腾讯称GPU够训练未来几代模型
17611538698
webmaster@21cto.com

腾讯称GPU够训练未来几代模型

腾讯高管称GPU够训练未来几代模型

5月14日,腾讯控股表示,AI能力已经对公司效果广告与长青游戏等业务产生了实质性的贡献。公司加大了对元宝应用与微信内的AI等新AI机遇的投入。公司预计,在AI战略投入阶段,现有高质量收入带来的经营杠杆,将有助于消化这些AI相关投入产生的额外成本,保持财务稳健。

腾讯高管还称,腾讯有足够的高端芯片来继续训练模型,对于未来几代模型而言是足够的。目前腾讯看到对GPU更大的需求是在推理侧,用户推理需求在逐渐增长,推理token(词元)的需求比之前预计的更多。如果做出更先进的模型,推理需求相比目前的需求还会更多,将消耗更多token。目前AI的需求非常高,需求已经超过GPU资源(能提供的算力)。

阿里通义 Qwen3 模型技术报告全公开

阿里通义千问正式公开了其 Qwen3 系列模型的技术报告。在技术报告中,用户可以深入了解到 Qwen3 模型架构、预训练及后训练过程、模型性能表现等诸多此前尚未公布的技术细节。

据介绍,Qwen3 的核心创新在于将两种模式整合至统一框架:思考模式 (用于复杂多步推理)和非思考模式 (基于上下文的快速响应)。这一设计无需切换模型(比如对话优化模型 GPT-4o 和专用推理模型 QwQ-32B),而是在同一个模型内根据用户查询或对话模板进行动态模式切换。同时,Qwen3 引入思考预算机制 ,允许用户在推理过程中自适应分配计算资源,从而根据任务复杂度平衡延迟与性能。

此外,通过利用旗舰模型的知识,Qwen3 团队显著降低了构建轻量级模型所需的计算资源,同时确保其性能具有高度竞争力。

图片


 编辑:行动中的大雄

评论