WAIC 2026现场,天数智芯发布天垓300,国产GPU开始比拼实际效率

WAIC 2026现场,天数智芯发布天垓300,国产GPU开始比拼实际效率

Amelia / 2026-07-20 18:10128554
标签:WAIC2026

今年逛WAIC,有一个变化挺明显。聊算力的人依然很多,但大家讨论的重点已经和前两年不太一样了。过去更多是在比芯片参数、比峰值算力,今年不少厂商都开始强调模型真正跑起来之后的效率,比如训练速度、推理响应、多卡通信,以及软件生态和整体部署成本。

天数智芯这次发布天垓300,关注点也放在了这里。相比单纯提升算力指标,它更强调Attention、MoE、Agent推理等真实应用场景的优化,希望把底层算力更高效地转化为实际业务能力。

wps_doc_0.jpg

天数智芯AI与加速计算负责人单天逸将AI的发展划分为三个阶段:处理和生成内容的“信息智能”、能够规划并执行任务的“行动智能”,以及面向科学发现和未知探索的“探索智能”。在他看来,不同阶段对应着不同的计算需求,这也成为天垓300此次产品设计的核心思路。

针对目前应用最广泛的大模型场景,天垓300重点优化了Attention和MoE两项核心计算负载。大模型参数越做越大,上下文窗口越拉越长,Attention运算已经成为整个训练和推理流程中最吃性能的环节。天数智芯公布的数据显示,天垓300在不同精度下的Attention计算效率都超过了90%;在64K长上下文的测试场景里,整体效能比Hopper架构的主流方案高出大约10%。

MoE(混合专家模型)同样是当前主流大模型的重要方向。为了减少专家调度和数据路由带来的性能损耗,天垓300针对算法和硬件进行了协同优化。官方数据显示,在DeepSeek V4 MoE场景下,产品计算效率超过了70%,推理阶段也能够在保持响应体验的同时支持更多并发请求。

除了训练,大模型推理也是此次升级的重点。尤其是Agent兴起之后,模型不仅需要理解用户需求,还要不断调用工具、规划流程并完成执行,这也对首字响应速度、多卡通信以及整体时延提出了更高要求。

针对这一变化,天垓300分别对Prefill和Decode两个阶段也进行了优化。按照官方公布的数据,在Qwen、GLM、Kimi、DeepSeek等主流模型测试中,产品首字延迟相比Hopper方案降低约20%;针对Decode阶段频繁的小数据通信,平均通信延迟降低约13%。这些优化最终对应的是智能编程、办公助手、企业自动化等Agent应用更快的响应体验。

除了生成式AI,天数智芯此次也把重点放到了未来可能快速增长的探索智能领域,包括世界模型、新材料研发、数字孪生、气象预测等科学计算场景。

wps_doc_1.jpg

不同于只针对Transformer进行优化的设计思路,天垓300采用SIMT通用计算架构,可支持标量、矢量和张量等多种计算类型,同时覆盖FP4、FP8等多种计算精度,并支持矩阵求解、动态规划、稀疏计算等不同计算任务。官方介绍,在Cosmos3世界模型测试中,天垓300推理效能同样较Hopper架构主流方案提升约10%。

据天数智芯介绍,公司自2018年以来一直在完善软件生态,目前已开发近百个加速库,并支持主流AI框架、模型及关键加速组件。天垓300也已经与国内云厂商、服务器厂商等展开适配,可支持从单机到万卡集群部署,进一步降低企业部署和迁移成本。天数智芯此次带来的天垓300,并没有只围绕某一项性能指标做优化,而是把重点放在大模型训练、Agent推理以及科学计算等不同应用场景。从现场介绍来看,这款产品希望覆盖的不只是当下的大模型应用,也希望为未来更多AI计算需求做好准备。

wps_doc_2.jpg

在热点科技看来,今年WAIC释放出一个比较明显的信号:国产GPU的竞争重点正在发生变化。过去行业更多讨论芯片参数和峰值性能,而随着大模型、Agent不断进入实际应用,企业开始更加关注训练效率、推理体验、软件生态以及整体部署成本。

声明类型:无需添加自主声明

发表评论注册|