老董的视界深处

· 国联民生证券 · 公司/行业基本面

计算机行业动态报告:昇腾、寒武纪、浪潮与超节点

摘要公开阅读;PDF 仅限有效会员阅读与下载,所有会员权限相同。 邮件登录

摘要

报告围绕 DeepSeek 与国产算力的“模算协同”、超节点技术路径、华为韬定律与昇腾路线图、寒武纪业绩与生态验证、内存墙技术底层及行业竞争格局展开。 DeepSeek V4 将细粒度专家并行(EP)方案同时在英伟达 GPU 与华为昇腾 NPU 上完成验证,通用推理任务实现 1.50~1.73 倍加速、延迟敏感场景最高加速 1.96 倍;昇腾 950 超节点在 8K 输入、TPOT 约 20ms 下实现单卡 Decode 吞吐 4700TPS,预计下半年批量上市后 DeepSeek V4-Pro 价格将大幅下调。 随着 MoE 模型迈向万亿参数,算力需求由单卡转向集群级系统能力,评价指标转向单位 Token 成本——英伟达 Blackwell(GB300 NVL72)运行 DeepSeek-R1 的每百万 Token 成本由 Hopper 的 4.2 美元降至 0.12 美元。 Atlas 950 超节点搭载 8192 颗 Ascend 950DT、FP8 算力 8EFLOPS、灵衢 2.0 总互联带宽 16.3PB/s,可组成 52 万卡级 SuperCluster;昇腾 950PR 单卡综合算力为英伟达 H20 的 2.87 倍,昇腾 960 有望 2027 年四季度上市,维持“一年一代、算力翻倍”节奏。 华为提出“以时间缩微替代几何缩微”的韬定律,过去六年设计并量产 381 款遵循该定律的芯片,目标 2031 年不依赖 EUV 达到 1.4 纳米制程等效晶体管密度。 寒武纪 2026 年上半年营收 59.96 亿元(+108.13%)、归母净利润 23.11 亿元(+122.61%)、连续第七个季度盈利,并于 9 月 8 日加入 PyTorch 基金会成为最高级别白金成员;IDC 数据显示 2025 年中国 AI 加速卡总出货约 400 万张,英伟达约 220 万张占 55%、本土厂商合计约 165 万张、份额超四成。 投资建议沿国产算力芯片、超节点及算力网算力服务、算力租赁三条主线布局,行业评级为推荐(维持)。

主要观点

  • DeepSeek V4 将细粒度专家并行(EP)方案同时在英伟达 GPU 与华为昇腾 NPU 上完成验证,通用推理任务实现 1.50~1.73 倍加速、延迟敏感场景最高加速 1.96 倍,V4-Pro 与国产算力深度适配有望成为实现全国产闭环的“模算协同”机遇。
  • 昇腾 950 超节点全面支持 DeepSeek V4:V4-Pro 在 8K 输入、TPOT 约 20ms 时单卡 Decode 吞吐 4700TPS,V4-Flash 在 8K 长序列、TPOT 约 10ms 时 1600TPS;低时延源于原生精度加速(内存占用降低 50%+、计算能力翻倍)、稀疏访存优化、Vector 与 Cube 共享 Memory 三大底层升级。
  • MoE 模型迈向万亿参数后单卡已难以承载完整训练推理,算力需求由单卡能力转向集群级系统能力,评价指标由峰值算力转向单位 Token 成本:英伟达官网数据显示基于 DeepSeek-R1,Blackwell 平台(GB300 NVL72)GPU 每小时成本约为 Hopper(HGX H200)的 2 倍,但每 GPU 每秒 Token 产出提升 65 倍,每百万 Token 成本由 4.2 美元降至 0.12 美元。
  • Atlas 950 AI 超节点面向万亿参数场景,搭载 8192 颗 Ascend 950DT、FP8 算力 8EFLOPS、FP4 16EFLOPS、总显存 1152TB、灵衢 2.0 总互联带宽 16.3PB/s,可组成 52 万卡级 SuperCluster(FP8 总算力 524EFLOPS);Atlas 960 搭载 15488 颗 Ascend 960、FP8 30EFLOPS,可组成百万卡级集群(FP8 2ZFLOPS)。
  • 华为提出韬定律(以时间缩微替代几何缩微),与摩尔定律、黄氏定律形成对照,过去六年设计并量产 381 款遵循该定律的芯片,路线图目标 2031 年在不依赖 EUV 光刻机条件下达到 1.4 纳米制程等效晶体管密度;首款 LogicFolding 麒麟芯片晶体管密度较上代提升 55%,搭载 9 月 23 日发布的 Mate 90 系列。
  • 昇腾产品路线图:950PR 已于 2026 年一季度上市(华为云宣布提前至 8 月上线),配套 Atlas 350 加速卡、单卡综合算力为英伟达 H20 的 2.87 倍、国内唯一支持 FP4 的推理产品;昇腾 960 有望 2027 年四季度上市、直接对标英伟达规划中的 NV576,昇腾 970 计划 2028 年四季度上市,维持“一年一代、算力翻倍”;IDC 报告显示 2025 年昇腾出货 81.2 万张、占国产 AI 算力芯片的 49%。
  • 智谱 GLM-5.3-Flash 公开服务全部由国产算力支撑,端到端服务性能较同一硬件基线提升 3 倍、硬件效率与单 token 成本达到与主流英伟达 GPU 相当的水平;其激活参数量由 32B 压缩至 18B、层数由 92 层减至 45 层,采用线性注意力与稀疏注意力混合架构并引入 IndexPool 索引器,DeepSeek-V4 则结合 DSA 稀疏注意力实现 1M 上下文全系标配。
  • 寒武纪 2026 年上半年营收 59.96 亿元(+108.13%)、归母净利润 23.11 亿元(+122.61%)、扣非归母净利润 21.66 亿元(+137.30%),连续第七个季度盈利,Q2 单季归母净利润约 12.98 亿元(环比 Q1 的 10.13 亿元增约 28%);存货 82.48 亿元、预付款项约 29.14 亿元(同比增约 291%),反映 Fabless 模式下为下游需求做供应链准备、景气度有望延续。
  • 寒武纪 2026 年 9 月 8 日加入 PyTorch 基金会并成为最高级别白金成员、在理事会拥有一个席位,凭“Upstream First”原则多年主干贡献由适配方升级为共建方,已完成 DeepSeek-V4、GLM-5 等主流开源大模型 Day 0 适配;作为不开展云业务的独立芯片厂商,具备拓展云厂商客户的基础,软件生态完善有望支撑客户拓展与产品放量。
  • 内存墙成为制约大模型训练与推理效率的核心瓶颈:过去 20 年服务器峰值算力提升约 60000 倍而 DRAM 带宽仅提升约 100 倍、互联带宽仅提升约 30 倍;英伟达走片上大容量 SRAM 近存计算路线(2025 年 12 月以 200 亿美元收购 Groq,2026 年 3 月随 Vera Rubin 平台发布的 Groq 3 LPX 裸片集成 500MB SRAM、单机架 256 颗每秒处理 3400 个 token),华为走 RRAM 存内计算路线(联合清华、字节发布 HYDAR,运算效率较传统架构提升 66 倍),智谱收购中科加禾完善跨国产芯片编译工具链。
  • 竞争格局呈三个生态位:华为以芯片、互联、超节点、软件栈与集群的全栈体系参与竞争(约束为 HBM 产能供应),寒武纪占据独立第三方位置(约束为客户集中度与实体清单),DeepSeek 以模型定义精度格式与架构需求;IDC 数据显示 2025 年中国 AI 加速卡总出货约 400 万张,英伟达约 220 万张占 55%、本土厂商合计约 165 万张、份额超四成;中报集体验证景气:海光信息营收 90.99 亿元(+67%)、归母净利润 17.98 亿元(+50%),浪潮信息归母净利润 29.52 亿元(+269.59%),腾讯 2026H1 资本开支 847.20 亿元(+82%)、阿里巴巴 FY2027Q1 资本开支 676.78 亿元(+75%)。

论述逻辑

  • DeepSeek V4 将 EP 方案在英伟达 GPU 与昇腾 NPU 上双完成验证并实现 1.50~1.73 倍加速 → 受限于高端算力 V4-Pro 吞吐有限,昇腾 950 超节点下半年批量上市后 Pro 价格有望大幅下调,模算协同成为全国产闭环机遇 → MoE 模型迈向万亿参数后单卡难以承载,瓶颈由峰值算力转向高速互联、显存管理、通信优化与分布式调度 → 超节点以统一内存编址将数百至数千颗芯片组成单系统,算力评价指标转向单位 Token 成本与实际利用效率 → 华为以韬定律与昇腾 950/960/970 一年一代、算力翻倍的路线图推进“时间缩微”,CANN 推出 PyPTO 编程范式实现算子开发周期缩短至天级与跨代兼容 → 寒武纪中报高增并加入 PyTorch 基金会白金成员,业绩与生态双重验证 → 海光 CPU+DCU 双芯协同、FlagOS 异构软件栈、中科加禾编译工具链使国产算力竞争由芯片性能延伸至系统软件与整体 Token 生产效率 → 叠加腾讯、阿里资本开支高增与英伟达/华为超节点代际趋同的证据,报告得出关注国产算力芯片、超节点及算力网算力服务、算力租赁三条主线的投资建议。

关键展望

  • DeepSeek 官方公众号预计下半年昇腾 950 超节点批量上市后 V4-Pro 价格将大幅下调;V4-Pro 已自 8 月 17 日起执行峰谷定价。
  • 昇腾 960 有望 2027 年四季度上市,配套 Atlas 960 SuperPoD 支持 15488 卡、FP8 算力 30 EFLOPS,直接对标英伟达规划中的 NV576;昇腾 970 计划 2028 年四季度上市,维持“一年一代、算力翻倍”节奏。
  • 华为路线图目标 2031 年在不依赖 EUV 光刻机条件下达到 1.4 纳米制程等效晶体管密度;麒麟 CPU 性能核心频率规划从 2026 年 3.1GHz 提升至 2029 年 4GHz 以上;2030 年前后昇腾 990 将把逻辑折叠引入 AI 加速器;首款 LogicFolding 麒麟芯片搭载 9 月 23 日发布的 Mate 90 系列。
  • 报告提示功耗风险:何庭波论文称 τ 是时间定律而非焦耳定律,性能提升伴随功耗同比例上升,未来超节点“可能超出电网容量”。
  • 风险提示:行业需求释放节奏存在不确定性;行业竞争可能加剧;技术迭代与生态适配存在不确定性。

推荐标的

  • 行业评级为推荐(维持评级);报告未给出个股评级与目标价,建议按三条主线重点关注。
  • 国产算力芯片方向:寒武纪、海光信息、云天励飞等。
  • 超节点及算力网等算力服务提供商方向:浪潮信息、软通动力、紫光股份、中国长城、联想集团、神州数码、思特奇等。
  • 算力租赁方向:宏景科技、集智股份(ARM Token 工厂)、协创数据、利通电子、行云科技、智微智能、阿里巴巴、优刻得、金山云等标的。

关键图表

图1. 昇腾 950 代际底层架构的三大升级

**图1. 昇腾 950 代际底层架构的三大升级**

图2. 表 3: 华为昇腾/鲲鹏超节点梳理

**图2. 表 3: 华为昇腾/鲲鹏超节点梳理**

图3. 国产 AI 芯片旗舰规格对比

**图3. 国产 AI 芯片旗舰规格对比**

图4. 寒武纪基础软件平台 Cambricon NeuWare

**图4. 寒武纪基础软件平台 Cambricon NeuWare**

图5. 华为达芬奇架构的构建块及其计算强度

**图5. 华为达芬奇架构的构建块及其计算强度**

图6. 中科加禾大模型推理优化工具示意图

**图6. 中科加禾大模型推理优化工具示意图**

图7. 表 5: 部分国产算力公司 2026 年中报业绩梳理

**图7. 表 5: 部分国产算力公司 2026 年中报业绩梳理**

图8. FlagOS 在 AI 生态系统中的位置及其组成模块

**图8. FlagOS 在 AI 生态系统中的位置及其组成模块**

查找相关研报 →