全文下载 1.3MB
RESEARCH REPORT

互联网/OTT行业AI算力
最新动态研究报告

2025下半年 - 2026年

面向对象:技术决策层、基础设施负责人、算力采购总监
制作时间:2026年7月

摘要

2025下半年至2026年,全球互联网/OTT行业AI算力基建已从"单一拼卡"的初级阶段,全面升级为"系统级集群能力"的终局博弈。行业算力消耗结构从"大模型高频训练"转向"万亿参数级MoE模型高并发推理",单芯片的峰值算力优势,被集群的互联带宽、全局通信效率、综合运维成本的优势所全面弱化。

国内互联网/OTT行业AI算力需求的增长,本质是"业务端AI化"与"算力端国产化"两大趋势的同频共振。作为行业发展的关键节点,2026年世界人工智能大会(WAIC 2026)清晰标注了行业算力基建的最新基准:头部厂商均推出"超节点化"算力系统。

ToC:核心业务全面AI化

60-70%

搜广推场景推理算力占行业总算力消耗

高并发、低时延

从"高峰值算力"转向"高并发、低时延、高稳定"的推理侧标准

业务场景迁移

从"增量式生成类短时爆发流量"转向"存量业务场景下的用户并发式流量"

ToB:算力规模效应外溢

成本中心 → 利润中心

算力资源从基建投入转化为云服务收入

使能型AI

将算力资源与模型能力、行业场景解决方案打包

规模效应

单位算力资源的综合成本、业务资源调度效率优势明显

模型层:MoE架构主流化

从"参数竞赛"到"成本效益竞赛"

模型的参数量级提升,对业务效果的边际贡献正在持续减弱,而对算力资源的消耗成本却在指数级上升。

MoE架构核心优势

"模型整体参数规模做大,单次推理实际激活参数规模做小",大幅降低单次推理的算力资源消耗。

DeepSeek V4-Pro

总参数:1.6T

专家数量:384个

激活比例:1.56%

Kimi K3

总参数:2.5T

专家数量:896个

激活比例:1.78%

成本断崖式下降

最高 99%

API调用价格降幅

推动AI在更多高并发业务场景下的渗透落地

框架层:去CUDA化

从行业性的技术共识,正式转为头部互联网/OTT厂商的实际落地技术路线。华为昇腾的CANN软件栈是这次行业级迁移的核心支撑基础。

vLLM-Ascend 适配
SGLang 国产适配
算子融合优化
性能追平CUDA

碎片化挑战

适配链路非标准化

不同厂商的适配技术方案存在明显差异,增加了应用侧的开发成本

算子适配不完善

部分高阶算子支持度存在短板,性能优化难度大

版本协同效率低

推理框架与芯片软件栈版本升级节奏不匹配,存在错配风险

硬件底座:超节点成为核心形态

架构范式转移

从"拼单卡峰值算力"到"拼超节点系统级有效Token吞吐"

互联能力优先

集群的整体互联带宽能力,对实际推理性能的影响权重已超过单芯片峰值算力

国产算力跨越

从"被动补充"到"主动选择",推理场景成为主赛道

华为昇腾 Atlas 950

单柜互联带宽:16.3PB/s

通信RTT:3μs

最大规模:8192卡

百度天池2.0

基本单元:32卡单机柜

卡间带宽提升:4倍

整体性能提升:50%

阿里磐久 AL128

基本单元:128卡

芯片:平头哥真武系列

特点:单位成本优化

AI加速芯片市场份额

2026年一季度数据 (IDC与中国半导体行业协会联合发布)

三层异构资源池

第一层:海外高端GPU资源池

支撑前沿训练、核心推理高优先级流量

主要芯片:H100、H200系列

第二层:国产超节点算力资源池

支撑大规模高并发推理、模型微调场景

主要芯片:昇腾、昆仑芯、平头哥

第三层:CPU、存储与低算力工具资源池

支撑Agent类业务、长上下文检索等辅助场景

主要芯片:高主频CPU

互联网/OTT头部大厂策略

双轨制:"海外高端GPU+国产超节点"

构建算力资源的供应商冗余度,最大化降低算力的综合成本

采购策略

双轨并行,分场景配额明确

部署策略

训推分离、流量分层,精准匹配算力资源

调度能力

自研异构算力调度层,支撑混合集群管理

国产芯片厂商策略

全栈协同,锚定互联网推理场景

从"单纯比拼芯片硬件性能",升级为"全栈能力协同"

华为昇腾

全栈封闭路线,构建超节点生态壁垒

百度昆仑芯

开放生态路线,锚定云厂商MaaS输出场景

阿里平头哥

自研自用+行业输出双线,支撑阿里生态内外场景

趋势展望:未来12-24个月

算力架构超节点化

超节点+池化异构调度成为行业标配,集群级工程能力成为比拼焦点

软件栈进一步解耦

统一调度层与异构算力池的技术接口标准化,行业适配成本持续降低

生态合作深化

互联网厂商与芯片厂商的合作模式,从"简单采购"升级为"联合研发"