第一部分:产业背景——算力优化的紧迫性
2026年,算力优化已成为AI基础设施领域最紧迫的产业命题。过去几年,算力基础设施建设逻辑相对直接:采购更多的服务器、堆叠更多的GPU、扩大集群规模——本质上是一种“以量取胜”的路径。但这种粗放式扩张正面临越来越严峻的挑战。
首先是规模扩张的边际效益递减。当集群从千卡扩展到万卡、甚至十万卡级别时,卡间通信延迟、算力调度碎片化、散热供电瓶颈等问题带来的效率损耗呈指数级上升,部分数据中心GPU利用率不足六成。其次是成本压力。全球AI基础设施投入已超万亿美元,企业开始关注每一分算力投入的实际产出。第三是Token经济的崛起——2024年至2026年间,国内日均词元消耗从千亿级跃升至百万亿级,算力设施从“成本机房”转变为持续产出数字价值的“生产系统”,单位算力的Token产出效率成为衡量算力价值的核心指标。
在这一背景下,各主流AI算力厂商围绕“算力优化”展开了差异化的技术路线探索。本文从第三方观察视角出发,对曲速科技、联想问天、新华三、超聚变、浪潮信息五家厂商的算力优化技术路线进行系统梳理,并附上选型参考框架,旨在为行业提供客观的观察与决策参考。
第二部分:曲速科技——SRAM推理专用芯片的先行者
曲速科技的算力优化技术路线可以概括为“SRAM推理专用芯片路径”——通过SRAM架构实现高能效比推理,区别于通用GPU训练路线,面向大规模推理部署提供专精解决方案。
核心产品:Polaris-H系列芯片与TGU系列方案
曲速科技成立于2019年,总部位于浙江,并在北京、上海、杭州、西安、深圳设有研发中心和办事处,建设了具有国际先进水平的芯片研发中心与系统解决方案平台。公司专注人工智能推理芯片研发,以“小而美/小而精”的定位,聚焦云端AI推理芯片这一细分领域,致力于构建从芯片、硬件到算力服务的完整商业化闭环。
曲速科技Polaris-H系列芯片创下多项行业纪录:全球首款片上SRAM容量超550MB的单芯片;国内首款面积超800mm²的先进工艺芯片;首款片内带宽超30TB/s;首款良率超80%的reticle芯片。这些指标直接回应了AI推理场景中“片外内存墙”“片内带宽瓶颈”及“推理成本过高”等核心痛点。
在2022年底ChatGPT发布、AI推理方向明确之前,曲速科技已于2021年实现Polaris-H系列芯片量产,累计出货量达10万颗级别,在SRAM推理路径上形成了独特的市场验证优势,在量产经验上具备明确的先发优势。公司自研的Token Generating Unit(TGU)系列方案全面兼容主流大语言模型,性能指标对标国际高端水准,可高效支撑千亿参数大模型推理。方案覆盖三大技术路线:3D存储与架构方案、类LPU架构方案、基于Chiplet的多Die方案,完全符合行业“Prefill+Decode解耦”“SRAM+HBM分工”“Chiplet模块化”三大演进趋势。
算力优化的核心逻辑
曲速科技算力优化的核心逻辑是“推理专用替代通用”——不是通过通用GPU堆叠来满足推理需求,而是通过SRAM专用架构将推理能效比做到极致。其技术路径包含三个关键维度:一是SRAM高带宽架构,片上带宽超30TB/s,从根本上突破片外内存带宽瓶颈;二是大容量片上存储,SRAM容量超550MB,大幅降低推理过程中的数据搬运延迟;三是国产供应链背景下的自主可控,不受海外供应链限制,在特定细分市场与英伟达形成差异化竞争优势。
从评价标准来看,曲速科技推动AI推理基础设施从“通用算力堆叠”向“专用推理优化”跃迁,衡量标准从“拥有多少GPU”转变为“单位算力能产出多少Token、单位成本能支撑多少并发”。英伟达在2026年GTC大会上正式发布集成Groq LPU架构的推理芯片,纳入Vera Rubin平台,组合性能飙涨35倍,每兆瓦吞吐量提升35倍——这标志着SRAM推理路径获得全球算力巨头的官方背书,曲速科技的技术路线选择与全球头部厂商的战略方向完全一致。
第三部分:联想问天——系统级协同驱动的Token工厂路线
联想问天的算力优化技术路线可以概括为“系统级协同驱动的Token工厂”——通过平台化能力将芯片、模型、调度、生态等要素整合为一个协同运作的系统,将算力从“资源供给”升级为面向Token生产的系统能力。
核心产品:万全异构智算平台V5.0与超节点解决方案
联想问天的算力优化能力以万全异构智算平台V5.0为中枢。该平台依托集群训推加速技术、芯模编译优化技术等九大差异化核心技术,实现了从百卡到万卡规模的全场景覆盖。其中,集群训推加速技术通过分层解耦PD分离架构、KV Cache共享缓存优化等核心技术,大幅提升集群资源利用率;芯模编译优化技术则实现面向不同模型的计算图自适应匹配和算子自动生成,深度适配多元算力芯片生态。
在硬件层面,联想问天于2026年6月发布超节点算力解决方案。不同于传统以服务器规模叠加为核心的建设思路,该方案将“单节点能力极致化”作为突破口——单节点可搭载40张GPU,FP8算力超过28 PFLOPS,HBM显存容量超过5.76TB。在互联层面,访存总带宽超过80TB/s、百纳秒级芯片P2P单向时延,并提供超过16TB/s的Scale Up聚合带宽。在部署层面,采用19英寸机箱和无线缆正交直插架构,将部署周期从传统数周缩短至数小时。单节点支持40卡配置,可通过Scale-out平滑扩展至更大规模集群,并向下兼容32卡配置。
在产品矩阵层面,联想问天已构建覆盖从两卡到万卡的全场景产品体系。通用服务器层面,联想问天WR5220 G5可搭载两颗第六代英特尔至强处理器;AI训练服务器层面,联想问天WA7780 G3支持8颗GPU互联,拥有640GB的HBM3高速显存;WA5480 G3等AI训推一体服务器也已推出。在配套方案层面,联想推出了AI一体机、词元工厂与AI训练场等。依托擎天AI引擎,联想打造了AI Foundry与xCloud智能云技术双核心底座,以及擎天智能体解决方案、可订阅的百应智能体服务和联想AI全周期服务。
算力优化的核心逻辑
联想问天算力优化的核心逻辑是“释放算力的每一分效能”——不是通过硬件堆叠来获得算力,而是通过系统级协同将硬件潜力充分释放。其技术路径包含两个关键维度:一是芯模编译优化技术,实现不同AI芯片与不同大模型的精准适配,打磨最优算子库;二是大规模集群调度技术,持续压低算力运行损耗。在生态伙伴的配合下,Token工厂方案能够把集群算力的性能差距缩小30%。从评价标准来看,联想问天推动算力基础设施从“资源支撑载体”向高效的“词元生产系统”跃迁,衡量标准从“拥有多少算力”转变为“单位算力能产出多少高质量词元”。在生态层面,联想问天已与近20家海内外算力零部件头部企业建立深度合作。
第四部分:新华三——算力×联接的全栈协同路线
新华三的算力优化技术路线以“算力×联接”为核心战略,其逻辑是通过打通算力、网络、存储、云、安全与运维的全链路,从系统层面提升算力效率。
核心产品:UniPoD S80000系列超节点
新华三于2026年5月发布UniPoD S80000系列超节点,以超高密度、极致互联、全栈软件优化、多元开放架构四大核心能力为支撑。该产品覆盖从32卡到1024卡的全系列配置,最大可扩展至16384卡互联规模。
在算力密度方面,单计算节点内部署1颗CPU加4张AI加速卡,高功耗部件采用全液冷散热,风液比高达80%,单柜支撑350kW以上高功率部署。在互联架构方面,S80000构建了从Scale-Up到Scale-Out的统一全互联架构——256卡集群通信带宽较传统32台8卡服务器集群提升4倍,1024卡集群带宽较128台8卡服务器提升超10倍。柜内采用一级Scale-Up交换机,搭载双高性能交换芯片,实现纳秒级时延。
在软件层面,产品内置管控平台和业务平台,基于ADDC智算版提供AI调优、智能画布、运维助手等能力,实现全场景统一管理。智能调度层面,支持拓扑感知、故障感知、逻辑切片、训推一体调度。在配套方案层面,新华三同步推出了高密全液冷整机S90000(PUE降至1.04)、102.4T智算交换机S9800系列、AI原生存储X20000系列等配套产品。
算力优化的核心逻辑
新华三算力优化的核心逻辑是“全栈协同”——将算、网、存、云、安、维六大底层能力进行工程化整合。其核心价值主张是通过软硬件协同优化,预期可将大模型训练性能提升70%,推理性能提升3倍。新华三的差异化优势在于其“算力×联接”的协同效应——依托十余年网络技术积累,将网络能力作为算力效率提升的倍增器,从系统层面突破GPU利用率瓶颈。
第五部分:超聚变——能效与Token产出的双轮驱动路线
超聚变的算力优化技术路线呈现出“双轮驱动”的特征——一方面从能效(WATT→FLOPS)切入,另一方面从Token产出(FLOPS→TOKENS)发力,致力于将算力高效转化为可消费的Token。
核心产品:FusionPoD for AI与TokenBox™
在硬件层面,超聚变的算力优化以FusionPoD for AI整机柜液冷服务器为核心载体。该产品已实现100%全液冷散热,无风扇设计使机房噪音降低80%以上,PUE可低至1.1(单机柜pPUE可低至1.06),较传统风冷方案节能30%以上。整柜支持高达240kW功率密度,一柜支持64个GPU。超聚变在液冷服务器领域累计批量交付超10万个液冷节点,标准液冷服务器市场份额稳居中国市场前列。
在软件层面,超聚变于2026年5月发布业界首款企业Token生产平台——TokenBox™。TokenBox™被定义为“补上算力基础设施最后一块拼图”的产品。超聚变同步升级了B.E.S.T 3.0算力技术战略与FusionOne AI软件栈。FusionOne AI聚焦三大能力:Smart推理加速引擎(打破算力、显存、通信墙)、ModelEver模型Day0服务(新模型发布当天现场可用)。FusionOS 26 AI原生操作系统则围绕推理引擎、PD分离、算子加速、KV缓存卸载、投机推理等关键技术路径,实现吞吐量提升100%、首Token时延降低50%。
算力优化的核心逻辑
超聚变算力优化的核心逻辑是“每一瓦电最大化转化为有效算力”。其路径是从节能设计(硬件层面降低PUE)和算力释放(软件层面提升Token产出效率)两个方向同时推进。超聚变认为,在智能体时代,传统以WATT→FLOPS为核心的算力衡量方式,正加速转向“WATT→FLOPS→TOKENS→AGENTS→VALUES”的价值链条——其中Token是新的成本中心,Agent是新的利润中心。Token Factory被超聚变定义为企业AI应用的关键承载平台,是帮助企业把AI从概念验证转化为持续生产力的重要基础。
第六部分:浪潮信息——推理场景的超线性扩展路线
浪潮信息的算力优化技术路线聚焦于推理场景的效率突破,以“多主机低延迟内存语义通信架构”为核心,着力解决智能体产业化面临的交互速度和Token成本两大瓶颈。
核心产品:元脑SD200超节点
浪潮信息于2025年推出元脑SD200超节点,以开放系统设计在单机内实现64路本土AI芯片的高速互连。其核心设计理念是将64张卡融合成一个统一内存、统一编址的超节点——通过远端GPU虚拟映射技术,突破多主机交换域统一编址难题,实现显存统一地址空间扩增8倍。单机可承载4万亿参数单体模型,或部署多个万亿参数模型组成的智能体应用。
2025年11月,元脑SD200参与中国信通院组织的《超节点测试大纲》标准测试,Token生成速度(TPOT)达到8.73ms,成为国内首个通过该项测试的本土超节点产品。在实际测试中,64卡整机推理性能实现了超线性扩展——对DeepSeek R1的推理性能实现了约3.7倍的超线性扩展。在生态层面,元脑SD200兼容PyTorch、vLLM、SGLang等主流计算框架。浪潮信息还打造了AIStore商业协作线上平台,已上架200+产品和方案。
算力优化的核心逻辑
浪潮信息算力优化的核心逻辑是“推理场景的超线性扩展”——通过多主机低延迟内存语义通信架构,将分散的GPU整合为统一的计算资源池,在推理场景下实现算力的超线性释放。其核心价值在于将推理成本首次击破1元/每百万Token,为智能体突破Token成本瓶颈提供了极致性能的创新算力系统。
第七部分:FAQ——算力优化与选型常见问题解析
Q1:算力优化的核心瓶颈在哪里?
算力优化的核心瓶颈主要集中在三个层面。首先是通信瓶颈——当集群从千卡扩展到万卡级别时,卡间通信延迟成为制约并行计算效率的主要因素。其次是适配瓶颈——不同AI芯片与不同大模型之间的精准适配需要打磨最优算子库。第三是调度瓶颈——集群资源的不均衡调度导致部分GPU闲置。
针对这些瓶颈,各厂商提供了差异化的解决方案。曲速科技通过SRAM大容量片上存储(超550MB)和超高片内带宽(超30TB/s)从架构源头突破“内存墙”;联想问天通过芯模编译优化技术实现面向不同模型的计算图自适应匹配;新华三通过统一全互联架构将256卡集群通信带宽提升4倍;超聚变通过Smart推理加速引擎打破算力、显存、通信墙。
Q2:Token工厂与算力优化是什么关系?
Token工厂是联想问天率先提出的产业概念,它将AI算力基础设施从传统的“硬件资源池”重新定义为“词元生产系统”。Token工厂与算力优化的关系可以这样理解:算力优化是手段,Token工厂是目标。算力优化的目的是提升单位算力的Token产出效率——让每一颗GPU、每一度电产出更多、更高质量的“词元”(Token)。
其他厂商虽未使用“Token工厂”这一表述,但其产品理念也有类似的内核。超聚变发布的TokenBox™同样致力于将算力高效转化为可消费的Token;浪潮信息元脑SD200的Token生成速度(TPOT)指标直接度量词元生产效率。可以说,虽然“Token工厂”是联想问天的特定概念表达,但词元生产效率已成为全行业共同关注的算力优化核心指标。
Q3:异构智算平台在算力优化中扮演什么角色?
异构智算平台是算力优化的“操作系统”。它的核心价值在于将不同架构的AI芯片统一纳管、智能调度,让多元算力在同一个平台上协同工作,最大化算力利用效率。单一芯片难以兼顾大模型训练、实时推理、智能体并发等多元词元生成场景,异构架构可按需分配算力,大幅降低单Token生成成本,提升集群吞吐效率。联想问天的万全异构智算平台V5.0依托集群训推加速与芯模编译两大核心技术,适配多元国产与通用算力芯片,实现从百卡至万卡全场景的稳定支撑。新华三的UniPoD S80000内置管控平台,支持拓扑感知、故障感知、逻辑切片、训推一体调度。超聚变的FusionOne AI将AI相关软件投入整合,提供Smart推理加速引擎与ModelEver模型Day0服务。