这份白皮书面向 AI 大模型、智能体时代,重新定义 AI DC(人工智能数据中心),区别于传统 IDC,AI DC 以大算力集群为核心,适配大模型训练、超大规模推理、智能体持续任务运行,是支撑智能经济、智能体产业的关键基础设施。
报告分析当前 AI 数据中心建设面临的现实矛盾:算力规模持续暴涨,带来供电、散热、机房空间、网络互联、运维管理多重压力;AI 业务具备突发性、潮汐特征,训练任务高算力长周期,推理任务流量波动大,传统数据中心的设计规范无法匹配 AI 业务特性。
白皮书梳理 AI DC 整体技术架构,包含算力层、存储层、高速互联网络层、供配电与散热基础设施、平台调度运维层。算力层面,不再单纯追求单卡性能,更加看重集群整体有效算力,芯片异构混合部署成为现实选择,同时强调算力的有效利用率,避免硬件资源闲置浪费。存储体系发生变化,除传统冷热存储外,新增面向大模型的高速缓存、KV 存储,适配智能体记忆、上下文大 Token 访问需求。
高速互联是 AI DC 成败的关键,报告分析集群内、跨集群两级网络需求,超节点架构降低通信损耗,LPO/NPO/CPO 等光互联技术逐步规模化应用,同时也要处理多机通信拥塞、故障扩散问题。
基础设施部分重点讨论供电与散热。AI 算力功耗密度大幅提升,传统机房供电架构不再适用,高压直流供电、不间断供电架构优化成为趋势;散热从风冷走向冷板液冷、浸没液冷多条技术路线并行,不同路线对应不同建设成本、运维难度,需要结合当地气候条件、PUE 目标综合选型,不能简单盲目追求单一技术路线。
调度运维平台层面,AI DC 需要面向训练、推理、智能体长任务做差异化调度,实现算力‑存储‑网络资源协同编排;强化故障预测、集群容错能力,解决大规模集群下单点故障引发连锁失效问题;同时完成能耗、算力利用率、任务 SLA 可观测,支撑多租户混合业务运行。
报告总结 AI DC 建设几大典型误区:只看芯片算力指标忽略集群互联能力;重硬件采购,轻视调度软件与运维体系;液冷方案盲目跟风,不评估本地运维条件;忽视算力供需错配,造成大量硬件闲置。
最后给出建设落地指引,要结合业务类型(训练 / 推理 / 智能体任务)做顶层规划,平衡性能、成本、能耗、运维复杂度;优先提升集群有效算力利用率;推进算力、存储、网络协同设计;完善全生命周期运维体系;同时重视绿色低碳,推动绿电消纳,控制算力的综合碳足迹。
点击文后阅读原文,可获得下载资料的方法。
欢迎加入智能交通技术群!扫码进入。
点击文后阅读原文,可获得下载资料的方法。
联系方式:微信号18515441838
OCR:IMG:I目录CONTENTS 01 02 03 04 AIDC创新与发展 AIDC规划与建设 AIDC运营、运维与安全 AIDC成功实践 1.1AIDC发展的五大超势 09 2.1Agent-Centric应用与生态 15 3.1AIDC智能生产运营 59 4.1华为云英湖3D数据中心创新实线 Agent成为AIDC负数的最大安量 09 围“AKDM”考框菜进行规划 15 从算力资源运营到A生产运营 59 模型向通用智加速演进 10 沿着四个阶级推进企业Agen落地 20 A生产运营五大核心力 62 4.2中国建设银行A数据中心建设与运 推理场ScaingLaws涌现 10 Agen动Alinra边界重构 21 案例实践:银行AIDC价值运营升级 64 转型实践 87 超节点时代已到来 1 2.2Token-CentricAlInfra 22 A生产运营演进路线 66 速供给或为AIDC成地约束 10 4.3复旦大学谢属中山医院AIDC医疗行业实践 从Cioud infra到AlInfr的变化 22 3.2AIDC自治运维保障 67 1.2Agentc时代AIDC新范式 11 Token生产效率否维评估要素 23 从设备运维到暂能生产运维保障 67 传统规划方法面临失效 = Token生成效率的关键约束与核心技术 25 Agenic自治运维六大心能力 68 以3T+3P为核心的ADC新式 12 Token-CenicA Infra日标考构 30 Agnic自池运维考装构 72 四大能力重塑Token-CentricAlIna 32 案例实线:Agnic维智能定界与快速恢复 74 企业AlInra规划建设重点方向 49 Agntc自治维演进路径 75 2.3Watt-CentricAI Facllity 51 3.3AIDC安全防线构筑 76 AlFacliy的系性抗战 51 AIDC“内忧外患”安全困境 76 AlFacity规建设建议 53 AIDC安全防护核心指施 77 AlFacity新建与存量场居地 56 LA防A的安全参考构 81 AOC白书2026 一但给C理中心的
OCR:IMG:可以看到,Scale-Out网络承的通信对象正在从 态优化通信路径:请网协网塞控制则通过网卡与 4、A存情:其力集群的长期记忆 传统的数据交换,扩展到模型状态、计算激活和上 交换设备协网,实现更低排队,更低尾迟的传 Agent时代,KVCache正在成为影明推理成本 Coding为例,任务持续数小时基至数天,上下文达 下文记忆,或为支A维理集群规模化运行的关键 输,核心价值:提升网络带宽利用率,保障Token 和性能的关键手级,典型Agent任务包含多轮工具 64K、128K甚至百万Token级别,单任务产生的 基础设施。 生产的稳定效率。 调用和上下文交互,后续请求通常复用大量已有上 KVCache可能达到数百GB基至TB级别.如何长 下文,仅追加少量新内容,这种“只增不改”的交 期保存、共享和度KVCache,正成为AlInfra Scale-Out网络的关键技术趋势 互联演进:从单数驱中心走向跨算力域 互式,便KVCache具备根高复用价值,以Al 必领解决的新问题。 题着A1集群从干卡走向万卡、十万卡规模, 图向大模型训练和互联网海星雅理等场景,A集群 Scale-Out网络正在围规模展、效率提升和 会进一步扩大,网络互联将可能突敬传统数据中心 域互联持续演进。 边界, KVCache给AI基础设施带来的关键挑战 构流进:从多级Clos走向多平图与向平化组网 一方面,传统电交换网络在万卡、十万卡规模下 关健热战 美要说明 传统多级Clos网络题着规模扩大,会带来更多网结 动耗和扩展压力,光路交换(OCS)开始 层级、更高互联成本和更大通信时起。多平图组网 入超大规模A网络,OCS通过在光域建立高速查 片上内存存不下 超长上下文(64K-1Mtokens)导数单任务KV 将一张大规模多级Clos网拆分为多个被此立的低 连,减少传统交换级,降低大规模互联的功耗 Cache高达数百GB基至TB级别,超出片上内存容量 星子网,算力卡接口拆分后分别接入各平面,等 和时起,但由于其连接模式更适合稳定、大规模流 效于把端口资源最大化地让给算力,同等端口开销 量,动态突发流量仍需要电交换承担灵活调度,两 下.可组网规模提升一个数量级,核心价值:突说 者在来来长期协网存在。 2 传统分级存储V时超高 数从NPU到SSD需经过DDR、PC交换等多级中 集群规模边界,让网络跟算力持续扩展。 转,显著增加访问起迟,难以通足推理的实创性要求 另一方图,受限于电力、土地和散热源,算力正 通信优化:从静态转发连向图能调度 在央敬单一数据中心边界,Scale-Across(四 KVCache的读写会产重加别SSD的写磨损 A通信具有大带宽、高井发、流量模式复杂等特 区、跨数据中心算力互联)成为新的发展方向,未 SSD写寿会短 每日全盘擦写次数(DWPD)可达10次以上,显著降 点,传统哈考负载均衡容是产生路不均和通信账 来,头都企业将探索跨地域算力协同,更多企业则 低SSD快用寿 ,网络级负载均衡通过感知全网流量状态,动 可通过满四区推理多活和容火提升A服务可靠性。 网城DC' DC 超节点 超节点 节点 0-10-1 ScalaOu Scale Across 网城,十KCM以内 图2-21数中心力联 ADC日书2026
OCR:IMG:才能回答三个关键问题:一次任务为什么成功或失数,或本主要花在哪个环节,是否需要优化模型 长期看,企业AgenticAl建设是一套持续运转的 被更多场景禁用,进一步扩大业务价值,企业可以 由、上下文组织或工具调用策略。 飞轮:Agent进入业务创造可量化价值,执行过程 通过任务光成率、能力复用率、新场景上线周期和 沉淀数据、语义、如职、扶能和经验,沉淀的能力 单位任务成本衡量飞轮运转效率, 用户入口 APP盛用 型网关 运营指标 Agent驱动AlInfra边界重构 实1 ? KRN TTFT TPOT 为了支撑企业A应用基地,Alina的边界也在发生 模型运行与服务,提供可组合、可治理的推理 统一接入|计量计费|结路由 求款 变化,需要扩展形成三类平台服务力: 能力 模型运行与服务提供统一、可编排的硬型生产服 推理服务 数据存储 欢源证 Agent运行环填,承载长周期任务与多Agent APIKey 务与高性能Token推理服务,支持按启用PD分 协同 KVCa 离、要向MoE模型的大规模专家并行与多级KV Agent运行环调案支撑数小时至数天的长程任务 Cache等能力. 执行,通过持久化状态与Checkpoint保障任务连 .. 续性 数据基础服务,统一支撑知识、数据、长期记 智算 通算 网络 存储 亿与训练评测数据集 图2-4:“企私有化Tokn程务考架构和开软件选型建议 多Agont并行要求平台提供按需启动、弹性扩 数据基础报务承担“沉淀企业智能资产'与”为模型 的安全沙箱,轻量容器沙箱冷启动P95(95th 训练供数”两奥职责。一方面通过向量库、图关系 最,型服务的工程部署应形成完整闭环: 指标:评测体系根据成功率、或本、时鼠与业务结 Percentile,第95百分位账退)控制在毫秒级, 辉与长期记忆服务,支撑企业“知识”构建,另 Agent请求统一进入型网关,由网关完或权、 果,反向优化模型选择与路由策路, 一方面通过多模态数据湖仓,实现训练数据集管 路由、计量与治理:观测系统记录模型级与任务级 网时需建立任务级可观测体系,重点监测并发 理、数据清洗标注、血缘追踪等能力,为模型训 Session数、任务或功率、数据访间、工具调用 练、评提供可道用、可复现的数据, 沿着四个阶段推进企业Agent落地 等,形成完整任务Trace,为问整定位与安全审计 提供输入 总体上,AlInfra离演为同时具备三类平台能力与 建设以Agent为中心的全业A应用与生态,应遵福 证、可图放、可审计,确认Agent的质量、成本、 异构资源对等互联架构的新型基础没施。 “价值素引、平台支撑、资产沉淀、持续营”的 限、安全、任务核和业务连续性是否达到性产要求。 原则,按细个阶设步推进: 阶段三:能力复用 阶段一:场最准备 持续沉淀执行路径、异常模式、最佳实践、岗位接 确认业务价值以及数据、语义、知识、工具和规 能、业务现则和通义资产,使知识、工具和技能能 到是具备条件,并建立任务成功事、人工接管 够跨Agent、跨部门、跨场复用 率、结果采纳率和单住务成本等业务目标。 阶段四:规模运营 阶段二:生产验证 形成统一的应用雄合、平台能力、智资产和组 建设统一平台和标准化接口,使关键行动可验 机制,推动Agent建设由分散项目走向企业级生态。 ADC白度书2026 一给C1建设数中心的[21
OCR:IMG:Knowledge:让Agent遵企业逻辑规划执行任务 Data:为Agent构建可溯源、可校验的事实数据 企业如识(Knowedge)是企业共享、长期积累并 企业本体资产的构建、运营与治理,可依托Agent Data是Agent理解环编、判断状态和执行任务 稳定、可信的数扭供给。 经过治理的认知资产,通盖制度文档,业务规 平台实现,由本体建模Agent、业务专家、应用验 的事实基起,Agentic时代下,数据湖、数据仓 范、行业本体、知识图语、流程经验与可执行业务 证Agent三美角色协同推动本体模型从设计到应用 库、B1、主数据和数据治理平台仍会续存在,数 Data与Knowledge在统一的数据底座上形或势 规则等,让Agen具正理解本行业、本组织和本流程, 的高质量落地。 建设的主要变化是从“人消费数据”转向“模型消费 同,Data是多模态数据湖中的原始事实, 数据”,这一转变也重构了企业数据流座的设计退错。 Knowledge是构建于其上的语义居-—从网一份数 企业知识的建设面路一个根本性予盾:知识分散在 本体建模Agent:将领域知识转化为 据中,通过本体建模和知识抽取提练出实体、关系 文格、消程、系统和人脑中,而Agent需要的是结 特合语义规范的本体模型,提供自动 企业数据底座需要从以结构化数据为主的数据湖 和规则,数据提供“有什么数据”,知识潮提供“数 构化、可推理的认知提产,解决这一子后,需要构 化建模与一致性校验能力: 仓.滨进为面向A的多模态数据(Mulimodal 据是什么意思',Agent在推理时,通过数据资产目 建知R湖(KnowledgeLake)-—在统-的数据 DataLake).结构化数据提供精确事实,如订单 录发现“可以消费什么数据集”,通过如识目录理解 底座之上,通过语义化加工将企业隐性经验转化为 业务专家:从业务通义与领域规则角 金额、落存数量、客户等级:非结构化文档提供业 “这些数据对应什么业务含义',通过元数据目录验证 Agent可消要的结构化知识资产。如识湖的建设准 度参与建模,审并优化本体模型的 务语境,如合网条款、尽调报告、合规文件:图 “数在哪里、是否可信”,这三个目录共同 “采集一取一建模一服务“的进进路径。 概念定文与关系语义,确保准确反映 像、语音、视频与日志提供现场过程与行为证据: Agen推理精准度。 真实业务证错: AgentTrace与用户反该则提供持续优化所需的 采集届对接企业多源知识载体,包括制度文 运行数据,多模态数据湖的核心,是实现不同形态 因此,企业数据建设应通“数据入湖一语义标 档、操作手、FAQ、历史工单等非结构化 应用验证Agent:向具体场景进行 数据的统一治理与统一搜权,为加识与Agent提供 注一知识构建一Agent消费”的道进路径, 数据,以及业务系统中的结构化规则。 语义推理验证与应地则试,评信本体模 型在暂都应用中的可用性与有效性。 Model:面向任务提供灵活组合的模型服务 抽取屠利用大模型从非结构化文档中自动视取 Agent时代,业A硬型建设的重点正从“选择一 任务复杂度、时题、成本、安全等级与模型可用 实体、关系与业务规到,经过人工审核校后 三类角色通过平台协网机制,形成知识建模、业务 个账强模型”转向“运营一组适配不同任务的模型服 性动态选择模型:高可用保障,具备限流、 形成高质量的“事实一事理“三元烟。 校验与应用验证的闭环,持续提升本体资产质量。 务”。通用模型、领域模型、小模型、多模态模型 新、重试、Falback、灰度发布与快速回溶能力。 与推理模型各有配场景,企业通过模型细合在能 力、成本、时冠与安全之间取得平衡,实现这一转 现到体系:是模生服务工程化的关键,包括模型级 变,需要两个关键工程组件:模型网关与现测体系, 观到与Agent请求级测两个维度, 建模以本体(Ontology)为语义骨果, 服务通过语义映射、规划引和标准API 文企业核心概念体系与约来规则。没有本体, 向Agent提供查询、校验与推理服务,使 模型网关:硬型网关是Agent访问视型服务的统一 ·模型级观测:焦模型服务的效能、或本与可用 知识图就是一盘教沙:“供应商“和”供货商 Agent能等沿着'实体一关系一约束*的路径 形成可解释的判断, 入口,所有Agen闵模型的调用,都应通过型网关 性,心尿集调用量、Token吞吐、应冠迟、错 会被当作不同板念,“张三和ZhangSan 入度型池,避免各业务系统直接定单一模型API。 误事、单Token城本及租户用量等关指标,覆 会被作为两个实体导入,本体将RDF、OWL 等标准定义的概念和关系账入Agnt感知、推 限流、降级等异常事件统计。 理、决的全生命用期,从根本上解决“数据 模型网关遇型应重点关注四类能力:统一接入,支 持私有化开源模型与公有云模型的统一纳管:精 什么章思”的问。 ·Agent请求级观:图向任务全链路可现测,记 细计量,支持按Agent、任务、部门、模型与租 录路标识、硬型与工具调用路径、Token消 户进行Token计量与成本归集:策路路由,按 耗、任务状态及业务结果,盖人工接管等异常场量。 AOC白书2026 一I设中心的[
OCR:IMG:超节点通过高速总线级互联,将数十到数干额AI芯 2、基于超节点的推理架构创新,实现高效Token EP卡数越多,Decode计算耗时越小:EP卡数越 但是倡助于超节点的大带宽,整个系统仍处于最优 片在物理上集成于整机柜乃至跨机柜,在逻上腔 生产 多,多卡之间AlI-to-All(A2A)通信排战越大, 状态。 合为“一台计算机”。同一超节点域A芯片互联症 超节点带来的统一计算域,为大模型推理架构提供 不少于32题,且应具有高带宽(大于400GB/s)、 了新的优化空间。 40.00 40% 低时延(小于500ns)和统一内存编址等特点。 传统服务器集群相比,超节点最大的变化在于: 大规模专家并行(大EP):放MoE模型吞吐湖力 耗时(ms) 30.00 30% 通信耗时 20.00 20% 节 MoE模型通过多个专家提升模型容量,但传统集群 KV时 统一内存编址:让分布式资源成为共享内存池 受限于通信效率,专家规模扩展困难,超节点提供 10.00 10% 演 权耗时 传统A集群中,每张A卡拥有验立片上内存,模型 的大规模内存池和高速互联,使更大规模专家并行 通信占比 成为可能。 0.00 和数据需要在不网没备之间不断搬运,超节点通过 16 32 64 288 0% 内存油化技术,将分布式内存烫源抽象为统一地址 EP卡数(以DeepSeek288专家切分为例) 空间,使不同A芯片能够言接访问远端内存资源。 以DeepSeek大EP方案为例,大EP架构可以实现 这章味着: 一卡一专家,EP卡数从16卡增加到288卡 图2-15DeepSeekV3大EP通耗时和通售占比 (包含共享专家),单卡权重占用从42GB降低至 P-D-C全对等架构:KVCache全网化消除重复 要重复Prefil计算, ·模型参数可以聘芯片统一管理: 2.33GB,可以保持更多的KVCache(实现 计算,大幅降低TTFT 基于超节点统一内存编址,推理架构正在向 -KVCache可以跨实例共享: BatchSize从B增长到30),扩大超节点内存池。 在多轮对话和Agent任务中,大里请求会复用已有 P-D-C全对等方向演进:Pre负责上下文计算、 ·大规模模型无需受单卡片上内存限制。 上下文。传统推理架构中,KVCache与单个实例 Decode负责Token生成、Cache负更状态共享。 定,不同实例之间KV无法共享,同一历史上下文 计算资源从“多个现立没备”转变为“共享内存的 60 40 大型计算机” Global Schedler 一 一 一 高带宽任时超互联:降任通信对计算效率的影端 PrefillCkster Decode Cluster 大模型尤其是MoE硬型,本质上是通信密集型计算, Inter-instanoe Router 11! inter-instance Router 1 Cortast Caching Caching 超节点通过高通互联和内存语义访问,将传统网络 PrefilInstance Decoding Instance 通信转化为更接近本地访问的数据交换方式,大幅 Intra-instance Router Intra-instance Rouer 降低通信开销。 32 54 288 Atin: Hybrid Paraleism Ain: 1 DP320 单卡权量 卡 Ckve Model 其价值不仅是提升峰值算力,更重要的是:让更多 (52专分为) MoE: EP32 MoE: EP320 计算费源真正参与Token生产,而不是等待数据传 (16NPUs per Instanoe) ,这些创新直接转化为业务收益一一在 图2-14 DeepSeekV3大EP RDMAPlane DeepSeek、Qwen等MoE模型推理中,端到性 UBPlane 能获得3倍以上提升,有力验证了超节点架构对 Token产出效率的实际增益, 图2-16基于异超节点+DeepSeek的P-D-C全对等构 ADC白书2026 公众号·智能交通枝术
OCR:IMG:未来拍理引原竞争的核心,是单位算力能够产生多 长期记忆(AgentMemory):让A具最持续认知 和业务操作,因此,A基设施要进一步支持智 少有效Token. 载、资原成本和业务优先级,实现请求路由、 能力 前任务的长期运行和规模化协作 灰度发布、流培断和放障动换,提英硬型级 面向Agent长期运行场景,管理持任务、跨会话积 训练引擎负责候型能力持续演进,是企业构建自身 务定性, 累的业务经验和上下文结息,使A从一次性交工 Agent运行环填主要承担三类能力: A能力的重要基础。 其演进为持续参与业务流程的智能主体。 模型生命用期管理,统一管理换型上线、版本 安全执行环镇:保障Agen可靠运行 代表技术包括Megatron-LM、DeepSpeed、 开级、效果评测和运行状态,使模型从一次部 数据集:形成A力优化用环。 Agent涉及工具调用、代码执行和外部系统访 PyTorchFSDP以及并生态中的MindSpeed 署进入持续运营阶段。 沉淀业务交互数据、推理日志和人工反慎,形成高 ,期要送行在安全环填中,平台要提供面 等,练引掌的核心价值,是将大规模候型训练任 质量训练数据资产,推动“使用一反馈一优化”的 向Ag和任务粒度的资、权限控行为 务高效映射别A集群,重点解决:大模型分布式训 Token计量与或本运,以Token作为统一计 数据飞轮 审计能力,确保任务纳行过程可控、可追。 练效率、多卡多节点协网、内存占用和通信开销优 量单位,对模型调用规模、源消耗和业务价 化等, 值进行分析,实现A资源投入的精细化运营。 前三类能力解决Token生成过程中的知识供给,让 身份与权限治理:警理数字工作负 A输出更加贴合企业业务:训练数据集则通过业务 随着Agent成为新的数字执行主体,每个Agent 未来训练引章主要呈现两个始:一昆从一次性训 未来,模型服务平台将成为企业A力管理和运常 反馈持续优化模型能力,形成企业A1持续进化闭 都需要备立身份,并退最小权限原则。企 的核心入口 练走向持续优化,模型能力提升越来越依验SFT、 环 业要将传统身份认证和访同控制体系扩展到 RLHF、Agent强化学习等后训练流程,练引 主体,实Agen的安全治理。 2、数据基础服务:让Token承载企业知识 正在从“大模型训练工具”演进为“模型持续进化 基础模型正在成为企业可获取的通用智能能力,而 3、Agent运行环境:让Token驱动业务行动 平台”,二是训推边界逐新能合。强化学习等新型 传统应用遵据“用户请求一系统响应‘的模式,而 多智体编排与生全用期管理:支撑规损化作 企业长期竞争优助将更多来自私有数据、业务如识 训练流程高要大量模型生成数据,推理引摩开始参 Agent通过自主规划、工网调用持续执行完成复 当Agent从单体应用走向多暂能体协作,基础设 与Rollout过程,练和推理正在从两官技立软件栈 以及持续反馈形成的数据闭环,数驱基础服务连接 杂任务。 施要提供任务排、状态管理、资源商和成 通用模型与企业业务,为Token生产提供持续的知 走向统一候型运行平台。 本控制能力,使多个Agen规够像企业团队一样 识供给,主要包括四类能力: 在Agent架构下,智算负责推理和决策,A数据服 协成复杂任务。 知识向量库:让模型理解企业知识, 模型服务:让模型力成为企业银AI服务 将规章制度、产品文档、专家经验等非结构化扣识 务提供上下文与长期记忆,通算环填承载工具执行 着企业进入多模型时代,硬型环境快进复杂化: 向量化,支挥RAG,使通用模型具备企业专业规力。 团源大模型、开源候型、企业私有模型以及行业专 企业AlInfra规划建设重点方向 用模型将长期并存,如果业务系统直接对不网模 图数据库:让模型理业务关系 企业建设AInfa,不能只关注当前算力需求,而需 企业需要支撑未大规模模型训练、MoE推理和 型,会带来大量适配成本,也班以实现统一治理。 企业知识不仅存在于文格中,还包含大里实体关系 要面向模型持续演进和智能应用规模化落地,从资 Agent集群,也离要润足部门应用、小模型推理等 因此,模型服务平台成为企业A能力的统一入口。 和业务规则,酒过知识图进和本体等方式,将企业 弹性、Token高效生产和生产级韧性三个方向进 多样化南求,因此,AInra需要具备向变化的资 其主要承担四类能力: 对象、关系和业务语义结构化表达,并通过图数据 行整体设计。 弹性: 型统一管理与服务化,面向企业多模型运行 库进行存储与计算,为模型和Agent提供可理的 业务知识 1.资源理性:让算力投资持续配未来变化 向上旷展:通过超节点和集群能力,支撑更大 场景,统一管理模型部着、发布、调用和运行 向量检索解决“我到相关信息”,知识图语解决 A基础设施最大的投资风险,是建或后无法适应未 现模推理和训练任务: 环填,通过标准化服务接口降低业务接入复杂 度,实现模型力买活复用。 理前业务关系”,二者共网推动A从他息检累走 模型和业务变化。 向下切分:通过资源切分和离离能力,调足不 向业务推理。 同业务需求, ADC白书2026 一给CI0设中心的49
OCR:IMG:亥二维码7天内(9月27日前)有效,重新进入将更
OCR:IMG:I目录CONTENTS 01 02 03 04 AIDC创新与发展 AIDC规划与建设 AIDC运营、运维与安全 AIDC成功实践 O O 1.1AIDC发展的五大趋势 -09 2.1Agent-Centric应用与生态 15 3.1AIDC智能生产退营 59 4.1华为云芜期3D数据中心创新实践 Agent成为AIDC负载的最大变量 09 围绕“AKDM考框架进行规划 15 从算力资源运营到A生产运营 59 85 模型向通用智能加速演进 10 沿着四个阶级推进企业Agen答地 20 AI生产运营五大核心能力 62 4.2中国建设银行A数据中心建设与运营 推理场ScaingLaws涌现 10 Agen动AlInfra边界重构 21 案例实践:银行AIDC价值运营升级 64 转型实践 87 超节点时代已到来 10 2.2Token-CentricAlInfra 22 AI生产运营演进路线 66 能源供给成为AIDC战路约束 10 4.3复旦大学附属中山医院AIDC医疗行业实践 从Cloud Infra别AlInra的核心变化 22 3.2AIDC自治运维保障 67 1.2Agentic时代AlDC新范式 11 Token生产效率四维评估要素 23 从设备运维到暂能生产运维保障 67 传统规划方法面临失效 = Token生成效率的关键约束与核心技术 25 Agenic自治运维六大被心能力 68 以3T+3P为横心的AIDC新范式 12 Token-CenicAl Infra日标考限构 30 Agenic自治运维考架构 72 四大能力重型Token-CenricAl Ina 32 案例实践:Agenc运维智能定界与快速恢复 74 企业AlInra规划建设重点方向 49 Agenc自治运维演进径 75 2.3Watt-Centric AIFacllity 51 3.3AIDC安全防线构筑 76 AlFacity的系统性挑战 51 AIDC“内忧外惠”安全困境 76 AlFacity规划建设建议 53 AIDC安全防护核心搭施 77 AIFacity新建与存量场景落地 56 以A防A的安全参考架构 81 AIDC白度书2026 公众号·智能交通技术
OCR:IMG:AIDC白皮书2026
OCR:IMG:2.2 Token-CentricAl Infra Token生产效率四维评估要素 不网业务场景对Token生产效率的要求并不相网,如下表所示: 从CloudInfra到AlInfra的核心变化 场景类别 真型应用 业务特证 Tokon生产效率要求 典型指标 负载从“云大数”到“AKDM”,CloudInfra主要 用、企业知识库、数据湖与模型推理训练等新型负 承载云计算、大数据与数据库等业务负载(简称云 载(简称“AKDM),以NPU为中心,星现计算 智客服 用户规模亿级:值调求 大数”),以CPU为核心,适配全类型多源数据,兼 集、带宽密集、长时运行与高功耗的特征。 A搜索、 万级及以上:单次请求通 TTFT90%: Agent 医疗助手、 结果可追 专业咨询 数据库/数据湖 知识 数据 软件开发、 单任务可包含10-100+次 以通算为中心 以智算为中心 模型调用:上下文可达10持续生成、状态复用、 持续生成、状态复用、 TPOT90% 计算 存 智算算超节点 存储 自动测试 续小时级及以上 支持小时级长任务 Scaleup Tokon生产效率可以通过四个维度进行衡量: TPOT(TimePer OutputToken.单Token生 DCN网络 Scale out Performance(应性)、Concurrency(# 成时间),指首Token输出后,每生成一个后续 发吞吐)、Cost(成本效率)、Quality(生成质 Token所需的平均时间。TPOT决定连续输出过程 图2-5:Allnfra相比CloudInfra的核心变化 量)。 的流畅程度,是衡量流式交互体验的重要指标。 an成为连接算力、模型与用户体验的价值载体,AlIntra的核心使命是保障高质量Token持续、高效 稳定地生成。 响应性能(Performance):用户体验指标 并发吞吐(Concurrency):性能评估指标 衡量用户从发起请求到获得有效响应时长,主要指 衡量A系统在满足用户体验约束的情况下,单位时 标包括: 同能够持续生产Token的能力。主要指标包括: TTFT (Time to First Token,Token时) TPS(Token PerSecond,抄Token处理 指从用户请求进入系统,到返回第1个输出Token )衡量单位时间Token处理能力,包括Output 所经历的时间。 TPS和TotalTPS。前者表示每秒输出Token数 AIDC白书2026 公众号·智能交通技术
OCR:IMG:模型向通用智能加速演进 这五个趋势判断指向同一个方向:数据中心正站在一个范式转换的怕界点。 大模型迈向通用智能(AGI)的发展路径,呈现以 MoE和算法创新等技术推动智能成本持续下降。 下超势: 1.2 Agentic时代AIDC新范式 硬型从静态训练走向持续学习和自我优化,结合数 超大规模参数模型,突破能力上限。模型从“快思 据、反慎和环境变化不斯提升能力。比姆,OpenAl Token正在成为衡量算力的基础单位,数据中心不 考走向“慢思考”,在编程、数学推理、科学研 企业CIO们面一个巨大的挑战:治用过去的方法 的GPT-5.6系列模型中,轻量板Luna模型的后训 再只是存放服务器的机房。它正在从”资供给系统 论来规划建设AIDC能否应对A的这些变化。 究等领域,逐步达到甚至超过人类专家水平, 已经可以由旗规版So模型自主完成 变成“算力生产系统”,衡量标准从“拥有多少 中小规模参数模型,提升智能效率,降低推理成 模型能力的淡进,对AIDC提出更高要求,既需要 XPU*变成了能产出多少Token” 本,模型重点准单位Token、单位算力下产生更 支撑超大算力负载,也需兼联训推混合场景下资源 传统规划方法面临失效 高水平的智能,包括模型架构优化、小型化模型、 的灵活调度, 业务规划失效,负载容量难以预测 再成立,A业务负载对计算、存储、网络的需求网 推理场景ScalingLaws涌现 AgenticA时代,传统软件应用和工具从前台退到 时爆发、相互合,需要考虑系统级的协同优化设 幕后,变成A智能体调用的底思基设拖。一个新 计,“定票统”正在走向“持续变化系统” 传统ScaingLaws描述的是训域阶段:硬型参数 通过增加推理计算量获得接近扩展参数量的收益, Agent域一个新模型可能在3个月内从垫伏起步变成 量、训练数据量、训练算力增加时,性能按幂律可 并借助更长思考链、更复杂搜索与更强自我验证机 全网爆火,带动Token需求展涨百倍。 物理设施层面,单机柜功率从5-8kW跃升至 预测提升。如今这一逻辑正在向推理阶段延神,推 制提开推理能力,对AIDC的直接影响是:单请求 40-120kW,风冷极限被击穿,液冷成为必选项, 理效果不再仅由模型大小决定,推理时投入的计算 算力消耗和推理时延同步攀升。 依赖历史业务发展的线性思维来推流业务来来规划 楼板承重、层高、电力引人都需要重新设计:更关 量正成为新的关键变量。 已经失效,未来3-5年的业务增长和业务负载也难 键的是时网窗口错位,企业肤得NPU后希望3-6 以预测 个月投产,但传统数据中心建设周期长达12-24个 超节点时代到来 月,机房准备节奏系统性用后于T设备送代节奏。 当单题芯片的性能近物理根限,就必须用系统化 已成为行业共识的技术路径,华为屏腾超节点和业 数据中心第一次无法“预测末要多大”。以Google 思维重构算力调优的全链条,华为发布的铅() 界主流超节点均遵循这一路线。 为例,2022年Go0gleAlCapex约为310亿美元, 运维保障失效,A突破原有运维运营边界 定律就是一个典型代表,通过器件-电路-芯片-系 到2026年这一数字预计接近1,900亿美元,四年增 传统数据中心运营以设备为中心,关注服务器可用 统四动同,实现系统级突破。 数据中心品面,也在不断涌现出系统化工程的新技 长超过5倍。 率、网络连通性、机房温湿度,核心目标是保障资 术方案,除了超节点,还包括PD分离(Pei-Decode 源不中新。 基于系统化工程创新,通过总线互联计算、网络、 分离)、多级KVCache等创新技术方案,正在改 架构范式失效,分层优化的时代结束 存储等基础设施,并进而通过池化提升整体性能。 变AIDC的设计范式。 传统数据中心的架构设计建立在技术是慢速变化 A时代,数据中心运维对象发生根本变化:Agen 的,系统是稳定的“这一假设之上。在这个前提下, 业务错路长、购城调用多,从模型推理到工具执行 能源供给成为AIDC战略约束 云资源层、计算/存储/网络层、Facilty层的分层优 再到数据访问,任一环节异常都会导改业务降级, 化显得顾理成章。 传统以设备为中心的道控体系无法应对。 算力的功率密度不断攀高,单机柜功率已从数十 超大型数据中心,也从MW级迈向GW级,GW级A kW迈入百kW级,中长期将超过300kW.传统风 DC的用电量堪比一座百万人口城市,能源供给正在 AI时代的技术选代节打破了这一前提,硬型选代 同时,数据中心还要考虑构建企业Token运营能力 冷极限约20kW/柜,已无力承载A高密算力,液冷 从成本问题升级为战路约束。 从年度变成季度甚至月度,芯片微架构的选代周期 以支撑业务部门激增的A需求。 从可选项变为必选项。 从24个月短到12-18个月。传统分层解架构不 0AIDC白书2025 公众号·智能交通技术
OCR:IMG:未来推理引擎竞争的核心,是单位算力能够产生多 智能路由与服务治理,根据模型能力、实时负 长期记忆(AgentMemory):让Ai具备持续认知 和业务操作,因此,A基础设施需要进一步支持智 少有效Token 载、资源成本和业务优先级,实现清求路由、 能力。 能任务的长期运行和规模化协作 灰度发布、眼流熔断和放障切换,提高模型报 面向Agent长期运行场景,管理跨任务、跨会话积 练引擎负责模型能力持续演进,是企业构建自身 务稳定性, 累的业务经验和上下文信息,使AI队一次性交互工 Agent行环辅主要承担三类能力: A能力的重要基础。 具演进为持续参与业务流程的智能主体。 模型生命周期管理,统一管理模型上线、版本 安全执行环填:保障Agent可靠运行 代表技术包括Megatron-LM、DeepSpeed、 开级、效果评测和运行状态,便模型从一次部 数据集:形成A能力优化闭环。 Agent涉及工具调用、代码执行和外部系统访 PyTorchFSDP以及异生态中的MindSpeed 署进入持续运营阶段。 沉淀业务交互数据、推理日志和人工反馈,形成高 间,乘获运行在安全隔爽环境中。平台亮要提供面 等,训练引擎的核心价值,是大规模模型训练任 质量训练数据资产,推动“使用一反一优化”的 向Agen任务粒度的资额、权限控行为 务高效映射到A集群,重点解决:大模型分布式训 Token计量与成本运营,以Token作为统一计 数据飞轮 审计能力,确保智能任务执行过程可控、可追球。 练效率、多卡多节点协网、内存占用和通信开销优 量单位,对模型调用规模、资源消耗和业务价 化等, 值进行分析,实现A资源投入的精细化运营。 前三类能力解决Token生成过程中的知识供给,让 身份与权限治理:管理数字工作负裁 A输出更加贴合企业业务:训练数据集则通过业务 随着Agent成为新的数字执行主体,每个Agent 未来训练引单主要呈现两个趋势:一是从一次性训 未来,模型服务平台将成为企业A能力管理和运营 反馈持续优化模型能力,形成企业A持续进化闭 都需要具备独立身份,并遵最小权限原则,企 的核心入口。 练走向持续优化。模型能力提升越来越依酸SFT、 环。 业需要将传统身份认证和访问控制体系扩展到A RLHF、Agent强化学习等后训练流程,训练引擎 主体,实现Agent的安全治理。 正在从“大模型训练工具”演进为“模型持续退化 2、数据基础服务:让Token录载企业知识 基础模型正在成为企业可获取的通用智能能力,而 3、Agent运行环境:让Token驱动业务行动 平台”,二是训推边界逐渐融合。强化学习等新型 传统应用遵“用户请求一系统响应的模式,而 多图能体编排与生金周期管理:支撑规化作 企业长期竞争优势将更多来自私有数据、业务如识 训练流程常要大量模型生成数据,推理引摩开始参 Agent通过自主规划、工民调用和持续执行完成复 当Agont从单体应用走向多智能体协作,基础设 以及持续反馈形成的数据闭环。数据基础服务连接 与Rollout过程,练和推理正在从两官独立软件栈 杂任务。 施需要提供任务排、状态管理、资源限商和成 通用硬型与企业业务,为Token生产提供持续的知 走向统一模型运行平台。 本控制能力,使多个Agen能够像企业团队一样 识供给,主要包括四类能力: 在Agent架构下,智算负责推理和决策,A数据服 协同完成复余任务。 如识向量库:让模型理解企业如识。 模型服务:让模型能力成为企业级AI服务 将规章制度、产品文档、专家经验等非结构化知识 务提供上下文与长期记忆,通算环提承载工具执行 随着企业进入多模型时代,硬型环境快速复杂化: 向量化,支撑RAG,使通用模型具备企业专业能力。 闭源大模型、开源模型、企业私有模型以及行业专 企业AlInfra规划建设重点方向 用模型将长期并存。如果业务系统直接对接不同模 图数据库:让模型理解业务关系, 企业建设AlInfra,不能只关注当前算力需求,而需 企业既需要支撑未来大规模模型训练、MoE推理和 型,会增来大量适配成本,也难以实现境一治理, 企业知识不仅存在于文档中,还包含大量实体关系 要面向模型持续演进和智应用规膜化落地,从资 Agent集群,也离要润足部门应用、小模型推理等 因此,模型服务平台成为企业A能力的统一入口。 和业务规则,通过知识图进和本体等方式,将企业 游弹性、Token高效生产和生产级韧性三个方向进 多样化需求,因此,AInra需要网备面可变化的资 其主要承担四类能力: 对象、关系和业务语义结构化表达,并通过图数据 行整体设计。 派弹性: 模型统一管理与服务化。面向企业多模型运行 库进行存储与计算,为模型和Agent提供可推理的 业务知识。 1、资源弹性:让算力投资持续透配未来变化 向上扩展:通过越节点和集群能力,支撑更大 场景,统一管理模型部署、发布、调用和运行 向量检紧解决“找到相关信息”,知识图语解决 AI基础设施最大的投资风险,是理成后无法适应未 现模推理和训练任务: 环境,通过标准化服务接口降低业务接入复杂 度,实现模型能力灵活复用。 理解业务关系',二者共间推动AI从信息检家走 来模型和业务变化。 向下切分:通过资源切分和隔离能力,满足不 向业务推理。 同业务需求 AIDC白皮书2026 公众号·智能交通技术
OCR:IMG:杨超斌 梅宏 华为公司常务董事,ICTBGCEO 中国科学院院士,北京大学教授,中国计算机学会前理事长 过去两年,全球日均Token消耗量增长近300倍,超过3000万个AlAgent已深入制造、金融、能源等行业协同 以互联网、云计算、大数据和人工智能为代表的新一代信息技术正以前所未有的深度与广度重望人类社会的 工作。AI正从技术探索走向规模化生产,而承数这一切的基础设施——AIDC,正在经历一场根本性的重构。 生产生活方式,成为新一轮科技革念和产业变革的核心驱站力,数字化转型已成为不可逆的时代大势。近年 中心的设计逻情已无法适应Agentic时代的需求。从供电架构到散热方案,从算力基础设施架构到关键 技术的突啦性进展以及AAgon技术的兴起,标志着人工智能正在开启具备自主规划与任务执行能 产品形态,从建没模式到运维运营,AIDC的每一个环节都在被重新定义,这不仅是技术的升级,更是业务逐 力的Agen5cA新阶段,作为人类生产生活的辅助工具将呈现能力的大幅联升,而这一切技术演进的底层支 .本白皮书凝聚了华为在A算力基础设施教域的深度实践与系统思考,从架构规划到工程落地,从技 .离不开算力基础没施的系统性升级,AIDC作为面向AI负载重构的新一代数据中心,是支挥大硬型 术选型到持续运营,为企业构建Agentic时代的A算力底座提供了参考指引。行业智能化正加速的行,希望这份 与AAgont规模化应用的“算力*工厂,这部白皮书,系统通述了AlDC的内涵边界、技术果构、建设路径与 白皮书能为全球AIDC的创新发展贡献一份力量, 发展姓势,具有实践性和前性,为产学研用各界提供了有益的参考 雷鸣 李鹏 中国建设银行副行长 一华为公司董事、ICT销售与服务总载、中国地区部总载 人工智能正加速重构产业发展格局,AIDC智算基础设施作为数字经济时代的核心算力底座,是赋 近年来,华为携手金胞、制造、电力等行业客户,图数智化转型联合创断,从机房物理没施、算力基 实体经济智能化升级的关键支撑。作为国有大型商业银行,建设银行深入践行“人工智能+”行动,坚持算 施、到图能运维运营的全链条都在打破传统经验的边界,A从辅助工具演变为核心生产力,AIDC也退来了 度超前,硬成“四地五中心”高可用智算集群,以望实算力底座范动全业务链条数智化转型,对 涂探素到系统化落地的全面联迁。在大量实践中我们深感受到,AIDC已不再是传统数据中心的技 力基建的战路价值的认知不断深化,本白皮书既别析技术座层逐调,又集产业落地实践,系统潮释了人工 升级选择,而是题动企业数智化转型的战略底座,这是产业流进的大超势,也是先行者的重大机,本自皮 与AIDC协同发展的路径与方向,兼具前睡性与指导性,值得业界网仁研读参考,期待与各方携手共 了华为与行业客户在实践中积累的经验与思考,希塑能为更多企业建好、用好ADC提供一份兼具的 智能算力生态,以算力筑基赋能新质生产力,助力数字经济高质量发展。 与切实的参考,我们期待以此为契机,与产业协同力,共同打造绿色集约、高效、开放的A基础设施, 加速暂算基础没施高质量发展,共赢Agentic时代! 公众号·智能交通技术
OCR:IMG:01 66 当人工智能成为数字经济的核心生产力,数据中心正经历一场深刻而决定性的跃 升。它已超越承载算力与数据的传统定位,成为智能时代的战略生产资料。旧范 第一章 式无法解释新负载,范式转换的大幕由此拉开。 AIDC创新与发展 人类历史上,每一次基础没施的联迁都重型了文 到能感知、规划和执行任务的自主Agent。智能 明的底层逻辑,落汽机重构了“动力”的生产范 正以能所来有的通度和密度满入每一个企业、每一 式,让人类握脱体力极眼:电力重构了“能源”的 台终端。 供给体系,点亮工业与干家万户:互联网重构了 “信息”的流转望辑,打破知识与时空的满, 数据中心的内通正在被深刻改写:从承载计算、存 储和同络资济的基础设施,演进为持续生产智能 今天,正在发生的第西次肤迁将重构“暂能”的存 力的新型基础设施,这不仅是一场T架构的技术重 在形态。从大规模预训练模型的能力涌现,到分布 里,更是一场定义未泉数十年生产力范式的系统性 式推理的规模化部署:从被动应的信息工具, 命 1.1 AIDC发展的五大趋势 88 Agent成为AlDC负载的最大变量 Agent让A从“认知智额”向“行动智能”流进, 与此间时,每百万Token的推理或本从5元降到0.5 成为能自主规划、工具调用和闭环执行的“行动 元,推理成本快速下降,进一步引爆了Agent和 者”,这使得A从错地型的“对话相”变成了能 Token需求,这符合经济学中的Jevons特论销 立承业务流程的“数字员工”,重构企业传统应 环:A效提升不会降低算力需求,而会创造更大 用 的A算力需求 2024年初至2026年,中国市场日均Token调用量 今天,Ai开发者每天消耗上亿Token已不确奇 从1000亿增长到140万亿,其后是Agont带来的 金融头部企业每天的Token消也超过亿,来 Token离求指数级增长,一个复杂Agent任务通常 来Agent的数量和复杂度变得不可预测,这是Al 要多轮推理和工典调用,会触发数十甚至数百次 DC负的最大变量, LLM调用,上下文窗口长度走向百万Token级别。 三 AIDC白书2026 一国地数中心的09
OCR:IMG:供配电:大电流输送的空间与可靠性代价 同时,超高功率A机柜带来的重量增长,也对建筑 AlFacility规划建设建议 当单个A超节点功率超过100kW,超节点集群规模 结构承重能力提出更高要求,当前智算整机柜重量 开至数百MW量级。传统数据中心普遍采用的 约16kN/,未300kW以上超高功率机柜单柜重 电力优先的园区选址逻辑与源网荷储协同架构 源网荷健不是万能的一一储能投资高、新能源出 63A三相供电回路,在承载能力上已见时一 量将突破20kN/m,已有标准里楼板荷载设计 供电能力与长期稳定性是AIDC选址的首要决策因 力难频判,破局之道是能源管控与算力调度深度联 为满足大电流输送需求,传统方案只能通过增加线 (8-12kN)不再适用 素,绿电富集地区因此成为大型A1DC园区的首 动:弹性任务跟随电源峰谷错峰运行,刚性负荷优 线数量与配电回路数进行补信,这会引发连锁问 造一不仅电力充沛,通常还兼具土地宽格、碳排 先保障移定供电。归根结底,AIDC园区的选址与 题:机能与桥絮空间被大量济占,线路钢耗与压持 建筑主体生念用期通常长达50年。首期规划建设查 放约束宽松等叠加优势。 建设,是在电力优先'逻辑下,在供电可靠性与长 同步上升,配电节点增多也章味着放障概率的累积 接决定了未来基础没施的上限一—承重、层高和主 期用电成本之间寻求最优平衡。 放大, 干路由,一旦理或根难改变。如何在初期决策中 不同A业务的电力调求不同,选址案差异化适配: 为末来不确定性留出余量,是建筑结构面络的 ·大模型训练:负荷稳定、规模大,优先低廉 供电架构从交流为主走向交流与高压直流井存 散热系统:液冷管网配置规划困填 心辨战 充沛的电力: 在保障电力供给规模与稳定性的前提下,供电架构 智算时代风冷满足不了单柜功率诉求,液冷散热成 需跟上高密算力的开级步伐,在中低密和存量场景 为必然。如何规划液冷管网面临同难:建没初期如 建设周期:工程交付跟不上算力选代 ·离线推理:成本敏感,侧重电价与吞吐的 中,交流供电产业链成熟、标准完善、运维经验丰 果管网、CDU和米端接口一次性固化,后续扩容就 当前智算硬件选代节奏已压至一年一代,芯片功 平衡: 富,仍将长期作为主流,面向300kW以上超高密机 要大改:反之,如果完全按照远期最大流量配置, 耗、机柜规格、集群互联方案持续更新,一次性定 柜,传统交流方案的电流、线缆数量和配电空间压 平时又会因“大管径、小流量”造成控制困难和额 型的静态机房架构难以通配硬件快速更选。传统土 -Agent交互式推理:在电价与访间时冠间 力急副上升,800V高压直流先借减少变换级数和降 外能耗,行业需要可拆分、可动态调节的管路架 建主导的建设周期长达12-18个月,而行业普遍要 权衡: 低线路电流的优劳,成为重要演进方向。300kW是 构,让管路能力随算力需求逐步扩容,这对液冷提 求智算没施6-8个月完成交付,工期子盾巨大。 规划参考阀值,最终路线仍需综合服务器接口、可 出全新的模块化和弹性化设计要求。 边缘场景:用户距离与数据合规优先。 靠性、投资成本、标准规范及产业成典度等因家确定。 除此以外,Agent推理业务负载具备很强的突发 液冷还带来水力平衡、冷却液推护和泄漏等风险。 性,短时间内功率峰值可成倍波动,通基没 绿电富集区的核心德点是新能源出力波动,为兼题 800V直流主要有三种架构路径: 液冷管线可达到十公里,任何网部堵塞、腐蚀或控 具备快速弹性扩容的能力。基建前期规划需要预留 供电容量与电能质量,大型智算四区离构建源网荷 制失配都可能形成热点,系统需持续道测流量、压 充足的调整空间,依靠弹性架构承接硬件选代周期 与业务负荷波动。 储一体化架构—配套构网型储能、联动就近能源 差、温度、工质电导率和pH值,建立泄漏检测与工 基地,实现新能源就地生产与消纳。构网型储能承 质健康度预测体系。 担西项关键功能: 建筑结构:层高、承重或为核心挑战 ·毫秒级应,平滑新能游功率波动: 随着液冷系统引入更大口径供回液管道,供电线 面持续增加,集群互联光纤规模快速增长,传统 支撑体网电压与频率稳定: 数据中心的层高、架空空间和机房布局已难以通应 ·收A负载瞬时功率尖峰,期减网的反向中击: 未来需求 短时断电时无缝商网运行,保障算力不中断。 S2AIDC白皮书2026 公众号·智能交通技术
OCR:IMG:Agent行环填:通过任务输排、工具调用、安全 构,但实际建没还需从工程部署视角进一步拆解为 执行和多暂能体协网,使Token进一步驱动业务流 四个能力图:超节点、超节点集群、算力调度和A 节点通过网络设备互联,通信占比高(20%-30%) 程和自动化执行。 报务平台,其中,超节点与超节点集群是算力庭座 上三层从功能分层视角定文了AlInfra的逻辑架 的心载体,性单位算力的Token生产效率, spine asm 参数至间络 Cm 四个能力圈重塑Token-CentricAlInfra 跨节点AtoA 跨节点AtoA通信 四个能力圈分别服焦算力供给、集群协网,资速调 能力交付的完整体系,是Token-CentricAlIntra 度和智能服务,共网构或从底算力资源到上A 落地建没的核心额力单元,其具体内通如下: AI服务器1 AI服务2 Al服务器n 2.1KV 11DC内 2-12传报务若 线 5 mon- 手| L2节点 L3力平台 L4A务平自 当计算规硬从单机扩展到集群,新的瓶随之出 宽和通信时延逐渐成为限制因素,计算芯片等待数 2.25cae Ou同 3.2DC 知| 现一—通信效事。特别是在MoE模型中,专家并行 据传输的时间增加,通信开得不断慢性有效算力, 4.3Agnt行 需要大量跨芯片A-to-Al通信,传统Scale-Out 导效集群规模越大,Token生产效率反而下降。 架构依以太网连腰标准化服务器,虽然具备良好 的通用扩展能力,但在超大规模A负载下,网络带 因此,A施出现了新的计算组织方式:超节点。 2-11 Token-Centric Ar Infra L1-超节点:Token高效生产核心引掌,成为建设常态 1、节点的定文:逻上的“一台计算机” 留给KVCache的空间不足,导推理并发能力和 高速互联总线 着模型规从百亿、干亿参数向万亿参数流进 长上下文能力受到严重制, 传统单服务器架构正在通近物理边界。以1T参数模 NPU NPU 型为例,即使深用FP16精度,型参数本身就需要 因此,要网时润足大模型部署、长上下文推理和 约2TB内存,已经超过主流8卡A服务器的片上内 并发服务,计算资源必须突碳单服务器边界,向跨 存容量,即使通过INT4、FP4等低精度量化方式压 节点合满进 对等|内存情一址|TB全互联 模型,有限片上内存仍会大星被模型权重占用, 2-13节点构 2ADC白书2026 一提地C10建设中心的33
OCR:IMG:中国建设银行 HUAWEI AIDC白皮书2026 ,是为公注,在本中本 本文的可含有息,细不期于有关未的、,严家列,到性末等信息,由于成注中存在提多不 进上做出的份行为承担,单为可都不通以改上进息,不用行通加, 构建万物互联的智能世界
OCR:IMG:5、通算资源:Agent的行动障 所”升级为“任务必完成”。 个过程,未来A基础设施的重要演进方向,是推动 智算提供“思考”能力,通算支撑“行动”能力, Agentic时代,A基础设施形成新的分工:暂算负 通算与智算资源进一步慰合,通过统一架构和协网 AI存储承载“记忆”,高性能网络连接三者协网。 责“思考”,通算负责“行动”。大量任务编排、 三是安:强障离成为Agent运行底座 调度,形成面向Agen任务的一体化超节点体系。 未来,四者将进一步融合为面肉Agent时代的影型 工具调用、代码执行和环境交互,都运行在通用算 Agent最大的安全风险来自模型自身的不确定行 AI基础设施, 力之上. 为、包括错误代码执行、异常工具调用和数据越界 至此,新一代A算力集群的架构全院得以呈现: 随着Agent进入企业生产环境,通算需要从传统业 访问,未来Agent运行环境案要具备:microVM级 务服务器开级为Agent原生运行环境,具备以下四 强隔离沙箱、网络与权限默认隔离、会话级安全控 制、全流程行为审计。 L3-算力调度:从建好到用好算力,高效释放超节点潜能 项楼心能力 超节点突破了单节点计算边界,但也带来了新的资 任务需求动态伸能和流动。 ①一是快:高并发、毫秒级启动 对于金融、改务、能源等行业,安全隔离与可审计 源管理挑战:当数百甚至上干张A芯片形成复杂计 能力将成为Agent生产部署的基础门格, 算集群后,如何持续、高效地调度这些资源,成为 资源可件缩:从固定规格到按任务分配 Agent具有高并发、短生命周期特点,未来可能网 释放A基础设施价值的关键。 面向大规模任务,支持资源聚合 时运行百万级任务实例,基础设施需要支持以“每 四是始:通智存协同调度 ·多个超节点通过亮速互联形成统一算力资源池: 会话一个沙箱”方式快速创建和销毁运行环境。 Agent应用的执行过程天然跨越多个资源域: 算力调度,就是超节点集群的“操作系统”,它通 ·支撑干卡级训练、大规模推理和跨节点PD分离。 通算资源:负责任务编排、工具调用和执行环境: 过资源池化、任务编排、弹性调度和故障管理, 核心能力包括: 底层算力转化为稳定、高效的Token生产能力。 面向小规模任务,支持资源切分: ·基于快照恢复实现毫秒级冷启动: 智算资源:负责模型推理与决策生成: ·超节点级:将数百卡超节点划分为多个逻辑源 ·单机支持数百至上干Agent实例离密度部署 AI存储资通:负责上下文状态、知识和长期记亿管 面对企业级A生产,调度平台需要解决三类心问题: 域,支持多个业务隔离行: ·大容量、高带宽内存支撑高并发状态运行, 理。 资源高效利用:如何让不网规模、不网类型的 单卡级:通过vNPU等虚拟化技术,将单卡切分 任务共享越节点资源,提升整体资源利用效率: 为多个计算实例,提高小模型资源利用率 这一需求推动通算从传统服务器走向超节点形态: 末来AlInfra需要打通三类资源,实现统一感3如和协 ·负动态适配:如何根据业务请求变化和模型 只有具备大内存、高带宽和芯片间亮通互联能力的 同调度: 行状态,动态匹配计算资源,保障稳定服务能力: 资源可流动:从静态占用到动态复用 系统级架构,才能支撑Agent现模化运行。 ·通算与暂算协同调度,根据任务需求动态匹配计 ·集群持续运行:如何通过故障检测、任务迁移和 AI负载具有明显潮汐特征:白天在线推理需求高 算资源: 资源恢复机制,保择大规模A集群长期稳定运行。 ,夜间训练、调和数据处理任务占主导。如果资 二是:从服务可靠到任务可靠 计算与存储高效协网,降低上下文和状态访问延退。 源长期图定绑定,容易造成高峰不足、低谷闲置。 1、弹性调度:让超节点资源“随需调用” Agent任务正在从分钟级交互走向小时级甚至天级 最终目标是让Agent的思考、行动、记忆'形成 超节点提供了高密度计算能力,但企业A负载具有 因此,调度系统需要基于业务优先级实现动态资源 自主运行,前沿编码Agent单次连续运行已达到25 统一运行体系,实现从资源调度到暂能执行的一体 高度不确定性:一方面,大模型训练和高并发推理 复用: 小时,传统“服务99.9%可用”已无法满足长任 化支撑, 需要数百甚至上干卡协网:另一方面,OCR、 ·核心生产推理任务获得确定性资源保障: 务可性。 Embedding、语音、小模型推理等大量任务只需 ·低谷时放资源自动投入训练、微调等商线任务: 未来展望:走向通智融合超节点 要少里资源。 ·高优任务到来时,低优任务支持暂停、迁够或降级。 未来通算平台需要具备:持久化执行、任务状态检 当前AI基础设施正在形或两类格节点:以NPU为 查点、新点续跑与跨节点迁移、与A存储结合的上 核心的智算超节点,以及以CPU为心的通算超节 因此,调度系统需要改变传统服务器时代一次分 通过训推混部、潮汐复用和优先级调度,将时间维 下文长期保存能力,可靠性标准正在从“报务不中 点,但Agent应用天然融合“思考与“行动”两 配、长期占用”的资源使用方式,让算力能够根据 度上的闲置算力转化为有效Token产能。 A1DC自2026 公众号·智能交通技术
OCR:IMG:高速芯片互联:提升多芯片之间的数据交换能力 总体来看,Token生产效率的提升,本质是一场围 传统CloudInfra以laaS为中心,聚焦计算、存 最终,算力底座的目标不是提供更多抓立算力,而 如华为灵丽(UBLink)等高速互联技术; “数据流动效率”的系统优化。从PD分离推理 储、网络的池化与调度:而当Token成为衡量Al 是构建面向A生产的高效计算体系,让单位资源产 高效井行计算架构:优化模型切分和任务调度 禁构,到减少无效搬移、提升节点供给能力、突 生产效率的核心单位后,单纯优化资理据已无法决 生更多有效Token 式,提高多芯片协同计算效率,如Megatron-LM、 跨节点通信照额,Allnfra正在从传统算力基础设 定终的Token产出效率,因此,Al Infra的架构 DeepSped等支持张量并行、流水井行和专家并行 拖转向面向智能生产的新型计算体系。未来竞争的 边界需要进一步向上延伸,在传晚资源基础没施之 算力调度层:解决“高效资源利用” 的大模型分布式计算框架: 关键,不是谁拥有更多算力,而是选能够让计算、 上增加模型运行、数据知识管理和Agont运行环填 算力调度层本质上是AlInfra的操作系统,负责连接 存储和通值形成更加高效的数据流动体系,持楼、 等A服务能力,将底层算力转化为可持续运营的A! 居资源、型任务和业务需求,通过资派池化、 通信与计算融合优化:减少通信等待,提高分布式 稳定、高效地产生Token。 能力 弹性调度、任务钢排和智能优化,实现: 推理效率,如HCCL集合通信优化、MoE场下针 对A-1o-A通信的优化技术。 基于这一变化,Token-CentricAlInfra形成AI 资源统一管理:屏蔽不同芯片、不同代际设备差 Token-CentricAl Infra目标参考架构 算力底座、算力调度、AI服务平台三层架构,分别 异,形成统一A资速池: 解决“极致Token生产效率、高效算力利用和持续 Agont A能力供给”三个核心问题,最终实现从“资源供 动态资源匹配:根据模型规模、推理阶段和业务优 住务 任务划 住务执行 Sk取生线 记艺期力 多Ag码 工具用 给”到“智能生产体系”的演进。 先级,将任务匹配到最适合的计算资源: Agen平台(AgenArt/DiyHiAgen) Model Knowledge&Data 算力底座层:解决“单位算力的Token生产 资弹性复用:通过训推混部、潮汐调度和优先级 型工程(引入、评估及生用理) 知工程 效率 管理,提高整体资源利用效率: Token 点 RL sN A时代,企业建设重点不再是简单增加算力规模 DoG ERIN RR工N 而是构建面向AI负载优化的统一算力底座,使计 高可靠运行:通过放障检测、任务迁移和烫源恢 模型工程工具链 WSNN BRAR 算、存储和网络能够图绕模型推理、训练和Agent 复,保障A生产连续运行。 任务高效的网。区别于传统Cloudinfra面向通用计 Token-CentricAlInfra 算资源,A算力底座需要网时支撑多样化AI负号: 如果说算力底座决定企业拥有多少Token生产前 型服务 Agent运行环填 识&数服务 力,那么算力调度决定这整能力能否被充分释放, 间 暂算资:以超节点及超节点集群为心,提供模 AI务 ANP 调度引章 工A内管 文,片, 型训练和推理所需的高性能计算能力,通过高速互 AI服务平台:解决“持续AI能力供给” 平台 沙箱 联、内存池化和大规模并行,提升单任务Token生 A服务平台主要包括三类核心能力: 行章 化/容8 880 产效率: 型运行服务:通过推理引擎、训练引擎和模型 力 统一资源管理及调度 通算资源:支撑数据处理、知识服务、Agent任务 服务管理,将算力转化为稳定、高效的Token生产 调座租 暂算资 通资源池 A网路 AI存储 输排和工具执行,为智能应用提供业务执行能力: 力: 力 N9A 座租 AI存储与高速网络:承载模型镜像、KVCache 数据与知识服务:通过向量数据库、知识图酒和长 上下文状态和训练数据,通过高带宽、低时延的数 期记忆,使Token具备企业业务知识,实现从通用 图2-10企业Token-centricAlInfra总体构 据通路保障计算资源持续获得有效数据, 智能到行业智能的转化: AIDC白度书2026 公众号·智能交通枝术
OCR:IMG:模型向通用智能加速演进 这五个超势判断指向网一个方向:数据中心正站在一个范式转换的绝界点。 大模型迈向遇用智能(AGI)的发展路径,星现以 MoE和算法的新等技术推动智能成本持续下降, 下势: 1.2 Agentic时代AIDC新范式 模型从静态训练走向持续学习和自我优化,结合数 超大规模参数模型,突破能力上思,模型从“快思 据、反该和环境受化不断提升能力,比如,OpenA 考”走向“慢思考”,在编程、数学推理、科学研 Token正在成为衡量算力的基础单位,数据中心不 企业CIO们面路一个巨大的挑战:治用过去的方法 的GPT-5.6系列模型中,轻量版Luna模型的后训 再只是存放服务器的机房,它正在从“资源供给系统 论来规划建设AIDC能否应对A的这费变化。 究等锁域,逐步达到基至路过人类专家水平。 练已经可以由旗机质So模型自主克成 变成“算力生产系统”,衡量标准从“拥有多少 中小规模参数模型,提升智能效率,降低推理成 模型能力的流进,对AIDC提出更高要求:既离要 XPU*变成了“能产出多少Token” 本,模型重点准单位Taken、单位算力下产生更 支撑超大算力负载,也案兼训推合场下资源 传统规划方法面临失效 高水平的智能,包括模型架构优化、小型化模型、 的灵活调度, 业务规划失效,负载容量难以预测 再成立,A业务负对计算、存储、网络的需求间 推理场景ScalingLaws涌现 AgenticA时代,传统款件应用和工具从前台退到 时爆发、相互合,需要考患系统级的协同优化没 基后,变成A暂能体调用的底层基础设施,一个新 计,“稳定系统”正在走向“持续变化系统” 传统ScaingLaws述的是练段:型参数 通过增加推理计算量肤得接近扩展参数量的收益, Agent或一个新模型可能在3个月内从垫伏起步变成 量、训练数据量、练算力增加时,性能按律可 并借助更长思考猛、更复杂握索与更强自我验证机 全网爆火,带动Token需求暴涵否倍。 物理设施层图,单机柜动率从5-8kW跃升买 预测提升,加今这一退镇正在向推理阶段延神,推 制提升推理能力。对AIDC的直接影响量:单请求 40-120kW,风冷极限被击穿,液冷成为必造项 理效果不再仅由模型大小决定,推理时投入的计算 算力消和推理时同步升。 依赖历史业务发展的线性思维来推演业务未来规划 硬板承重、高、电力引入都需要重新设计:更关 量正成为新的关键变量。 已经失效,未泉3-5年的业务增长和业务负载也难 键的是时问密口错位,企业获得NPU后希望3-6 以预 个月投产,但传统数据中心建设用期长达12-24个 超节点时代到来 月,机房准备节资系统性用后于IT设备选代节奏, 当单题芯片的性能通近物理根限,就必填用系统化 已成为行业共识的技术路径,华为算腾超节点和业 数据中心第一次无法“预未来要多大',以Gcogle 思维重构算力调优的全链条,华为发布的箱() 界主流超节点均猫这一路线, 为例,2022年GoogeAlCapexd约为310亿美元, 运维保障失效,A突破原有运维运营边界 定律就是一个典型代表,通过件-电路-芯片-系 到2026年这一数字预计接近1,900亿美元,四年增 传统数据中心运营以设备为中心,关注服务器可用 统西展协网,实现系统级突破。 数据中心层面,也在不断消现出票统化工程的新技 长过5。 率、网连透性、机房温湿度,核心目标最保障资 术方,除了超节点,还包PD分离(P-Dcod 源不中断 基于系统化工程创新,通过总线互联计算、网络、 分离)、多级KVCache等创新技术方案,正在改 架构范式失效,分层优化的时代结束 存储等基础设施,并进而通过池化提升整体性能, 变AIDC的设计范式 传统数据中心的聚构设计建立在“技术是慢通变化 A时代,数据中心运维对象发生根本变化:Agen 的,系统是稳定的“这一做设之上,在这个前提下, 业务路长、跨域调用多,从模型推理到工具执行 能源供给成为AIDC战略约束 云资游层、计算/存储/网络层、Faclity层的分层优 再到数据访问,任一环节异常都会导放业务级 化得顾理成章 传统以设备为中心的道控体系无法应对。 力的功率密度不断单高,单机柜功率已从数十 超大型数据中心,也从MW级迈GW级,GWA kW迈入百kW级,中长期将超过300kW.传统风 DC的用电量堪比一座百万人口城市,能源供给正在 A时代的技术选代节要打破了这一能提,硬型选代 同时,数据中心还要考虑构建企业Token运营能力 冷吸限约20kW/柜,已无力承载A高密算力,液冷 从成本问题升级为战路约束。 从年度变成季度基至月度,芯片微架构的逃代淘 以支撑业务部门激增的A需求。 从可选项变为必选项。 从24个月继短到12-18个月。传统分层解架构不 10ADC白书2026 一给建设数中心的[11]
OCR:IMG:A也给数据中心的安全带来了极大的冲由,数据中 风险,数据中心外部累客驱动基于A大模型的自动 三者构成一个完整的价值链条:Agent驱动Token “3P"参考框架 心内部的Agent自主规划执行带来越权和数据泄露 化攻击也让传统防御体系面临代差劣势。 消耗,Token消耗决定算力需求,算力需求决定瓦 P1:Production(智能生产运营)P2:Prov- 特消耗。规划设计需要在每个环节上做出取舍和平 sioning(自治运维保障)→P3:Protection(安 衡,缺少了任何一个T的考量,ADC的规划都是 全防线构筑) 以"3T+3P"为核心的AIDC新范式 不完整的。 A算力本身已经成为生产要素,数据中心的定位也 是主要子盾。业务部门关注的同题是:每天能够产 在发生变化:从成本中心到价值中心,其价值不再 出多少有效Token? 体现为“拥有多少资源”,而是体现为“能持续生 Production智能生产运营 成多少价值,行业公开数据显示,2025-2026 AIDC的规划没计需要一套全新的系统性思维,我 从算力资源运营到A生产运置新冠式 年中国头部科技企业Al相关资本开支(Capex)网 们称之为以“3T”和“3P”为核心的参考框架: 比普连增长50%以上:其中学节跳动2026年A基 设域投入规模已上调至2000亿元以上, “3T”参考框架 Provisioning自治运维保障 P1 Protection安全防线构筑 T1:AgenT(应用驱动)→T2:Token(算力 阿时头部企业的A基础设施团队正从运维成本中心 运营)-T3:WatT(物理支撑) 从设备运维到能生产运维保障 P2 P3 构筑零信任智体、强化内生安全、A防A 转向”AI产能运营部门”,“机房有多少台服务器”不再 传统应用 AI应用 图1-2'3P°参考架 Application 自用 应用/江具 生产运营以Taken为计量单位驱动图能价值创造, 支撑、协同联动,共同保障AIDC从算力资源到智 重构 业务数中台 Agent 运维保障以自治化手段保障系统连续可靠,安全控 能价值的稳定转化。 数库/数据 知识 数据 制以零信任和A防A守住业务安全底线,三者相互 以通算为中心 以留算为中心 AlInfra 点 存 重构 传统机房 AIDC机房 AIFaclty MWR GWE 量构 供电 20 供电 数 30 风 信压 中心 冷 中心 图1-1'3T'参考 AIDC白书2026 公众号·智能交通技术
OCR:IMG:聚焦前沿跟踪发展 广结同道分享经验 口 智能交通技术(ITSTech)
OCR:IMG:最终日标是:让一次基础设施投资能够适应模型规 当A进入核心业务流程,企业必须回答:如果智能 模、业务形态和应用需求的持续变化,因为企业果 生产中断,会发生什么?A时代的可靠性标准,正 2.3 Watt-CentricAlFacility 购周期通常以年计算,而A技术演进以月计算,只 在从“服务不中断”升级为“任务不中断” 有弹性架构才能蛇短用者之间的差距。 传统数据中心Facility的规划建设是基于“功率 机柜功率达到数百kW,算力集群从数十MW扩 企业级AlInfra需要具备三个层次的韧性: 可预测、冷却可标准化、负载相对稳定”三个前 展到GW级别,一座GW级AIDC四区,用电负 2、Tokon高效生产:让算力转化为有效智能 提之上,A时代这一确定性设计范式正在失效。 荷已相当于一个百万人口城市。该功率量级超 很多企业面临一个共同问题:算力投入不少,但资 第一层:实例可靠——保障单点放障不影响服务。 出传统机房设计上限,电力供给不再只是配套工 源利用率不高,业务仍然觉得算力不足,不能纯粹 通过多实例部署、副本机制和自动切换,保障单个 这是因为从AI芯片到AI机柜再到A园区,算力的 程,而是项目立项与建设方案的决定性前置要素。 从AI算力利用率衡量,它既无法反映任务调度效 节点放障不会影均业务。 功耗在快速持续增长:单芯片功耗迈向kW级,单 率,也无法体现模型推理效率、状态复用能力和业 务产出能力。 第二:状态可靠一一保障任务不中断,对于 算力单柜功耗趋势(kW/柜) AIDC变化特征 Agent、多轮交互等复杂任务,接口可用并不代表 润 300 AIDC规膜10倍增长 A时代,企业需要从关注“资源使用率”,转向关 业务连续,需要保障:会话状态保存、KVCache 100MWGW 注:单位算力能够持续产生多少有效Token 恢复、长任务持续执行,避免一次故障导效任务重 200 新开始 150 功率密度10倍增长 提升Token生产效率,企业需要重点关注三个方向: 100 40-100-300+kW 50 第三层:业务可靠—保障企业级连续运行。通过 2024 2025 2026 2027 2028 芯片进代加 。 计算效率:提升单位算力输出 跨集群、跨地域部圈和灾备体系,保障单一源域 Souroe:Public infoation & Huawei Ptanning 年代以上 通过模型优化、并行计算和推理调 故障不会影响核心业务。 度,让更多算力用于有效计算。 对于金附、能源等关键行业,生产级韧性不是优化 图2-23数据中心电力负荷始势变化 状态效率:减少重复计算 项,而是A规模化应用的基础能力。 面对这种变化,Facity设计需图统能源、空间、时 ·机房布局与建筑结构原生适配超高功率智算集群: W 通过KVCache、暖存和状态管理, 间三个维度重新思考: ·规划建设以模块化预制增短建设周期,大小机电 让已有计算结果复用,降低长上下文 【小结】 ·选址以电力供给为第一优先级,通过源网荷储一 解端支持弹性部署,兼容多代算力演进。 和Agent任务成本。 AlInfra建设的核心目标,是构建面向智能生产的 体化平衡可靠性与成本: 新型基础设施能力。未来企业之间的差距,将更多 $0 系统效率:提升资整体利用 体现在算力、网络、存储和调度体系的整体协同能 AlFacility的系统性挑战 通过统一调度、润部和资编排,提 力,以及由此形成的高性能、大规模、高质量、可 开不同业务之间的资源协同能力。 持续的Token生产能力。 电力供给与质量:从园区配套上升为选址错点 最终,企业案要从关注:“算力利用率是多少?”转 随着Al从硬型能力竞争走向规模化应用,AlIntra正 选址逻物根本性重构。ADC园区规模呈指数级扩 源网荷储双向合挑战:随着新能源接入率持续提 向关注:单位投资能够产生多少有效Token? 在从支绿算力运行的基础设施,演进为驱动智能生 张,选址逻辑已从过去的“以用户覆差和网络时延 升,能源供给的波动性与不确定性有可能影响A集 产的新型生产体系。它将成为企业进入智能时代的 为核心”,全面转向以电力容量、电结构、并 群的稳定运行:与此同时,万卡级A集群呈现高密 3、生产银错性:让A成为可监生产系统 重要底座,并支撑末来企业智额化竞争的核心能力。 网周期及长期供电稳定性为核心, 度、高功率和强同步特征,其动态负载变化也会反 向冲击电网稳定性。 IDC白皮书2026 公众号·智能交通技术
OCR:IMG:5.算资源:Agent的行动引 新”升级为“任务必完成”。 个过程,未来A基础设携的重要演进方向,是推动 暂算提供“思考”能力,通支撑“行动”能力, Agentic时代,Ai基础设施形成新的分工:暂算负 通算与智算资源进一步胎合,通过统一架构和协间 AI存储承“记忆”,高性能网络连接三者协同。 责思考”,通算负责“行动”,大量任务编排、 3三是安:强隔离成为Agent运行鹿座 调度,形成图向Agent任务的一体化超节点体系, 未来,四者将进一步附合为面向Agent时代的型 工具调用、代码执行和环境交互,都运行在通用算 Agent最大的安全风险来自模型自身的不确定行 AI基础设施 力之上. 为,包据增误代码执行、异常工具调用和数据越界 至此,新一代A算力集群的架构全航得以星现: 随着Agent进入企业生产环填,通算需要从传统业 访问,未来Agent运行环填需要具备:microVM级 务服务器升级为Agent原生运行环境,具备以下四 隔离沙箱,网络与权限默认离、会话级安全控 制、全流程行为审计。 L3-算力调度:从建好到用好算力,高效释放超节点滋能 项核心能力。 超节点突破了单节点计算边界,但也带来了新的资 任务需求动态伸和流动。 0一是快:高并发、毫秒级启动 对于金题、改务、能源等行业,安全商与可审计 源管理挑战:当数百基至上干张A芯片形成复杂计 能力将成为Agent生产部署的基础门格, 集群后,如何持续、高效地润度这资源,成为 资源可神缩:从周定规格到按任务分配 Agent具有高并发、超生会周期特点,未来可网 样放A基她设施价借的关键, 配向大规视任务,支持资济服合 时运行百万级任务实例,基砖设施案要支持以“每 04西是购:通智存协网调度 ·多个超节点通过高速互联形成统一算力资源池: 会话一个沙箱”方式快速创建和销股运行环填, Agent应用的执行过程天然跨越多个资源域: 其力调度,就是超节点集群的“操作票统”,它通 支撑干卡级训练、大规模推理和跨节点PD分离。 通算资源:负责任务编排、工具调用和执行环境: 过资源池化、任务编排、弹性调度和故障管理, 核心能力包括: 底算力转化为稳定,高效的Token生产力。 配向小规模任务,支持资源切分: ·基于快期恢复实现率秒级冷启动: 智算资源:负美硬型推理与决策生成: ·超节点级:将数否卡超节点划分为多个逻错费源 ·单机支持数百至上干Agent实例高密度部署 AI存健资通:负责上下文状态、知识和长期记亿管 面对企业级A生产,调度平台需要解决三类心问题: 域,支持多个业务商运行: ·大容量、高带宽内存支撑高并发状态运行。 理 ·资源高效利用:如何让不同规模,不网奥型的A 单卡级:通过vNPU等虚拟化技术,将单卡切分 任务共享超节点资源,提升整体资游利用效率: 为多个计算实例,提高小模型资源利用率 这一常求推动通算从传统服务走向超节点形态: 未来Ainra离要打通三美资源,实现统一感知和 ·负载动态通配:如何根据业务请求变化和模型 只有具备大内存、高带宽和芯片间高速互联能力的 同调度: 行状态,动态匹配计算源,保障稳定服务能力: 资源可流动:从静态占用到动态复用 系统级架构,才能支Agent规换化运行。 ·通算与智算协网调度,根据任务需求动态匹配计 ·集群持续运行:如何通过故障检测,任务迁移和 AI负载具有明显逛汐特征:白天在线推理需求高 资源: 资源恢复机制,保障大规模A集群长期隐定运行。 峰,表间训练、调和数据处理任务占主导,如果资 D2二是:从服务可靠到任务可靠 ·计算与存储高效的同,降低上下文和状态访问随。 源长期图定绑定,容层造成高峰不足,低谷闲置。 1、弹性调座:让节点资道“案调用” Agent任务正在从分特级交互走向小时级甚至天级 最终目标让Agent的*思考、行动、记忆”形成 超节点提供了高密度计算能力,但企业A负载具有 因此,调度系统需要基于业务优先级实现动态费源 自主运行。前治编码Agent单次连续运行已达到25 统一运行体系,实现从资调度到智能执行的一体 高度不确定性:一方面,大模型训练和高并发推理 复用: 小时,传统“服务99.9%可用”已无法演足长期任 化支撑 要数百基至上干卡协同:另一方图,OCR、 ·核心生产推理任务获得确定性资保障: 务可性。 Embedding、语音、小模型推理等大量任务只需 ·低谷时放资通自动投入训练、微调等离线任务: 未来展望:走向酒智合超节点 要少量资源 ·高优任务列来时,低优任务支持暂停、迁够成障级, 未来通算平台需要具备:持久化执行、任务状态检 当前A基础设施正在形两类超节点:以NPU为 查点、新点续跑与跨节点迁移、与A存储结合的上 核心的智首超节点,以及以CPU为心的通算超节 因此,调度系统需要改变传统服务器时代“一次分 通过调推湿部,沙用和优先级调度,将时阅维 下文长期保存能力,可喜性标准正在从“服务不中 点,但Agnt应用天然融合“思考”与“行动”两 配、长期占用”的资速使用方式,让算力能够根据 度上的闲置算力转化为有效Token产能。 ADC日书2026 一出C中心的45
OCR:IMG:2、高可用调度:让AI服务从“可运行”走向“持续 -优先保障Decode持续运行: L4-Al服务平台层:Token生产闭环的最后一环 运行 ·通过降低Pref资游弹性收短期冲击 超节点集群将大量计算芯片、高速网络和存储组成 Allnfra的最终目标,是将底层计算资持续转化为 二者共同完成从底层计算资源到企业级A服务的能 ·结合任务迁移、状态恢复和跨节点重润度,降低 复杂系统,规模越大,单点故障概率越高。对于金 可交付、可运营的智能能力。超节点提供高效算力 力转化。 故障影响。 、能源、改务等关键业务,A服务不仅需要运 供给,算力调度提升资源利用效率,而A服务平台 进一步连接模型、数据与业务应用,完成从算力资 根型运行:释放AI算力价值的核心软件引掌 行,更要长期稳定运行。 未来高可用目标,是让故障从“服务中断事件”变 游到智能生产的价值转化 硬型运行主要包括推理引攀和训练引。 成“资调整事件” 因此,高可用调度需要从单点保护开级为面向业务 A服务平台主要包括三个核心能力层: 雅理引擎负责将训域完成的模型转化为持续输出 连续性的系统保障。 3、图能调度:从资理管理走向A生产优化 Token的生产能力。 传统调度关注:哪些有空闲资源?A时代需要进一 模型运行服务:将算力转化为Token生产能力 多级部著:控制故障影响范围 步回答:“什么资源,在什么时间,以什么方式服 通过模型部署、推理优化和行管理,实现稳 代表技术包括MindIE、vLLM、SGLang等,其核 通过多层级资源隔离和余部署,实现放障隔离: 务什么任务,能够产生最大业务价值? 定、高效的模型推理服务: 心价值在于,在有限硬件资速下,通过模型优化、 调度优化和款硬件协同,最大化Token生产效率。 超节点内: 医此,调度系统正在从资普理平台演进为A生产 数据基础服务:让Token具备企业知识力 随着大模型进入生产阶段,推理引擎正在从“模型 通过多实培图,持低单卡或模块故障影响: 优化系统。 通过知识库、数据管理和上下文服务,将企业 执行工具”演进为“A|运行时平台”,主要体现在 数账转化为模型可理解、可调用的智能资产: 三个方面: 集群内: 感知:建立AI负像 不同模型、不同任务具有不同资源特征:计算密 Agent运行环填:让Token驱动业务行动 01 跨超节点部署,挺御节点级故障; 度、内存容量、内存带宽、通信模式。调度平台需 通过Agent框架、工具调用和任务输排,使模 第一,从锁型适配走向系统协同优化,推理引 要形成模型级、任务级算力面像,实现精准匹配。 型输出进一步转化为业务流程和自动化执行。 攀需要支持MoE、多模态、长上下文等复杂 数据中心间: 模型,并与超节点、网络、存储惠统协同设 跨地域部署,应对机房级灾难。 预测:从被动扩容到提前规划 三者共同构成从算力一Token一知识一行动的 计,实现端到端效率提升。 传统扩能容依赖实时阅值。末来调度将结合A预 测:预测业务流量、提的准备资源、助态调整算力 暂能生产闭环,推动AlInfra从资源供给平台演进为 -02- 调度范图覆盖到那里,故障限离能力就冠伸到都里。 面向业务价值创造的暂能生产平台。 供给,从“看到需求再应”,走向“预测求提 第二,从单实例优化走向集群级效率优化,通 前布局 1、硬型运行与服务:算力转化为Token的核心引 过PD分离、KVCache管理、连续批处理等 智能恢复:从故障恢复到业务连续 节点提供高密度算力供给,模型运行与服务负责 机制,提高整体吞吐能力,降低单位Token A推理不同阶般的重要性不同,在PD分离架构下: 决策:面向业务价值的全局调度 将这些计算资源转化为可持续交付的A能力,这一 生产成本, -Decode直接影均用户当前生成体验: 未来企业可能同时拥有:多个超节点、多代算力资 源,调度系统案要根据业务价值,在全范围优化 层包括两个核心组成: -03 -Pre主要影新请求进入速度, 资源:高优任务优先保障、低优任务弹性运行、异 型运行(ModelRuntime):决定Token生产 第三,从模型服务走向智能任务运行,随着 因此,面对资源波动或故障时,调度系统需要具备 构资源统一利用。 效率: Agent、多轮交互和复杂工作流尚起,推理引撑 业务感如力,例如采用“继P保D”策略 模型服务(Model Serving):决定Al能力交付 需要支持更长周期、更复杂的智能任务执行。 效率 AIDC日书2026 公众号·智能交通技术
OCR:IMG:马海旭 魏凯 华为公司副总截、ICT产品组合管理与解决方案部总裁 中国信息通信研究院人工智能所所长,工业和信息化部人工智能标准化技术委员会(MIT/TC1)秘书长 Agentic时代的到来,正在深刻改变AI基设施的成层逻辑,超节点成为训推算力集群建设常态,层次化KV 当前,人工暂能技术加速演进,大模型与Agent应用不断深化,面向A原生负载的AIDC正成为算力基础没 成为提升Token效率的关键手段,通智合、数智合成为支撑万级Agent、EB级多模数据的核心: 级的主要方向,本白皮书立足产业实践,系统梳理了AIDC的技术体系与建设路径,围绕AIFaciity、 与此同时,传统的数据中心运维运营模式正在失效,这章味着AIDC的规划与建设迈入全新阶段。这本白皮 2024年发布第一版,凝聚了华为在AlDC额域的初步实践与思考,过去两年,随着AgenticA在各 、AlAgent等族心要素明确了关键技术要求,并对智能体时代的算力需求特征、Token服务能力评 方向进行了深入探讨,白皮书兼具体系性与实操性,对凝聚行业共识、推动产业发展一定能够起到 行业的加速落地,我们参与到大量的客户建设实践中,积累了丰富的经验,并对AIDC的未来发展有了更深刻 因此,我们在第一版基础上进行了全面刷新,自皮书详细测述了Agentic时代下ADC的趋判断、 重要的引领作用。 创新范式、规划与建设、运营与运维等,希望为全球AIDC规划与建设提供价值参考,为全球暂算基础设施的 高质量发展员献力量。 王磊 刘康 中国太平洋保险集团CIO 华为公司iCTMarketing与解决方案销售总裁 Agent正全面深入智能服务、风险决策等核心业务,智能应用的规模爆发,让算力成为企业暂升 模模型训练到生产级实时推理,Token产出效率正成为衡量智算基建价值的核心标尺。AIDC绝 级的核心制约,AIDC也由此跃升为支撑业务创新的战略生产系统,当下模型技术快速选代、应用场展持续更 非传统IDC的算力堆磁式扩容,而是涉及算力说度、存算网联动、供电敬热的系统工程,直接决定芯片算 对A数据中心的动态适配与演进能力提出更高标准。企业暂能化建设,基础没施著地只是基础,能否紧 业务价值的转化效率,是大模型和Agent规模化落地的核心底座。这本白皮书系统梳理了AlDC的技 模型选代节奏,让算力持续高效赋能业务、落地真实价值,才是规模化智能转型的核心关键,本自皮书立足资 术演进逻调与可落地的架构方案,汇聚金、医疗、大型智算中心等多个行业兼具前确性与实操性的标杆 入到业务产出的全链路视角,系统拆解ADC的建设逻调与运营范式,为企业精准评估智算投资、搭建 。希望这整沉淀能为不同规模、不同阶段的企业提供有益借盗,也期待与产业同仁在实中持续 配智能时代的算力底座、驱动业务长效增长,提供了极具落地性的专业参考。 素、共网完善。 公众号·智能交通技术
OCR:IMG:Knowledge:让Agent遵企业逻辑规划执行任务 Data:为Agent构建可溯源、可校验的事实数据 企业知识(Knowedge)是企业共享、长期积累并 企业本体资产的构建、运营与治理,可依托Agent Data是Agent理解环境、判斯状态和执行任务 稳定、可信的数据供给。 经过治理的认知资产,通盖制度文档、业务规 平台实现,由本体建模Agent、业务专家、应用验 的事实基础。Agentic时代下,数据湖、数据仓 范、行业本体、知识图谱、流程经验与可执行业务 证Agont三类角色协网推动本体模型从设计到应用 库、B1、主数据和数据治理平台仍会续存在,数 Data与Knowledge在统一的数据底座上形成协 规则等,让Agen真正理解本行业、本组织和本流程, 的亮质量落地。 据建设的主要变化是从”人消费数据“转向“模型消费 同,Data是多模态数据湖中的原始事实, 数据”,这一转变也重构了企业数据底座的设计退辑。 Knowledge是构理于其上的语义层——从同一份数 企业知识的建设面临一个根本性矛盾:知识分散在 本体建模Agent:将领域如识转化为 据中,通过本体建模和知识抽取提练出实体、关系 文格、流程、系统和人脑中,而Agont需要的是结 符合语义规范的本体模型,提供自动 企业数据底座需要从以结构化数据为主的数据潮 和规则,数据提供“有什么数据”,知识湖提供“数 构化、可推理的认知资产。解决这一予盾,需要构 化建模与一数性校验能力: 仓,演选为面向Al的多模态数据湖(Multimodal 据是什么章思',Agent在推理时,通过数据资产目 建知R湖(KnowledgeLake)-—在统一的数据 DataLake).结构化数据提供精确事实,如订单 录发现“可以消费什么数据集”,通过知识目录理解 底座之上,通过语义化加工将企业隐性经验转化为 业务专家:从业务语义与领域规则角 金额、库存数量、客户等级:非结构化文档提供业 “这些数据对应什么业务含义',通过元数据目录验证 Agent可消费的结构化知识资产,知识湖的建设道 度参与建模,审阅并优化本体模型的 务语境,如合同条款、尽调报告、合规文件:图 “数据在即里、是否可信”,这三个日录共同影明 指”采集一抽取一建模一服务“的递进路径。 概念定义与关系语义,确保准确反映 像、语音、视频与日志提供现场过程与行为证据: Agen推理精准度. 真实业务逆辑: Agent Trace与用户反馈则提供持续优化所需的 来集层对接企业多源知识载体,包括制度文 运行数据。多模态数据湖的核心,是实现不同形态 因此,企业数据建设应遵“数据入湖一语义标 、操作手册、FAQ、历史工单等非结构化 应用验证Agent:面向具体场景进行 数据的境一治理与统一授权,为知识与Agent提供 注一知识构建一Agent消费”的道进路径, 数据,以及业务系统中的结构化规则。 语义推理验证与应用测试,评估本体模 型在智应用中的可用性与有效性。 Model:面向任务提供灵活组合的模型服务 抽取层利用大模型从非结构化文档中自动提取 Agent时代,企业Al模型建设的重点正从“选择一 任务复杂度、时超、成本、安全等级与模型可用 实体、关系与业务规则,经过人工审核校验后 三类角色通过平台协同机制,形成知识建模、业务 个最强模型”转向“运营一组适配不同任务的模型服 性动态选择模型:高可用保障,具备限流、络 形成高质量的“事实一事理“三元组。 校验与应用验证的闭环,持续提升本体资产质量。 务”。通用模型、领域模型、小模型、多模态模型 断、重试、Falback、灰度发布与快速回浪能力. 与推理模型各有透配场损,企业通过模型组合在能 力、成本、时与安全之间取得平衡,实现这一转 观测体票:是模型服务工程化的关键,包括模型级 变,需要两个关键工程组件:模型网关与现测体系, 观测与Agent请求级观延两个维度。 建模层以本体(Ontology)为语义骨架,定 服务通过语义映射、规则引和标准API 文企业核心概念体系与约规则。没有本体, 向Agent提供查询、校验与推理服务,使 模型网美:模型网关是Agent访问模型服务的统一 ·模型级现测:服焦模型服务的效能、成本与可用 知识图进就是一盘散沙:“供应商“和”供货商 Agent能够沿着'实体一关系一约束'的路径 入口,所有Agen均模型的调用,都应通过模型网关进 性,核心深集调用量、Token吞吐、明应冠迟、 会被当作不同板念,“张三“和'ZhangSan 形成可解释的判断。 入模型池,避免各业务系统直接期定单一模型AP1 误率、单Token成本及租户用量等关键指标,盖 会被作为两个实体导入。本体将RDF、OWL 限流、降级等异常事件统计。 等标准定义的概念和关系嵌入Agent感知、推 模型网关选型应重点关注四类能力:统一接入,支 理、决的全生命用期,从根本上解决“数据 持私有化开源模型与公有云模型的统一纳管:精 ·Agent请求级观则:面向任务全链路可观测,记 是什么章思”的问题。 细计量,支持按Agent、任务、部门、模型与租 录链路标识,模型与工具调用路径、Token消 户进行Token计量与成本归集:策路路由,按 耗、任务状态及业务结果,墨盖人工接管等异常场展。 AIDC白书2026 公众号·智能交通技术
OCR:IMG:02 66 每一次产业革命,都以基础设施的重建为先导。当智能需求的选代速度超越建设 周期,数据中心的规划逻辑与工程标准必须整体重写。新范式不止于架构图上的 第二章 设计,更要落成可建设、可交付的工程体系。 AIDC规划与建设 2.1 Agent-Centric应用与生态 进入AgenticAl时代,企业Al应用正从单次硬型 设以Agent为中心的应用与生态,推动A真正入 调用走向长周期、复杂任务的完整交付,实现从 核心生产场景。 Token”到“任务”的本质联迁,这要求企业理 围绕“AKDM”参考框架进行规划 欧 Agent进入企业核心生产消程,单靠模型能力运 Knowledge:提供企业认知,将业务规则、流程 远不够,它离要知识来理解业务边界,需要数据 经验和本体沉淀为可复用资产 来支撑精准执行,要模型来动推理决策,围境 AKDM”框架建设企业AI应用与生态,是A规模 Data:提供可信事实,让每一步执行基于准确、实 福 化落地的关键: 时、可追溯的数据 Agent:承担执行中柜,把相织的意图转化为任务 Model:提供推理引擎,支撑理解、生成、判断和 和行动 规划 应用/江具 网关 Agent 型 知识 数据 ModelA Model B ... 一 通算 存结 智算 图2-1国AKDM考架行规划 AIDC白书2026 公众号·智能交通枝术
OCR:IMG:AIFacility新建与存量场景落地 液冷改造方案需要结合项日规模灵活选型,小规模 【小结】 改造场景,可选用分布式ECU、风液CDU等分散式 Wa-Centic:在物理约束中系统性地可找最优解 新建场景部要原则 方案:中等规模改造项目,采用标准化液冷POD模 数据中心的核心目标正在从“提供资源能力”转向 针对算力常求波动大、硬件选代续的行业特征,算 敬挂”的三阶顶层原则,实现基没施给与业务发 块实施部署:冷源系统充分结合原有设施现状,因 “让每瓦特电力输出更多的有效Token”,对于Al 力基础没施建设应确立“长期储备、中期规划、短期 展的动态匹配。 地制宜选择利旧改造或全新增设,优先选用预制集 Facity而言,关键挑战在于如何以确定性的物理基 成冷站维短拖工周期。 础设施,去承载能源供给、硬件演进和A/负载变化 带来的不确定性。 长期储备 供配电改造立足现有系统猫序渐进推进,针对机柜 (3-10年) 前置统筹土地、电力等长用期稀缺资源,为远期广张预留空间 末端配电回路退行专项升级。新增电源系镜采用预 未来AlFacity规划离要重新审视三个核心同: 制模决化产品,末端配电优先选用智能母线或智能 能源如何高效供给、空间如何灵活演进、建设如 列头柜,透配不阅功率算力机柜。 何快速响应,解决之道在于从静态蓝图转向弹性架 中规划 建立业务需求滚动预测机制,将新模型上线节奏、暂能化业务落地计划等 (1-3年) 构,在润察A负载长期演进趋势的基础上,通过预 核心变量纳入预测模型,动态更新算力需求基线 此外,需提前复核楼板承能力,通过结构加图 留空间换取代际兼容能力,通过模块化设计支撑敏 或机柜稀疏排布满足荷载要求:层高受限项目利用 捷扩容,通过系统协同实现能源、空间与算力的最 短期敏捷 依托模块化、预制化算力基础单元,实现现场快速部署上线,支持按业务 BIM建模开展风险推演:同步借助仿真工具优化机 优匹配。 (0.5-1年) 增量弹性扩容 房气流组织;同时保证场内设备图运通道净高不低 于2.5米,满足整机柜进场施工条件。 基于上述原则,新建项目可泪两类路径落地。 存量场最改造 当前存量数据中心大多以低密风冷机房为主,普返 模式一(土建+大机电先行):业务详细求南未 存在风冷向液冷升级条件受跟,配电容量不足、楼 完全明确时,结合频判的功率区间、风液配比,提 板承重与室内净高不达标的多重约束。改造路径可 前应动大型机电系统建设:待机柜规格、负载离求 参额以下三项硬性指标进行判定: 明确后再推进末端小机电实施,整体就绪周期可压 至3个月左右, 桂板承重>12kN/m 机房净高≥5.4m 模式二(土建+大小机电模块化预研、框架采购先 电力余不低于现有IT峰值负载的1.5倍 行):提前约一年完成机电系统标准化、模块化产 品开发,同步开展柜架购、供应商滚动备货:业务 三项条件全部达标,具备改造为风液泥合机房的基 求正式确定后,约3个月即可完成现场交付落惑。 :仅部分据标达标,优先部著高能效风冷服务器 掘算力潜力:三项条件均难以满足,则建议有序 弹性建设理念贯穿完整周期:长期阶段锁定稀缺 关停、资源置换。存量改造的核心思路为“以高换 资源边界,中期持续收效需求方案,短期以标准化 低,依托单机柜算力密度提升,用少量高密机柜 POD单元敏捷落地扩容, 换大量伍密机柜,盘活有限机房空间。 AIDC白书2026 公众号·智能交通技术
OCR:IMG:KVCache不再属于单个实例,而成为整个计算域 3、超节点多种形态:可满足大中小场景高性能推理 4、超节点发展趋势 光互联为下一代核心方向,NPO近封装光学是关键 共享资源,结合KVCache感知路由,可以优先调 需求 超节点正在从技术探素走向产业规膜化应用,成为 技术路径。 度已有上下文级存的实例,从而减少重复Pre 对于中小规模场景,可以果用64卡/96卡等不同规 AI基础设施演进的重要方向。未来,超节点将围绕 跨低TTFT、提升整体Token生产效率。这标志着推 模超节点,部署不同规格的PD分离大EP实例,满 三个方向持续演进: 第三,资持续解据:随着推理、多模态和 理系统从“计算模型”走向“计算+状态管理模型”。 足高性能推理要求: Agent任务复杂化,计算、内存和通信需求 第一,规模持续扩大:超节点规模将持候突破传统 日趋差异化,未来超节点需要支持:AF分商 64卡超节点 96卡超节点 服务器集群边界,支撑更大规硬训练和推理,未来 (Attention-FFN Disaggregation,BAttention PD分离大EP部实例 PD分南大EP部著实例 超节点规模将从干卡演进到万卡, 与FFN/MoE模块解据部署)、多模态VAT(视觉 2 3 格1 2 03 -音频-文本多模态模型架构)以及LLM分离(大语 4P+2D 6P+1D 6P+2D 6P+3D 8P+2D 9P+3D 第二,互联持续升级:随着超节点规模持续扩 言模型不同组件拆分部署)等新型部署模式,最终 大,网络互联成为决定系统效率的关键,超节点网 目标是:让不同A工作负载都能够动态获得最通合 正从微秒级向纳彩级时延演进,通过Tbps级带宽 的计算资源 护在- h# 0 书点 点 oB 可 9 点 FEN 护点 护点 格 护E 点 护E h 点0 点1 点2 和更高效拓扑,实现计算资源之间的高速协同,与 此网时,传统电互联遭遇高频损耗与功耗瓶项: L2-超节点集群:万亿MoE模型高并发部看的基础架构 图2-17中小规楼超节点部著配置 02 面向大规硬高并发推理、模型训练和核心生产场 超级计算系统,更 超级计算系统,更重要的是,超节点具备逻辑切分 超节点提升的是单一计算域的协同效事,而超节点 能力, 集群进一步解决A规模化生产问题,将多个超节点 景,越节点可以扩展至数百基至数干卡规模,形成 与网络、存继融合为统一AI生产系统。 生产运营:支挥多业务、多模型并行运行 企业级A需要同时承载多个硬型、多个业务和 数百卡一数干卡大规模超节点 1、节点集的典型应用墙景 大量用户请求,超节点集群通过统一资源池和 企业建没超节点集群,本质是为了满足A进入生产 弹性调度,实现计算能力横向扩展。 退属商1 2 弹性可弄 还辑离 阶段后的三类需求: 2PD3P+D P.2D SP+1D 6P2D 6P+30 8P+2D 4P-30 01 03- 规模扩展:支撑业务持续增长 可行:保障心业务连续性 西店 BEN 3 P4 以盈 合司 自 R地 家 B医 名清道 出海 F城 D 传 1 口 节 特 打营 营: 梦 节 节 节 点 从A试点到规模化应用,单个超节点会逐渐受 当A进入金、政务、制造等关键流程,集群 中 对尚中 售女 真 南 商茶 点 格 量 20 2 22 2 到香吐、并发和业务隔离限制。通过 通过故障隔离、服务迁移、滚动升级和容灾部 Scale-Out扩展多个超节点,企业可以平酒 要,将A从单实例服务升级为可靠生产系统。 提升Token产能,而无常重新建设基础设施, 图2-18大模超节点署配置 AIDC白书2025 公众号·智能交通技术
OCR:IMG:一份给CIO规划建设智算数据中心的参考 中国建设银行、华为技术有限公司 联合发布单位
OCR:IMG:中国建设银行 HUAWEI AIDC白皮书2026 的严中,出的我它,产品名,报务名以是公司称,由各应的所有人有, ,是为本相司者注标,在子中及本子述 ,可实均量与限息有很大的别,国此,本文信自仅参考,不任的求通,华为不对也在本文 本文可能生有测信息,担作不期于有关来来的务,营,严品系列、折性术等信息,由于定中存在多不比因 上做出的向行为承报征,单为可能不改上述息,都不别行通知, 非经牛为技求有限公司面可,任间单个人不自,本手内的份或全,并不式 权用存+禁为接末有期公司2026,保一切视利 公众号·智能质通
OCR:IMG:量,反映用户感知的生或速度:后者表示能入与输 ·长文本生成、代码生成等场景,请求致量较少但 企业AlIntra建设的目标不是地单地叠最大算力,而是在性能、香吐、成本和质量之间找到最佳平断,构 出Token总理量,反映系统整体吞吐能力。 单请求持续输出大量Token,核心诉求是提升单请 四配业务需求的Token生产系线 求生成效率。 QPS(QueriesPerSecond,每秒调求数)衡 Token生成效率的关键约东和核心技术 量系统单位时间处理请求数。 或本效率(Cost):性价比指标 衡量生产一定数量有效Token所需要投入的资源或 Token生产效率的提开,本额上是图大硬型推理 提升推理数据访问和搬运效率展开,包括提高计算 企业真实的工程目标不是“生成更多Token”,而 本,包热硬件折旧、电力消耗、网络传输、存储以 全链路斯的持续优化。着模型规模扩大、上下 单元利用率,提升存储带宽、优化通信效率,以及 是在调足用户体验约乘的条件下,持接生产更多 及软件优化成本, 文长度增加以及实时交互需求提升,推理过程中的 针对KVCache的高效暂理、存健和访间。 有效Tokon,这可以用有效TPS来衡量,即:在 百万Token成本(CostperMilionTokens) 性能核心瓶领正在从“计算能力”转变为“数据流 TTFT、TPOT等用户体验约束下,系统实际产生 量Token生产经济性的核心指标。随着硬型优 动效率 “数据流动效率”或为推理的核心瓶颈 的Token总量,是衡量A集群真实生产能力的核心 化、硬件升级和殖理效率提升,单位Token成本 一次完整的大硬型推理过程包括Pref(预填充) 指标, 持续下降, 因此,从A芯片微架构到系统级的计算、存储、高 和Decode(解码)两个级,两者对庭层芯片与 速互联协间设计,整个技术栈的演进重心都在围绕 系统架构的需求存在本质差异,如下表所示: 评估AlInfra并发吞吐能力,必须结合具体业务负 生成质量(Quality):服务有效性指标 载,而不能只看单一TPS指标,这是因为不间业务 衡量Token是西准确、定且满足业务要求,速 场景的并发在吐优化重点也不同,比如: 度与规模代表生产力,高可信可用的Token才是 Pretll Decode ·智能客报等短问答培景,请求频率高、单请求输 业务价值的真正载体。一般包括内容生成的准确性 出短,核心拆求是提开QPS和并发承载能力: 和一效性等, 用户输入Prompt后,一次性并行处理全 处理过程 量Token,完成Atenon运算并生成KV 硬型按自回日方式逐个预测下一个Token Token生产效率评价指标体系表 Cache 评价维度 评价指标 指标说明 计算特证 Token之间高度并行,超计算密集 Token逐个生成,串行计算,数据访问 应性 TTFT 衡量前Token应时间,决定用户等待体验 (Performance) TPOT 量连续Token生成速度,决定流式交互体验 每秒Token处理量,量单位时间Token理 大规模矩阵运算 数据供给,受限于内存带宽 井发香吐 TPS 力,包括OuputTPS和TotTPS 性能膜 (Compute-Bound) (Memory-Bound) (Conourrency) OPS 每秒请求数,衡量系统单位时间处理请求数 成本效率 百万Token成本 衡星单位Token生产成本 力优化: 数据流动优化: (Cost) 显升A芯片计算力 -KVCace压缩、共享和分居管理 准确性 衡量输出结集是西流足业务要求 优化方向 优化TensorParall等井行路 提升内存容量和带宽 生成质量 (Quality) 一款性 量信出稳定性和可靠性 ·提高模型算力利用率(MFU,Model FLOPs Utiization) -优化芯片间高速互联 可信度 衡量结果是否可验证,可审计 PD分离后匹配高算力烫 -PD分后匹配高带宽资 ADC白书2026 一设数量中心的(25
OCR:IMG:长上下文加别数据搬运压力 “存算刀差”进一步放大瓶颈 Al推理芯片的关键指标成为Token生产效率核心硬约束 CDeepSeekV4Flash模型(数284B)处 近年来,A芯片算力的增长速度远超内存带宽的增 对于A芯片来说,以下4个指标影响Token生产效率: 理128k长文本为例:单次请求离要挂留约288GB 长速度(内存增加别),以英伟达的H100到B200 模型权重和KVCache状态,这味着在Decode 为例,在低精度推理算力上提升了4.5倍,而内存 阶段,每生成一个Token,都案要从总规核达数百 带宽仅升约2信,算力联升够著地Pref, GB的驻留数据进行调度访问,在此过程中,芯 但Decode因受限于带宽而难以获得网等收益, A博力 口内存容量 片计算单元往桂仅需不到0.01毫秒即可完或计算, 算与数供给之间的鸿沟持续扩大, FLOPS-每秒浮点运算次 GB一芯可同时教的数 其余99.9%以上的时间都在*等待数供给” ,T(T)、力 定们大,少并户,不对 快,力TFT 卡,长净上下文行 Decode的核心不已相底从算得快”演进 为“图得快” 售线:TTFT :CPS开-上下文度 内存墙:A力与内存带宽增长对比(2018-2026) 内存带宽 互联带宽 力(TFOP)增度过内有,成购性 GB/s一从片上内存读取数的该度 GB/s一芯片间教里交换速度 相(20) DTD 30 菜 存—力在等,才良实用孩 2408 258 电:TPOT 自涂彩牌:维的有费TPS 20倍 差距正在扩大 15 2 10 . 图2-7决定Token生产效四个留标 58 168 2.4 408 20 约4倍 2018 2019 2020 2021 2022 2026 2026 模型推理性能受于其中短木板,所以这4指标之间的比例关系,能更好地反映A芯片推理性能均病性,包括: (T 力带宽比=AI力(TFLOPS)+内存带宽(TB/s) 算力带宽比用于判断芯片适合计算密集还是访存密集负载:比通高,适合训练与Pre推理:比值低 S型9 力 AAE 日的不中 通合Decode与在线推理 25 8长 大 AFNREN7 PS. 本国作批A院 内存力比=内存容量(GB)+A算力(TFLOPS) 内存算力比决定单卡额装下多大的硬型、保留多长的KVCache。比值高,更适合长上下文、高并发 周2-6:内存填:A1力与内存增长对比(2018-2026) 理,Agent期发使超长上下文成为常态,A芯片设计的趋势是系统性提升内存算力比 因此,大模型推理的核心期颈正在全面从“提开峰 生产效率的竞争,本质上是芯片访存、互联传输与 对于A芯片来说,算力再强,如果内存用宽不足,Decode依然会受限:内存再大,如果互联 值算力”转向“提升数据报运效率',未来Token 系统级数据流协同调度能力的综合竞争。 法支撑大规现MoE协网。 ADC白书2026 一地规理图数中心的2
OCR:IMG:突破Token生产瓶颈的关键技术 资理需求冲突:Prefi是高算力消耗型任务, 2、图绕数据流动效率的三大优化方向 随着Agent任务复杂度持续提升,多级分布式KV 除A芯片微聚构革新外,AlInfra的核心演进方向也 Decode则是高带宽消耗型任务。 在此基础上,进一步图绕数据流动效率开展三个方 Cache已成为AllInfra降低推理成本、提开提源利 是聚焦于数据流动效率:让不间阶段匹配不同资 向的优化。 用率的关能力。 ,让数据更少微够、更快到达计算单元。 润合部图互相拖累:长Prompt的Prel请求占 用大量计算资源,影明Decode的实时响应:而为 减少数据搬移:降低无效访问 提升数据供给能力:增强单节点Token生产效率 1、架构层重:Prefill-Decode解分离 了保障Decode的低时延与SLA,系统又必须膜 随着上下文长度与对话轮次急剧账账,KVCache 即使减少了无效数据搬移,随着模型规模持续增长 传统方案将Pref与Decode在网一期中,易引 留内存与算力,导数Pref算力利用奉低下。 带来的存储与传输开销成倍放大。核心思路是尽可 和上下文不断加长,单个计算节点仍然面格巨大的 发费源配与性干犹(Head-of-LineBocking): 能复用计算结果、减少不必要的数据搬够: 数据供给压力。特别是在Decode阶级,模型参数 和KVCache需要持续供应给计算单元。因此,Al KVCache优化:通过压绝、量化、淘达和高效管 Infra需要提升整个节点的数据供给能力,让计算单 调度器 理策略,降低KVCache的存然规模和访问压力: 元持续获得所案数据,减少“等数据”的空转时间。 如vLLM的PagedAttention,通过分页式管理提开 KVCache利用效率, 高有效带宽存储体系:结合高规格存储介质、先进 封装与数据压缩/量化技术,全面突碳存储吞吐瓶 Prefil集群 Decode集群 PrefixCache:复用公共的上下文的计算结 题,最大化提升送入计算单元的单位时间有效数据量; P实制 P实例 D实列D实例 D实例 果,避免重复的Pre计算,大榴减余数据生 KVCache 成与搬运,用于多轮对话、固定SystemPrompt 算存网协网设计:优化CPU、NPU、SSD之间的 推理引vLLM 推理引VLLM 及Agont工具链调用等场票: 数据流动路径,减少数据搬移开销,如华为NDS 智算服务器 智算服务器 (NPUDirect Storage)等,通过数据直通技术 多级KVCache聚构:利用片上内存、DRAM内 短数据访问路径: 存、SSD等不网存储层级,根据数据访问频率进行 热温KVCache的分级管理与动态调度。 超节点蒙构:通过高速对等互联总线,将多个A芯 片组织成统一计算单元,突破单芯片和单服务器资 构建片上内存+DRAM内存+SSD多级KV存 源限制,提高单节点模型承载能力和推理吞吐,例 参数面网络 如华为屏腾Atlas超节点等。 片上内存 十-百|1活V 优化跨芯片数据流动:突破大规模模型扩展照 图2-8Prefil1-Decode(P-D)解分商 DRAM 随着模型规模不断扩大,尤其是MoE架构逐渐成为 -TB|最|KV 重要方向,模型参数和计算任务被分布到多个芯片 P-D分离架构通过将两个阶段拆分到不同资源池, Decode集群:侧重访存带宽与通信互连, SSD 甚至多个节点,此时,颜颈不再只是单个芯片内部 实现异构负载的最优匹配: 提升单位时间Token产出速率(TPOT) -PB|KV 的数据访问,而是不同计算资源之间的数据交换效 车,因此,需要进一步优化跨芯片、跨节点的数据 -Pre集群:侧重高吞吐与算力利用率,通常采 其本质是解决推理阶现之间的资源错配问题,让计 说动,让分布式计算资源形成高效协网的Token生 用高算力密度芯片,短首Token时延(TTFT)。 算资源与业务负载更加匹配。 图2-9多层级KV级存 产系统。 AIDC白皮书2026 公众号·智能交通枝术
OCR:IMG:马海旭 魏凯 华为公司总载、ICT产品组合管理与解决方案部 中国信息通信研究院人工智能所所长,工业和信息化部人工暂标准化技术委员会(MIT/TC1)秘书长 Agentic时代的到来,正在深刻改变A基础设施的底逻调,超节点成为训推算力集群建设常态,屠次化KV 人工暂能技术加速演进,大模型与Agent应用不新深化,面向AI原生负载的AIDC正成为算力基 为提升Token效率的关键手段,通智合、数暂合成为支撑万Agont、EB级多模数据的核心: 的主要方向,本白皮书立足产业实践,系统理了AIDC的技术体系与建设路径,图绕AFacilty、 与此同时,传统的数据中心运维运营模式正在失效,这章球着AIDC的规划与建设迈入全新阶段,这本白皮 fra、AlAgont等械心要素明确了关键技术要求,并对智能体时代的算力需求特征、Tokon服务能力 2024年发布第一版,凝聚了华为在ADC领域的初步实践与思考,过去两年,随着AgenticA在各 方向进行了深入探讨,白皮书兼具体系性与实操性,对限行业共识、推动产业发展一定能够起到 行业的加速落地,我们参与到大量的客户建设实践中,积累了丰富的经验,并对AIDC的未来发展有了更深划 只,因此,我们在第一版基础上进行了全面新,自皮书详细述了Agentic代下AIDC的追判断 重要的引额作用。 创新范式、规划与建设、运营与端维等,希望为全球AIDC规划与建设提供价值参考,为全球暂算基础设用的 高质量发策类献力量, 王磊 刘康 中国太平洋保险集团CIO 一华为公司CTMarketing与解决方案销售总 Agent正全图深入智能服务、风险决策等核心业务,暂能应用的规模爆发,让算力或为企业暂升 模模型训练到生产级实时推理,Token产出效率正成为衡量智算基建价值的核心标尺,AIDC绝 级的核心制约,ADC也由此联升为支业务创新的战随生产系统,当下硬型技术快速选代,应用场持续更 8传统DC的算力地确式扩容,而是涉及算力调度,存算网联动,供电数热的系统工程,直接决定芯片 对A数据中心的动态适配与流进能力提出更高标准。企业暂能化建设,基础设施落地只是基础,能否 业务价值的转化效率,是大模型和Agent规模化落地的核心底座,这本白皮书系统植理了AiDC的 模型送代节奏,让算力持续高效赋能业务、落地真实价值,才昆规模化智能转型的核心关键,本自皮书立定资 术演进退与可落地的架构方案,汇服金购、医疗、大型智算中心等多个行业兼具前增性与实操性的标杆 入到业务产出的全银路视角,系统拆解ADC的建设逻调与运营范式,为企业精准评估暂算投资、搭速 希量这些沉定能为不网规模、不网阶段的企业提供有益偿,也期待与产业网仁在实践中持续探 配暂能时代的算力底座,驱动业务长效增长,提供了根具落地性的专业参考, 素、共网完善,
OCR:IMG:-层次化KVCache:面向超长上下文推理,实现性能、体验、或本综合展优 全同层次化KVCache共享体系 后级 名称 容量 时 承KVCache 超节点 超节点 L1 片上内存 数十-百GB级 纳秒级 活联KV,承载当前推理实例正在使用 NPU NPU NPU NPU NPU NPU 的热数据,提供最低延迟访问 鞋 #上 ... 贴 L2 DDR内存池 TB级 百纳秒级 热KV,承载短期会话上下文,解片 Scae-Up(UB-C) Sa-Up(UB-C) 上内存容量压力 CPU CN ou L3 共享KVCache池 数+TB级 拨秒级 温KV,在超节点范围内复用上下文, DDR内存 DDR内存 NDS直通 DDR内存 DOR内存 实现跨实例缓存共享 节点内KVCacho共享油 节点内KVCache其享池 L4 集群级A存储 PB级 毫秒级 冷KV,提供跨超节点的持久化KV Cache理 Se-O() (UB-GRCE) KVCache将根据访问频率和时延要求,在不网居 语义,通过生命周期感知服合与智能磨损均衡,将 级之间自动流动:热数据驻留高速存储(片上内存 写入放大降低70%以上,使每日全盘写入次数 /DDR内存)、温数据进入共享存池、长期数据 (DWPD)从10次以上降至3次以内,存储寿命 A存储 进入大容量存储。最终日标是:将分散在不同计算 长2-3, KV语义卸载 全局磨损均衡 多流写入(冷热识别) 资源中的KVCache统一管理,使上层推理银务无 跨节点KVCache共享池 高关注KVCache的物理位置,而能够像访问统一 对于长上下文Agent应用,决定推理成本的不仅是 SSU SSU SSU SSU SSU 记亿空间一样调用企业级KVCache能力, 算力规模,更是系统能否持续保存、共享和复用上 下文状态。在AgenticAl时代,具备统一上下文管 从主机搬运到NPU-SSD直连(NDS):能短KV 理能力的Alnta,将以更低成本、更高效率支撑持 访间路径 续性的智能生产。 2-22算网存网的多级KV细存日标构 传统架构中,KVCache访问通常要经过存储 栈-主机CPU-内存多级搬运,增加访问时延和资 源消耗,未来A存储将通过A芯片直通访问,KV语 从局部缓存到全局层次化KV共享池 义卸载、内存语义协议等技术,指短计算芯片与存 随着多级KVCache体系形成,缓存管理能力将成为AI基础设拖的公共能力,多个超节点之间可以共享KV 储之间的访问路径,使KVCache访问逐渐接近内 Cache,使任意推理实例能够复用已有KVCache,提高PrefixCache命中率 存访问体验。 从SSD到SSU:提升存建介质寿命 SSD将向语义化存健单元(SSU,Semantic StorageUnit)演进,SSU感知KVCache数据 AIDC白2026 公众号·智能交通技术
OCR:IMG:供配电:大电流输送的空间与可靠性代价 同时,超高功率A机矩带来的重量增长,也对键筑 AlFacility规划建设建议 当单个A超节点功率超过100kW,超节点集现模 结构承重能力提出更高要求,当前智算整机柜重量 升至数西M量级,传统数中心普来用的 约16kN,未300kW以L上超高功率机柜单柜重 电力优先的园区造址逻辑与源网荷储协同架构 63A三相供电路,在承载能力上已提律见时一 将突破20kN/,已有标准里楼板荷载设计 供电能力与长期稳定性是AIDC选址的首要决策因 力难预判,破局之通是能源管控与算力调度深度联 为满定大电流输送常求,传统方室只能通过增加线 (8-12kN)不再适用 ,绿电富集地区因此成为大型AIDC四区的首 动:弹性任务跟随电源峰谷错峰运行,用性负荷优 数量与配电回路数进行补信,这会引发连锁问 一不仅电力充漆,通常还兼其土地宽格、碳排 先保障稳定供电,归根结底,AIDC四区的选址与 题:机柜与桥架空间被大里济占,线路铜耗与压降 建筑主体生命用期通常长达50年,首期规划建设查 放约束宽松等费加优势, 建设,是在“电力优先进辑下,在供电可靠性与长 同步上升,配电节点增多也意味着放障极率的累积 接决定了未来基础没施的上限——承重、层高和主 期用电成本之间得求最优平衡。 放大。 干路由,一旦建成根难改变,如何在初期决策中 不同A业务的电力请求不网,造址需差异化道配: 为未来不确定性留出余量,昆建筑结构面格的核 大模型训练:负荷稳定、规模大,优先低廉 供电架构从交流为主走向交流与高压直流并存 散热系统:液冷管网配置规划图境 心挑战 充市的电力: 在保障电力供给规模与稳定性的前提下,供电架构 智算时代风冷满足不了单柜功率诉求,液冷散热成 需跟上高密算力的升级步忧,在中低密和存量场 为必然,如何规划冷管网面两难:建没初期如 建设周期:工程交付跟不上算力选代 ·高线推理:或本敬感,重电价与吞吐的 中,交流供电产业链成熟、标准完善、运维经验丰 果管网、CDU和水端接口一次性图化,后续扩容就 当前智算硬件选代节奏已压能至一年一代,芯片功 平衡: 富,仍将长期作为主流,面向300kWC以L上超高密机 要大改:反之,如果完全按照远期最大流量配置, 耗、机柜规格,集群互联方案持续更新,一次性定 柜,传统交流方案的电流、线缆数量和配电空间压 平时又会因“大管径、小流量”造成控制困难和额 型的静态机房架构难以通配硬件快速更选,传统土 Agent交互式推理:在电价与访网时冠间 力急别上升,800V高压直流凭借减少变换级数和降 外能耗,行业需要可拆分、可动态调节的管路架 建主导的建设周期长达12-18个月,而行业普遍要 权衡: 低线路电流的优势,或为重要演进方向。300kW量 构,让管路能力随算力需求逐步扩容,这对液冷提 求智算没施6-8个月完成交付,工期子巨大, 规划参考阅值,最终路线仍需综合服务接口、可 出全新的模块化和得性化设计要求。 边缘运:用户距离与数据合院优先。 靠性、投资或本、标准范及产业规熟度等因素确定。 除此以外,Agent推理业务负载具备根强的突发 液冷还带水力平衡、冷却液维护和泄漏等风险。 性,短时间内功率辨值可或细波动,通基础没册 绿电富集区的核心痛点是新能源出力波动,为兼股 800V直流主要有三种架构路径: 液冷管线可达到十公里,任何网部堵塞、腐蚀或控 民备快速弹性扩容的能力,基建的期现划需要预留 供电容量与电能质量,大型智算四区需构建连网 制失配都可能形成热点,系统需持续值测流量、压 充足的调整空间,依靠弹性架构承接硬件选代周期 与业务负荷波动。 储一体化架构一配套构网型储能、联动就近能源 差、温度、工溪电导率和pH值,建立泄满检测与工 基地,实现新能源就地生产与消纳,构网型储能承 质健康度预测体系, 担西项关键功能: 建筑结构:层高、承重成为核心挑战 -毫秒级电疫,平酒新能源功率波动: 随器液冷系统引入更大口径供回液管道,供电线 面持续增加,集群互联光纤规模快速增长,传统 ·支撑微网电压与颜车稳定: 数中心的居高、絮空空间和机房布局已难以适应 收A负率实,前网的级向中: 未来需求, 短时断电时无健离网运行,保障算力不中断。 S2ADC日书2026 一CI建设数中心的53
OCR:IMG:路线 基本架构 主要优势 适用考虑 墙,与智算设备同列就近部署,封闭热通道、冷 通过预制化,模块化和产品化缩短交付周期 量池化,无需回风天花,该方案对机房层高要求更 预制化和产品化是压能建设周期的关键手段。 设备集中、系统成本相对更 需要完善直流母线保护、改 低,但散热设备与智算没备混合部署,运维空间交 AIDC应以POD为基本建设单元,将供电、储 变压器与集中式直流UPS统 低,供电系统与IT功率密度 障揭离和运维体系,适合现 又较多,对运推管理要求较高。 能、制冷和T系统进行标准化没计,机电模块在工 集中式直流 一部署,通过800V直流母 解,便于容量池化和弹性 模较大、规划相对统一的新 厂完成预制、集或和测试,现场主要完成吊装、连 线向多个POD或机柜供电 演进 建园区 建筑结构设计需要预留演进空间 接和联调:服务器则尽可能采用整机柜交付,减少 机房承重设计:新建液冷算力机房:建议楼板承载 现场安装和调试。网时搭配A辅助设计、数字化交 能力按20kNr及以上标准实施。 付、仿真校验等手段,保障方案落地可行性。 交流电先送到机房成POD. 故障域较小,扩容灵活,容 设备数量和控制节点增加, 分布式直流 再由靠近负载的直流UPS 易适配不同代际和不网功率 需要统一接口、协同控制和 机房层高设计:面向300kW以上超高功率机柜场 从建设模式看,AIDC本质上是一套规模化算力 成800V供电 机柜 全生命周期运维 景,微模块内部架空地板1m,电力与光纤管线布设 生产系统,需要打通核心产品、设计仿真、标准 空间,加消防通道、回风夹层和顶部桥架预留空 接口、票统验证和数字制造,通过土建与机电并 间约5m,建筑梁高约1m,综合测算机房层高建议 行、框架来购和滚动备货,依托工厂预制、现场模 在超节点或高密机柜侧部署 柜侧部署与超节点结合紧密,部著灵 需要统等机柜侧空间、 不低于7.5m,或案下净高不低于6.5m。 块化拼装,实现标准化复制建设,能够将传统土建 SideCar方案 独立供电单元,以较短直流活,可能短末端供电距离 活,可能短末端供电距离 热、检修和多厂商接口,机 12-18个月的建设周期压地至6-8个月,加快算力 路连接IT设备 电与IT协同要求更高 同时需预管整机柜搬运、设备更换和检修空间,主 资源投产速度, 干电力和液冷路由应尽量独立、可扩展,避免不网 专业在柜顶和地板下相互挤占——这也是运维安全 和扩容效率的长期保障,搬运斜城要求,斜坡皱度 无论采用何种技术路线,800V都是覆盖全链条 采用模块化、分区及可变流量设计,支持按POD逐 ≤8,斜坡宽度≥2.2m 的系统性工程:硬件层面涉及直流UPS、高压锂 步扩容。系统应持续监测流量、压差、温度、工质 电、高压母线、连接器、断路器及服务器电源的协 电导率与pH值等关键参数,对泄漏、新流、气堵 同适配,产业后面则涉及标准制定、准入认证与近 等异常实现快速识别与自动隔离,并基于工质健康 吊回网 消防管网 维体票的同步成照。 度势开展预测性推护,保障暂算设备可运行。 电力热架 3200 光桥 构建风液同源、弹性管网和全链路可靠的散热 风冷侧面向单柜20kW左右的高密散热需求,可采 梁下净 系统 用以下两种方案: 6.5m 7.5m 散热系统整体采用风液同原架构:前端冷源与一次 液冷机胎 2300 侧管网统一规划,液冷与风冷共用冷源基础设施: 方案一(双侧房间级空调):在机房双侧部署大风 末端根据机柜功率与设备类型灵活选择风冷、液冷 增,通过增加制冷末璃数量提升敏热能力,相比单 或风液湿合。机位同步预留液冷快速接头与风冷送 侧房间级空调,双送风可小冷热通道宽度、降 风条件,使同一机房可弹性部署不同代际没备。 低天花回风高度,并提升机房空间利用率。 空地高 1000 液冷侧按长期能力规划主管路,CDU与二次支路 方案二(近端列间空调):在微模块近端部署小民 图2-24班节点对机房净空的推荐要求 S4AIDC白皮书2026 公众号 智能交通技术
OCR:IMG:2、超节点集群的核心构成 典型场景如下: 节点集群 KVCache信 邀话与MoE通信 Prefix Cache信 统一运维管理 场景1:节点PD分离 场景2满节点AFD分真 场3:全共享KV 智算超节点 智算超节点 通算超节点/服务器 PD分 EP EP信 ScaleOut 步数面 数据面 业务面 超点(950PR) 节(950DT) P实-节点 (950PR) 口实所-超节点 (9500T) (A) Scale Out 机 22 KVCache 关系团数 向星拉票 AI存储 ScaleDu Scale OuteBn 图2-19超节点果系统构图 KVCach KVCae M2N 超节点集群通过暂算、网络、存储、通算四大底座 数据资源、实现集群级AI协同的互联网络,它 协同,将分散的计算资源融合为面向A生产的统一 一方面连接多个超节点,协同完成大模型调 基础设施, 推:另一方面连接A1存储,为模型状态、KV 面2-20Scale-Out网的民型场示 Cache等推理关键数据提供高效访问通通,让 智算座提供大模型训练与理能力: 上下文状态能够在集群范图内共享和复用。 网络底座实现越节点间高速互联和集群扩展: 奥型场景 场景述 主装酒信流量 Scale-Out网络价值 Al存储底座承载模型数据、KVCacho和Agent长 Scale-Out网络的典型场与主要流量 期记亿: 随着大模型推理架构从单实例向集群化演 Prefill与Decode KVCache节点 连接异构超节点,实现不同代 通算底座支撑任务编排、工具调用和Agent运行环 进,Scale-Out网络录载的通信类型不断扩展,主 跨节点异构PD分离 部在不同类型算 传 际、不同类型算力协同,优化推 境 要包括: 力资源池 理成本 四大底座共同构成A生产平台,使计算、状态和任 KVCache通:支撑PD分离和上下文状态共享: 异构AFD分离 AttentionFFNMoE 激活与MoE通信 支撑模型模块跨资源池网,提 务能够在集群范围内协同消动:智算负思考,通 激活与MoE通信:支撑Docode实例模型结构解码 换块进一步解 高MoE模型资源利用效率 算负责行动,A存储负责记忆,网络负责连接。 后的模块协同: PrefixCache通信:支撑跨实例的上下文复用 多超节点组或大院 PrefixCache与全 实现上下文状态实例共享,将 3、Scale-Out网络:让多个超节点成为统一计城 超节点间PD分离 模推理集群 局KVCache通信 KVCache从单节点缓存演进为 Scale-Out网络,是连接超节点集群中计算与 集级资源 AIDC白书2026 公众号·智能交通技术
OCR:IMG:路线 基本架构 主要优的 适用考虑 增,与智算没备同列就近部署,封闭热通透、冷 通过预制化,模块化和产品化短交付周期 量池化,无需回风天花,该方案对机房旅高要求更 预制化和产品化是压绝建设周期的关键手段。 设备集中、系统成本相对更 需要完善直流母线保护、故 低,但散热设备与暂算没备混合部署,运维空间交 AIDC应以POD为基本建设单元,供电、储 变压器与集中式直流UPS统 低,供电系统与T功率密度 障高和运维体系,合规 又较多,对运维管理菱求较高, 能、制冷和T系统进行标准化设计,机电模块在工 集中式直流 一部著,通过800V直清母 前,使于容量池化和弹性 模较大、规划相对统一的新 厂光成预制、集成和测试,现场主要完成吊装、连 线向多个POD或机柜供电 演进 建园区 建筑结构设计需要预留演进空间 接和联调:服务则尽可能来用整机柜交付,减少 机房承重设计:新建液冷算力机房,建议楼板承 现场安装和调试,网时搭配A辅助设计、数字化交 能力按20kN及以上标准实施。 付、仿真校验等手段,保障方案落地可行性。 交流电先送到机房或POD. 故障域较小,扩容灵活,容 设备数量和控制节点增加 分布式直 再由近负的流UPS 基适配不同代际和不同功率 要一接口、协同控制和 机房层高设计:面向300kW以上超高功率机柜场 从建设模式看,AIDC本质上是一套规模化算力 成800V供电 机柜 全生命用运维 景,微模块内部架空地板1m,电力与光纤管线布设 生产系统,需要打通核心产品、设计仿真、标准 空间,加消防通通、风夹和顶部桥架预留空 接口、系统验证和数字制造,通过土建与机电井 问约5m,建筑梁高约1m,综合算机房层高建议 行、框架来购和滚动备货,依托工厂预制、现场模 在超节点或高密机柜邮 部著与超节点结合紧密,部著灵 要统等机柜倒空间、 不低于7.5m,或下净离不低于6.5m。 块化拼装,实现标准化复制建设,能够将传统土建 SideCar方案 独立供电单元,以较短直流活,可能短末瑞供电距南 活,可能短末瑞供电距南 热、检修和多厂商接口,机 12-18个月的建设周期压维至6-8个月,加快算力 路连接T设备 电与T网要求更高 网时案预留整机柜搬运、设备更换和检修空间。主 资投产速度, 干电力和液冷路由应尽量胞立、可扩展,避免不网 专业在柜顶和地板下相互挤占——这也是运维安全 和扩容效率的长期保障,运料城要求,料坡玻度 无论采用何种技术路线,800V都是覆盖全链条 采用模块化、分区及可变流量没计,支持技POD逐 ≤8,料坡宽度≥2.2m. 的系统性工程:硬件品面涉及直流UPS、高压锂 步扩容、系统应持续监测流量、压差、温度、工质 电、高压母线、连接、新路器及服务器电源的 电与率与pH值等关键参数,对泄漏、新流、气地 同适配,产业层面则涉及标准制定、准入认证与道 等异常实现快速识别与自动隔离,并基于工质健康 维体系的间步线然。 度验龄开票预测性维护,保障智算设备可靠运行。 电力 >3200 构建风液同源、弹性管网和全路可靠的散热 风冷图向单柜20kW左右的高密散热需求,可 系统 下.5m 用以下两种方案: 7.5m 故热系统整体深用风液同乘架构:前消冷藻与一次 液冷机 2300 倒管网统一规划,液冷与风冷共用冷源基础没施: 方案一(双例房间级空调):在机房双部署大风 末端根据机柜功率与没备类型灵活选择风冷、液冷 增,通过增加制冷末端数量提升敬热能力,相比单 或风液现合,机位网步预留液冷快速接头与风冷送 侧房间级空调,双送风可略小冷的通道宽度、 风条件,使网一机房可弹性部署不同代际设备, 低天花回风高度,并提升机房空问利用率。 空地用R >1000 液冷侧按长期能力规划主管路,CDU与二次支路 方案二(近端列间空调):在模块近端部署小风 图2-24节点对机房净空的推荐要求 54ADC白度书2026
OCR:IMG:KVCache不再属于单个实例,而或为整个计算域 3、超节点多种形态:可满足大中小场高性能推理 4、节点发 光互联为下一代核心方向,NPO近封装光学是关键 共享资源,结合KVCace继知路由,可以优先调 求 超节点正在从技术探素走向产业规模化应用,成为 技术路径。 度已有上下文缓存的实例,从而减少重复Pre 对于中小规模场景,可以果用64卡/96卡等不网 A基础设施演进的重要方向,未来,超节点将围统 降低TTFT、提升整体Token生产效率。这标志着推 模超节点,部著不间规格的PD分离大EP实例,满 三个方向持续演进: 第三,资源持续解:随着推理、多模态和 理系统从“计算模型”连向“计算+状态管理模型” 定高性能推理要求: Agent任务复杂化,计算、内存和通信需求 第一,规模持续扩大:超节点规模将持续突破传统 日趋差异化,来来超节点需要支持:AF分离 64卡节点 96卡超节点 服务器集群边界,支撑更大规模练和理,未来 (Attention-FFN Disaggregaion,IBAttention PD分大EP部实别 PD分南大EP部著实制 超节点规模将从干卡演进到万卡。 与FFN/MoE块解部著).多模态VAT(视 6) 一音频-文本多模态模型架构)以及LLM分离(大 4P-2D 6P-1D 6P-2D 6P+3D 8P-2D 9P+3D 第二,互联持续升级:随若超节点规模持续扩 言模型不间组件拆分部署)等新型部署模式,最终 大,网络互联成为决定系统效率的关键,超节点网 目标是:让不同AI工作负载都够动态获得量遗合 络正从微秒级向纳形级封随演进,通过Tbps级带宽 的计算资源。 护E- 3 h 护 护 护心 护 心 -3 EN 3 e: o FEe 护 0 59 E 和更高效拓扑,实现计算资源之间的高速协同,与 此网时,传统电互联遗通高频换耗与功耗瓶项: L2-超节点集群:万亿MoE模型高并发部晋的基础架构 2-17中小超节点暑配置 02 向大规模高并发推理、模型训练和核心生产场 超级计算系统,更 超级计算系统,更重要的是,超节点具备逻错切分 超节点提升的是单一计算域的协网效率,而超节点 ,超节点可以扩展至数百基至数干卡规模,形成 能力。 集群进一步解决A规模化生产问题,将多个超节点 与网络、存储合为统一A生产系统。 生产运营:支撑多业务、多视型并行运行 企业级A案要网时承载多个模型、多个业务和 数百卡一数干卡大规模超节点 1、超节点集容的典型应用场景 大里用户请求,超节点集通过统一资源池和 企业建设超节点集群,本质是为了满足A进入生产 弹性调度,实现计算能力模向扩展。 商1 逆周2 可调 逆钢隔真 阶股后的三类常求: 2DPD P+2D SP+ID P-20 P+30 8P-20 9P30 01 03- Scale-Ue 规模扩展:支撑业务持续增长 可喜运行:保障核心业务连续性 一 PN h 上净城 a F 1 nhs R 2 品 1 1 聘 电 百香 1 1 燕酒 理 营营 电营 营 ! 节 节 营 浙 从A试点到规模化应用,单个题节点会逐渐受 当A进入全、改务、制等关键流程,集 浙 铺 商 A O 福 20 到香吐,并发和业务隔南限制,通过 通过故障隔离、服务迁移、滚动升级和容灾部 Scale-Out展多个超节点,企业可以平酒 署,将A从单实例服务升级为可罪生产系统。 提升Token产能,无常重新建设基础没施, 图2-18大硬节点著配置 3 AOC日书2026 一C级理中心的[37
OCR:IMG:长上下文加剧数据搬运压力 “存算剪刀差”进一步放大瓶颈 A推理芯片的关键指标成为Token生产效率核心硬约束 以DeepSeekV4Flash模型(总参数284B)处 近年来,A芯片算力的增长速度远超内存带宽的增 对于AI芯片来说,以下4个指标影响Token生产效率: 理128k长文本为例:单次请求需要驻留约288GB 长速度(内存增加剧)。以英伟达的H100到B200 模型权重和KVCache状态,这意珠着在Decode 为例,在低精度推理算力上提升了4.5倍,而内存 阶段,每生成一个Token,都需要从总规模达数百 带宽仅提升约2倍,算力跃升能够著短Pref, GB的驻留数据进行调度访问,在此过程中,芯 但Decode因受限于带宽而难以获得网等收益,计 A算力 口内存容量 片计算单元往往仅需不到0.01毫秒即可完成计算, 算与数据供给之间的鸿沟持续扩大。 FLOPS-每浮点运算次数 GB一芯片可同时承数的数量 其余99.9%以上的时间都在“等特数据供给” 决定P,Tn(TTFT).力 决装多大型,务多少并发用户,量不足 快,力组TTFT 卡部署,长浮上下文步行 Decode段的核心予盾已底从“算得快”演进 为“得快”。 直接售:TTFT 影:QPS井家数上下文长度 内存域:A力与内存带宽增长对比(2018-2026) 内存带宽 互联带宽 力(TFLOPS)增系度过内存宽,成性 GB/s一从片上内存读取致据的该度 GB/s一芯片间数据交换速度 相长(2018=18) 决定Dd步Tkn生,D报 决定多卡协作率,卡步中问,Mo 30 # 存案型一力在等待数,才是真实, 258 2 始 直驶能电:TPOT 直法影电:集联有效TPS 20 8信 差距正在扩大 15倍 2 02,约 10 700 2. 40信 图2-7决定Token生产效率四个留标 5倍 2.4 20 增 约4倍 2018 2021 2022 0222023202420 2026 2026 模型推硬性能受限于其中最短木板,所以这4指标之间的比例关系,能更好地反映A芯片推理性能均衡性,包括: 力(OPS)K 内(TB)长 2018年 算力带宽比=A算力(TFLOPS)+内存带宽(TB/s) 算力带宽比用于判断芯片适合计算密集还是访存密集负载:比值高,适合训练与Pre细推理:比值低 星营生 力地证 内存用后 的不 适合Decode与在线推理 力长通#动 2m 8年长78 1大的 7 内折 立际鞋院 内存算力比=内存容量(GB)+A算力(TFLOPS) 内存算力比决定单卡能装下多大的模型、保留多长的KVCache。比值高,更适合长上下文、高并发 图2-6:内存:A1算力内存带宽增长对比(2018-2026) 理,Agent爆发使超长上下文成为常态,A芯片设计的趋劳是系统性提升内存算力比。 因此,大模型推理的核心照领正在全面从“提开峰 生产效率的竞争,本质上是芯片访存、互联传输与 对于A芯片来说,算力再强,如果内存带宽不足,Docode依然会受限:内存再大,如果互联带 值算力”转向“提升数据搬运效率”,未来Token 系统级数据流协同调度能力的综合竞争, 法支撑大规模MoE的同 AIDC白书2026 公众号·智能交通技术
OCR:IMG:Agent运行环镇:通过任务编排、工具调用、安全 构,但实际建设还需从工程部著视角进一步拆解为 执行和多暂能体协网,使Token进一步驱动业务流 四个能力圈:超节点、超节点集群、算力调度和A 跨节点通过网络设备互联,通信占比高(20%-30%) 程和自动化执行。 服务平台,其中,超节点与超节点集群是算力座 上述三层从功能分层视角定义了AlInfra的逻错架 品的心载体,紧焦单位算力的Token生产效率。 waeaam spine m 参数面网络 m Veat cem 四个能力圈重塑Token-CentricAlInfra 跨节点AltoA通信 跨节点Al toA通信 四个能力圈分别服焦算力供给、集群协同、资源调 能力交付的完整体系,是Token-CentricAinfra 度和智能服务,共同构或从底层算力资源到上层A 落地建没的核心能力单元。其具体内涵如下: AI服务器1 AI服务格2 Al服务器n 2.1KV存 3.1DC内力 4.1行务 图2-12传统报务器 品线 5 suO- |户 运行时|运行时] L1超节点 L2节点群 L3算力调度平台 L4A服务平台 当计算规模从单机扩展到集群,新的瓶之出 宽和通信时延连渐成为限制因素。计算芯片等待数 2.2 5caleOut网 3.2DC度 点联|光 火换均 |关| 现一—通信效率。特别是在MoE模型中,专家并行 据传输的时间增加,通信开销不断慢蚀有效算力。 4.3Agont行环填 需要大量跨芯片A-to-A通信,传统Scale-Out 导效集群规模越大,Token生产效率反而下降。 安全 架构依以太网连接标准化服务器,虽然具备良好 的通用扩展能力,但在超大规模A负载下,网络带 因此,A基础设施出现了新的计算组的方式:超节点。 图2-11 Token-Centric Ai Infra NPU NPU L1-超节点:Token高效生产核心引擎,成为建设常态 1、题节点的定文:逻上的“一台计算机” 留给KVCache的整间不足,导致推理并发力和 高速互联总线 随着模型规模从百亿、干亿参数向万亿参教演进 长上下文能力受到严重限制。 ul 传统单服务器架构正在近物理边界。以1T参数模 NPU NPU NPU NPU NPU NPU 型为例,即使采用FP16精度,硬型参数本身就需要 因此,要同时满足大模型部署、长上下文推理和高 约2TB内存,已经超过主流8卡AI服务器的片上内 并发服务,计算资源必须突玻单服务器边界,向跨 存容量,即使通过INT4、FP4等低精度量化方式压 节点期合演进 对等联|内存一址|TB级全互联 模型,有限片上内存仍会大量被模型权重占用, 图2-13节点构 2AIDC白度书2026 公众号·智能交通技术
OCR:IMG:亥二维码7天内(9月27日前)有效,重新进入将更 公众号·智能交通技术
OCR:IMG:01 66 当人工智能成为数字经济的核心生产力,数据中心正经历一场深刻而决定性的跃 它已超越承载算力与数据的传统定位,成为智能时代的战略生产资料。旧苑 第一章 式无法解释新负载,范式转换的大幕由此拉开。 AIDC创新与发展 人类历史上,每一次基础没施层的联迁都重塑了文 到能够感知、规划和执行任务的自主Agent。智能 明的底层逻辑,蒸汽机重构了“动力”的生产范 正以前所未有的速度和密度涌入每一个企业、每一 式,让人类摆脱体力极眼:电力重构了“能源”的 台终端。 供给体系,点亮工业与干家万户:互联网重构了 “信息”的流转逻辑,打破知识与时空的满算。 数据中心的内通正在被深则改写:从承载计算、存 储和同络资游的基础设施,满进为持续生产智能能 今天,正在发生的第四次跃迁将重构“暂能”的存 力的新型基础设施。这不仅是一场T架构的技术重 在形态。从大规模预训练模型的能力消现,到分布 里,更是一场定义未来数十年生产力范式的系统性 式雅理的规模化部署:从被动确应的信息工具, 革命。 1.1 AIDC发展的五大趋势 88 Agent成为AIDC负载的最大变量 Agent让A从“认知智能”向“行动智能”演进, 与此同时,每百万Token的推理或本从5元降到0.5 成为能自主规划、工具调用和闭环执行的“行动 元,推理成本快速下降,进一步引爆了Agent和 者”,这使得AI从辅助型的“对话框”变成了能 Token需求,这合经济学中的Jevons论循 立承推业务流程的“数字员工”,重构企业传统应 环:A效提升不会降低算力需求,而会创造更大 用 的A算力需求, U 2024年初至2026年,中国市场日均Token调用量 今天,A开发者每天消耗上亿Token已不稀奇, 从1000亿增长到140万亿,其商后是Agent带来的 金融头部企业每天的Token消耗也超过百亿。来 Token需求指数级增长,一个复杂Agent任务通常 来Agent的数量和复杂度变得不可预测,这是Al 要多轮推理和工具调用,会触发数十甚至数百次 DC负载的最大变量。 LLM调用,上下文窗口长度走向百万Token级别。 T AIDC白书2026 公众号·智能交通技术
OCR:IMG:杨超斌 梅宏 —华为公司常务董事,ICTBGCEO 中国科学院院士,北京大学教授,中国计算机学会前理事长 过去两年,全球日均Token消耗量增长近300,超过3000万个AlAgent已深入制造、金题、能返等行业协网 以互联网、云计算、大款据和人工智能为代表的新一代他息技术正以前所未有的深度与广度重整人类社会的 工作。A正从技术探素走向规模化生产,而录载这一切的基础设施——AIDC,正在经历一场根本性的重构。 生产生活方式,成为新一轮科技革会和产业变革的核心毫动力,数字化转型已成为不可逆的时代大势,近年 中心的设计逆储已无法适应Agenic时代的需求,从供电架构别散然方案,从算力基设施架构制关键 技术的突最性进展以及AAgen技术的兴起,标着人工智能正在开启具备自主规划与任务执行 产品形态,从建设模式则运维运营,AIDC的每一个环节都在被重新定义,这不仅是技术的升级,更是业务速 力的AgenicA新阶段,作为人类生产生活的辅助工具将呈现能力的大幅联升,而这一切技术演进的底层支 .本自皮书聚了华为在A算力基础没施领域的深度实与系统思考,从架构规划到工程落地,从技 .离不开算力基础没施的系统性升级,AIDC作为图向A负能重构的新一代数据中心,是支撑大模型 水进型到持续运营,为企业构建Agentic时代的A障力座座提供了参考指引。行业智能化正加速的行,望这纷 与AAgen模化应用的“算力“工厂,这那自皮书,系统述了AiDC的内通边界、技术架构,建设路径与 白皮书能为全球AIDC的创新发展质献一份力量。 发展趋势,具有实践性和前性,为产学研用各界提供了有益的参考。 雷鸣 李鹏 中国建设银行期行长 一华为公司事、ICT销售与服务总载、中国地区部总载 前,人工智能正加速重构产业发展格局,ADC暂算基础设施作为数字经济时代的核心算力庭座, 近年来,华为携手金期、制造、电力等行业客户,围统数智化型联合创新,从机房物理设施、算力基 实体经济智化升级的关键支撑,作为国有大型商业银行,建设银行深入践行“人工暂能·行动,坚持算 、到智能活维运营的全条都在打破传统经验的边界,A从辅助工具演变为核心生产力,ADC也来了 度超前,建成“四地五中心”高可用智算集群,以里实算力底座更动全业务条数暂化转型,对 涂探素到系统化落地的全面联迁,在大量实践中我们深刻感受到,AIDC已不再是传统数据中心的技 力基建的战价值的认如不斯深化,本白皮书既的析技术底层逆调,又聚焦产业落地实践,系统释了人工 升级选择,而是驱动企业数暂化转型的战路底座,这是产业演进的大超龄,也是先行者的重大机遇,本自皮 与AIDC协同发展的路经与方向,重具前性与指导性,得业界同仁研读参考,期待与各方携手共 了华为与行业客户在实践中积累的经输与思考,希里能为更多企业建好、用好ADC提供一份兼其的 智能算力生态,以算力筑基能新质生产力,助力数字经济高质量发展, 与切实的参考,我们期待以此为契机,与产业协同服力,共网打造绿色集约、高效、开放的A基础设 加速暂算基础没施高质量发展,共Agenc时代!
OCR:IMG:才能回答三个关键问题:一次任务为什么成功或失败,或本主要花在哪个环节,是否需要优化模型 长期看,企业AgenticAl建设是一套持续运转的 被更多场景复用,退一步扩大业务价值,企业可以 由、上下文组织或工具调用策略。 飞轮:Agent进入业务创造可量化价值,执行过程 通过任务完成率、能力复用率、新场景上线周期和 沉淀数据、语文、知识、技能和经验,沉淀的能力 单位任务成本衡量飞轮运转效率。 用户入口 APP应用 型网关层 诚营指标 Agent驱动Al Infra边界重构 实1 实2 实州N TTFT TPOT 为了支撑企业Al应用落地,Alinfra的边界也在发生 模型运行与服务,提供可组合、可治理的推理 统一接入|计量计费|第地向 请求款 变化,需要扩展形成三类平台服务能力: 能力 推理服务 模型运行与服务提供统一、可编排的模型生产服 数据存储 源管理 型管理 其力酒度 营运座 Agent运行环境,承载长周期任务与多Agent APIKey 务与高性能Token推理服务,支持按需启用PD分 协同 KVCach多荐 数回库存 离、向MoE模型的大规模专家井行与多级KV Agent运行环填需支择数小时至数天的长程任务 Cache等能力 执行,通过持久化状态与Checkpoint保障任务连 .. 续性。 数据基础服务,统一支撑知识、数据、长期记 智鞋 通算 网络 存储 亿与训练评测数据集 图2-4:“企业私有化Tokon服务参考禁构和开源软件选型建议 多Agent井行要求平台提供按需启动、弹性扩 数据基础服务承担“沉淀企业智能资产'与”为模型 的安全沙箱,轻量容器沙箱冷启动P95(95th 训练供数”两类职责。一方面通过向量库、图关系 最终,硬型服务的工程部署应形成完整闭环 招标:评测体系根据成功率、成本、时延与业务结 Percentle,第95百分位延退)控制在毫秒级, 库与长期记忆服务,支撑企业“知识”构建。另 Agent请求统一进入模型网关,由网关完成签权、 果,反向优化模型选择与路由策路。 一方面通过多硬态数据期仓,实现训练数据集管 路由、计量与治理:现测系统记录模型级与任务级 网时需建立任务级可现测体系,重点道测井发 理、数据清洗标注、由缘追踪等能力,为模型 Sessian数、任务成功率、数据访问、工具调用 练、评测提供可追测、可复现的数据。 沿着四个阶段推进企业Agent落地 等,形成完整任务Trace,为问题定位与安全审计 提供输入。 总体上,AlInfra宽演退为同时具备三类平台能力与 建设以Agent为中心的企业A应用与生态:应遵福 证、可回放、可审计,确认Agent的质量、成本、权 异构资源对等互联架构的新型基础没施。 价值引、平台支撑、资产沉淀、持续运营”的 限、安全、任务恢和业务连续性是否达到性产要求。 原则,按照否个阶段稳步推进: 阶段三:能力复用 阶段一:场最准备 持续沉淀执行路径、异常模式、最佳实践、岗位技 确认业务价值以及数据、语义、知识、工具和规 能、登务现则和进义资产,使短识、工具和技能能 则是否具备条件,并建立任务成功率、人工接管 够跨Agent、跨部门、跨场复用。 率、结果采纳率和单任务成本等业务目标。 阶段四:规模运营 阶段二:生产验证 形成统一的应用组合、平台能力、智能资产和组 建设统一平台和标准化接口,使关键行动可验 机制,推动Agent建设由分散项目走向企业级生态。 AIDC白度书2026 公众号·智能交通技术
OCR:IMG:Agent:建设多Agent协同的生产级平台 多Agent的生产级运行,需要三层架构的Agent 通信、资源调度、算力亲和调度等。Runtime的核 Agent正在成为企业新的执行中枢和业务入口。生 任务,谁拥有执行权跟,谁校验结果,谁对最终产 平台支撑,每一层解决不同的问题: 心价值,是保障执行过程在故障、并发、租户隔离 产级多Agent系统的核心,不在于Agent数量的扩 出负责。 和资源波动下依然可靠运行。 张,而在于建立清断的任务分工、协作协议与销环 第一层AgentFramework,录担任务智能排的 优化机制。 为提升长时复杂任务的成功率,多Agent系统还 职责。涵盖上下文工程、分层记忆、多Agent 第三层Agent System Service,为Agent提供安 引入三重循环机制,形成Harness自进化网环: 同、自评估与自演进、工具编排、任务规划、算力 全可信的系统服务,通盖系统沙箱、CLI-native 典型多Agent系统通过设置LeadAgent作为任务 LeadAgont优化任务组织,Sub-agent优化专业 亲和调度等核心能力。 (Command-Line Interface-native)原生执 调度中枢,负责任务拆解、优先级管理、上下文分 执行,Agent平台优化运行环境与协作机别,只有 行、安全限离、文件与进程访问控制、代码执行环 发与结果汇总:多个Sub-agent承担专业任务,如 具备从任务到平台的持续学习能力,企业才能减少 第二层Agent Distibuted Runtime,为Agent提 填、工具调用边界等。其核心作用,是让Agent在 架构设计、代码开发、质量评估等。各Sub-agent 对人工逐步调度的依赖,让复杂任务在更长周期、 供分布式、大规模、可靠运行能力,通盖分布式状 调用系统力时不越界。 在限定职费、权限与工具边界内运行,避免权限过 更大规模和更高不确定性下稳定运行。 态管理、任务队列、Checkpoint、跨Agent 宽和上下文过载,企业需要明确协作契约:盖界解 AgentCore Agent-Studio &Agent-Ops LeadAgent Agont Framowork Harness:多任务管理润度(外环) Agent-Shudo SOK No-CodeaLow Ce Agont Engine Mrsstrgne Cordhaton Engne Servag Afty-Schr Tem.SkRs Aplcaton Spas Sub-Agent Sub-Agent Sub-Agent (Architect) (Coder) (Reviewer) Harness Harness Hamess Agent Loop Agent Loop Agent Loop Agent Distrbuted Runtine (内环) (内德环) (内循环) Agent Service SDK Agt Disrya Comricato AgMuerany Mesh Runme AOps Ful-chain VousiTurg Agnt Sysm Service AgentPOSIX Asst &E Agent平台 AutoHamess(自通归循环) Sytem Sandbox Agent Memory Sterage AgnntUUWeb Propose (Agent) Log Evaluate 图2-3Agent平台参考架构 文件系统 LLM+Harness 图2-ZMuiti-Agent Harness环机制 AIDC白书2026 公众号·智能交通技术
OCR:IMG:量,反映用户感知的生成速度:后者表示输入与输 ·长文本生成、代码生成等场量,请求数量较少但 企业AlInfra建设的目标不是简单地叠最大算力,而是在性能、否吐、或本和质量之间找到最佳平街,构建 出Token总处理量,反映系统整体吞吐能力。 单请求持续输出大量Token,心诉求是提升单请 匹配业务需求的Token生产系镜, 求生成效率。 QPS(QueriesPerSecond,每秒调求数)衡 Token生成效率的关键约束和核心技术 量系统单位时间处理请求数。 成本效率(Cost):性价比指标 衡量生产一定数量有效Token所需要投入的资源成 Token生产效率的提升,本质上是围晚大模型推理 提升推理数据访问和搬运效率展开,包括提高计算 企业真实的工程目标不是“生成更多Tokon”,而 本,包括硬件折旧、电力消耗、网络传输、存储以 全链路斯硬的持续优化。随着模型规模扩大、上下 单元利用率、提升存储带宽、优化通信效率,以及 是“在满足用户体验约束的条件下,持续生产更多 及软件优化成本。 文长度增加以及实时交互需求提升,推理过程中的 针对KVCache的高效警理、存储和访问。 有效Token,这可以用有效TPS来衡量,即:在 百万Token成本(Cost per MillionTokens)衡 性能核心瓶正在从“计算能力”转变为“数据流 TTFT、TPOT等用户体验约束下,票统实际产生 量Token生产经济性的核心指标。随着型优 动效率 “数据流动效率”或为推理的核心瓶颈 的Token总量,是衡量A集群真实生产能力的心 化、硬件开级和推理效率提升,单位Token或本 一次完整的大模型推理过程包括Prefi(预填充) 招标。 持续下降。 因此,从A芯片微架构到系统级的计算、存健、高 和Decode(解码)两个阶级,两者对盛层芯片与 速互联协同设计,整个技术栈的流进重心都在围 票统架构的需求存在本质差异,如下表所示: 评估Allnfra并发吞吐能力,必须结合具体业务负 生成质量(Quality):服务有效性指标 载,而不能只看单一TPS指标,这是因为不同业务 衡量Token是否准确、稳定且满足业务要求。速 场景的并发吞吐优化重点也不同,比如 度与规模代表生产能力,高可信可用的Token才是 Pretill Decode ·智能客服等短同答场景,请求频率高、单请求输 业务价值的真正载体。一般包括内容生或的准确性 出短,核心诉求是提升QPS和并发承载能力: 和一致性等, 用户输入Prompt后,一次性并行处理全 处理过程 Token,完成Atenton运算并生成KV 模型按自回归方式逐个预测下一个Token Token生产效率评价指标体系表 Cache 评价维度 评价指标 指标说明 计算特征 Token之间高度井行,矩阵计算密集 Token逐个生成,患行计算,数据访问 应性能 TTFT 衡量首Token聘应时间,决定用户等待体验 (Performanoe) TPOT 衡量连续Token生成速度,决定流式交互体验 每秒Token处理量,衡量单位时间Token处理 大规模矩阵运算 数据供给,受限于内存带觉 并发吞吐 TPS 能力包括OutputTPS和TotaTPS 性能 (Compute-Bound) (Memory-Bound) (Conourrency) QPS 每秒请求数,衡量系统单位时间处理请求数 成本效率 百万Token成本 衡量单位Token生产成本 算力优化: 数据流动优化: (Cost) 提升A芯片计算能力 -KVCache压缩、共享和分居管理 准确性 衡量输出结果是否满足业务要求 优化方向 优化TensorParall井行策路 提升内存容量和带宽 (Quality) 生成质量 一数性 衡量信出稳定性和可靠性 提高模型算力利用率(MFU,Model FLOPs Utilization) 优化芯片间高速互联 可信度 衡量结果是否可验证、可审计 PD分离后匹配高算力资 -PD分南后匹配高带宽资源 AIDC白书2026 公众号·智能交通枝术
OCR:IMG:Agent:建设多Agent协同的生产级平台 多Agent的生产级运行,案要三层架构的Agent 通信、资源调度、算力亲和调度等,Runtime的核 Agent正在成为企业新的执行中概和业务入口,生 任务,谁携有执行权限,谁校验结果,谁对最终产 平台支撑,每一层解决不网的问题: 心价值,是保障执行过程在放障、并发、相户隔真 产级多Agent系统的核心,不在于Agent数量的扩 出负责。 和资源波动下依然可靠运行。 张,而在于建立清账的任务分工、作协议与环 第一层AgentFramework,任务暂能排的 优化机制 为提升长时复杂任务的成功率,多Agent系统还 职,通盖上下文工程、分居记亿、多Agent 第三层Agent System Service,为Agent提供安 引入三重循环机制,形成Harness自进化闭环: 同、自评估与自演进、工具编排、任务规划、算力 全可信的系统服务,通盖系统沙箱、CLI-native 典型多Agent系统通过设置LeadAgent作为任务 LeadAgent优化任务组织,Sub-agent忧化专业 亲和调度等心能力。 (Command-Line Interface-native)原生执 调度中,负责任务拆解、优先级管理、上下文分 执行,Agent平台优化运行环填与协作机别,只有 行、安全隔离、文件与进程访问控制、代码执行环 发与结果汇总:多个Sub-agent担专业任务,如 具备从任务到平台的持续学习能力,企业才能减少 第二层AgentDistributedRuntime,为Agent提 填、工具调用边界等,其核心作用,是让Agent在 构设计、代码开发、质量评估等,各Sub-agent 对人工遵步调度的依赖,让复杂任务在更长周期、 供分布式、大规模、可靠运行能力,通置分布式状 调用系统能力时不越界, 在限定职类、权限与工具边界内运行,避免权限过 更大规模和更高不确定性下稳定运行。 态管理、任务队列、Checkpoint、聘Agent 宽和上下文过载,企业需要明确协作契约:维拆解 AgentCore Agent-Studlo &Agent-Ops Harness:多任务管理润度(外环) Lead Agent AgentFrark Agont-Shdo o-CodeLow Oo Haenfrgre SerEohng Ay-teher AoplcnSpar Sub-Agent Sub-Agont Sub-Agent (Architect) (Coder) (Reviewer) Wofow C Harness Hamess Hamess Agent Loop Agent Loop Agent Loop (内环) (内环) (内猫环) AtDry Cr MeshRntne AgntOps Fal-cn VfTue Agent System Service Agent平台 AutoHarness(自递扫环) StenSandbox Agent Menory Strge AgmntUw Propose (Agent) Log Evaluate 图2-3Agen1平台参考构 文件系统 LLM+Harness 图2-2Muiti-Agent Harness环机 ADC日书2026 一地1设中心的号
OCR:IMG:最终目标量:让一次基础设施投资能够适应模型规 当A退入核心业务流程,企业必须回答:如果智能 模、业务形态和应用需求的持续变化。因为企业果 生产中断,会发生什么?A时代的可靠性标准,正 2.3 Watt-CentricAlFacility 购周期通常以年计算,而A技术演进以月计算,只 在从“服务不中断”升级为“任务不中额”, 有弹性架构才能缩短两者之同的差距。 传统数据中心Facility的规划建设是基于*功率 机柜动率达到数百kW,算力集群从数十MW 企业级Ainfra期要具备三个层次的韧性: 可预测、冷都可标准化、负载相对稳定”三个能 到GW级别.一座GW级AIDC器区,用电负 2、Tokon高效生产:让算力转化为有效智 提之上,A时代这一确定性设计范式正在失效, 荷已相当于一个百万人口城市,该功率量级超 根多企业图略一个共网问题:其力投入不少,但资 笔一层:实例可靠一—保障单点放障不影响报务, 出传统机房设计上限,电力俱给不再只是配客工 源利用率不高,业务仍然觉得算力不足,不能纯粹 通过多实例部署、副本机制和自动切换,保障单个 这昆因为从AI芯片到AI机柜再到A图区,其力的 程,而是项目立填与建设方案的决定性前置要款。 从A算力利用率衡量,它既无法反映任务调度效 节点放障不会影业务。 功耗在快速持续增长:单芯片功耗迈向kW级,单 事,也无法体现模型推理效率、状态复用能力和业 务产出能力。 第二:状态可靠一一保障任务不中断,对于 算力单柜功耗趋势(kW/柜) AIDC安化特 Agent、多轮变互等复杂任务,接口可用并不代表 福路 AIDC10增长 A代,企业需要从关注“资源使用率”,转向关 业务连续。需要保障:会语状态保存、KVCache 100MW-GW 注:单位算力持续产生多少有效Token 恢复、长任务持续执行,避免一次放障导效任务重 200 新开始, 功率座度10长 提升Token生产效率,企业需要重点关注三个方向: 40-100-300+kW 第三层:业务可售—保障企业级连续运行。通过 2024 2025 2026 2027 2029 芯片代加速 计算效率:提升单位算力输出 集群、跨地域部圈和灾备体系,保理单一资源域 Souree:Public infemation&Huawi Pianning 年代以上 通过模型优化、并行计算和推理请 放障不会响核心业务, 度,让更多算力用于有效计算。 对于金财,能源等关键行业,生产级性不是优化 面2-23数中心电力负荷势变化 状态效率:减少里复计算 项,而是A规膜化应用的基础能力。 面对这种变化,Facty设计需围规能源、空润、时 ·机房布局与建筑结构原生适配超高功率暂算集群: W 通过KVCache、存和状态管理, 间三个维度重新思考: ·规划建设以模块化预制推短建设用期,大小机电 让已有计算结果复用,降低长上下文 [小结】 ·选址以电力供给为第一优先级,通过网荷储一 解支持弹性部署,兼容多代算力淡进。 和Agent任务成本。 AlInfra建设的核心目标,是构建面向智能生产的 体化平衡可票性与成本: 新型基础设施能力。未来企业之间的差距,将更多 $0 系统效率:提升资源整体利用 体现在算力、网络、存储和调度体系的整体协能 AIFacility的系统性挑战 通过统一调度、润那和资通编排,提 力,以及由此形成的高性能、大规模、高质量、可 开不用业务之间的资源价同能力。 持续的Token生产能力。 电力供给与质量:从园区配套上升为选址错点 最练,企业需要从关注:“算力利用率是多少?“ 着A从硬型力竞争走向规模化应用,Allnfra正 选址理错根本性重构,AIDC图区规模星指数级扩 源网荷储双向端合携战:随着新能源接入率持候 向关注:单位投资等产生多少有效Token? 在从支撑算力运行的基础没施,演进为驱动智能生 张,选址逻情已从过去的“以用户差和网络时起 升,能理供给的波动性与不确定性有可影A 产的新型生产体系,它将成为企业进入智能时代的 为核心”,全面转向“以电力容量、电源结构、并 群的稳定道行:与此同时,万卡级A藻群呈现亮密 3、生产级性:让A成为可靠生产系统 重要面座,并支撑末来企业智能化竞争的心能力。 简用期及长期供电稳定性为核心” 度、高功率和强同步特征,其动态负载变化也会反 向冲击电网稳定性。 DC白书2026 一CI中心的[5]
OCR:IMG:一份给CIO规划建设智算数据中心的参考 中国建设银行、华为技术有限公司 公众·智能交通技术
OCR:IMG:AlFacility新建与存量场景落地 液冷改造方案需要结合项目规模灵活选型,小规模 [小结】 改造场展,可选用分布式ECU、风液CDU等分散式 Wa-Centric:在物理约束中系统性地导找最优解 新建场景部著原则 方案:中等规模改造项目,采用标准化液冷POD模 数据中心的核心目标正在从“提供资源力”转向 针对算力需求波动大、硬件选代快的行业特征,算 敬挂”的三阶顶层原则,实现基础设府供给与业务发 块实施部署:冷源系统充分结合原有设施现状,因 “让每瓦特电力编出更多的有效Token,对于A 力基础没施建设应确立“长期储备、中期规划、短期 展的动态匹配。 地制宜选择利旧改造或全新增设,优先选用预制集 Facity而言,关键挑战在于如何以确定性的物理基 成冷站维超施工周期。 础设施,去承载能源供给、硬件演进和A/负载变化 带来的不确定性。 长期储备 供配电改造立足现有系统猫序渐进推进,针对机柜 (3-10年) 前统等土地、电力等长用期稀缺资源,为运期扩广张预留空间 末端配电回路进行专项升级。新增电源系统来用预 未来AFacity期划需要重新审视三个核心问: 制模决化产品,末端配电优先选用智能母线成智能 能源如何离效供给、空间如何灵活演进、建设如 列头柜,退配不同功率算力机柜。 何快速响应,解决之道在于从静态蓝图转向弹性架 中规划 建立业务需求滚动预测机制,将新模型上线节奏、暂能化业务落地计划等 (1-3年) 构,在润察A负载长期演进的基上,通过预 核心变量纳入预测模型,动态更新算力需求基线 此外,需提前复核楼板承载能力,通过结构加因 留空间换取代际兼容能力,通过模块化设计支撑敏 或机柜政排布满足荷载要求:高受限项目利用 捷扩容,通过系统协同实现源、空间与算力的最 短期敬捷 托模块化、预制化算力基础单元,实现现场快速部署上线,支持按业务 BIM建模开展风险推潢:同步供动仿真工具优化机 优匹配 (0.5-1年) 量弹性护容 房气流组织:同时保证场内设备据运通道净高不低 于2.5米,满足整机柜进培施工条件。 基于上述原则,新建项可沿两更路径落地。 存量场量改造 当前存量数据中心大多以低密风冷机房为主,普遍 模式一(土建+大机电先行):业务详细需求间来 存在风冷向液冷开级条件受展,配电容量不足、楼 完全明确时,结合预判的功率区间、风波配比,提 板承量与室内净高不达标的多重约束。改造路径可 后动大型机电系统建设:待机柜规格、负载离求 参额以下三项硬性指标进行判定 明确后再进末端小机电实施,整体就结周期可压 至3个月在右, 楼承=12kN 机房净高=5.4m 模式二(土建+大小机电模块化预研、框架采购先 电力元余不低于现有IT峰值负载的1.5倍 行):提前约一年完或机电系统标准化、硬块化产 品开发,同步开展柜采购、俱应商滚动备货:业务 三项条件全部达标,具备改造为风液润合机房的基 求正式确定后,约3个月即可完成现场交付落地。 :仅部分指标达标,优先部著高能效风冷服务器 框算力潜力:三项条件均难以满足,则建议有序 弹性建设理念赏穿完整周期:长期阶段锁定缺 关停、资源置换,存量改造的核心思路为“以高换 资源边界,中期持续收放求方案,短期以标准化 低,依托单机柜算力密度提开,用少量高密机柜 POD单元敏捷落地扩容, 智换大量低密机柜,盘活有限机房空间。 ADC白书2026
OCR:IMG:欢迎加入 智能交通技术知识 知识星球 iTSTech 微信扫码加入知识星球 智能交通交流社区,共享行业政策、标准规范、研究 报告、技术方案和项目信息。
OCR:IMG:2、超节点集群的核心构成 典型场如下: 节点集群 KVCache 话MoE信 Prefix Cache 统一运维管理 场1:节点PD分离 2满节点AFD分 场3:全共享KV池 智算超节点 智算路节点 通算路节点/服务器 ScaleOut 修姓面 数据面 业务面 (950DT) P实-超节点 D所-节点 (50DT) (A) 2 KvCache 关系 #9收机 向 AI存 Scale Oupn Scale Ou热 2-19超节点系构成 KVCach M2NB 超节点集群通过智算、网络、存储、通算四大底座 数据资源、实现集群级AI协同的互联网络,它 协网,将分散的计算源合为要向A生产的统一 一方连接多个超节点,同完成大模型训 基础设施, 推:另一方面连接A1存健,为模型状态、KV 图2-20Scal-Out网的离型场示 Cache等推理关键数据提供高效访问通通,让 座提供大模型练与理能力: 上下文状态够在集群范图内共享和复用。 网络底座实现越节点间高速互联和集扩展: 典型场景 场景述 主要通信流量 Scale-Out网络价值 A存承载模型数据、KVCache和Agent长 Scale-Out网络的典型场与主要流量 期记忆: 随着大模型推理架构从单实例向集群化演 Pref与Decode KV Cache节点 连接异构超节点,实现不同代 通底座支任务编排、工具调用和Agent运行环 ,Scae-Out网络录载的酒信类型不额扩展,主 跨节点异构PD分离 部署在不间类型算 传 际、不同类型算力协间,优化推 填。 要包括: 力资源池 理成本 四大成座共同构成A生产平台,使计算、状态和任 KVCache通:支撑PD分离和上下文状态共享: 异构AFD分 AttentionFFNMoE 激活与MoE通信 支挥模型视块资源治网,提 务能够在集群范图内协同消动:智算负爽思考,通 激话与MoE通信:支撑Decode实的模型结构解 视块进一步解 高MoE模型资速利用效率 算负责行动,A存储负责记忆,网结负责连换 后的模块协同: PrefixCache通情:支撑实例的上下文复用 多超节点组成大规 Prefx Cache与全 实现上下文状态持实例共享,将 3、Scale-Out网:让多个超节点成为一t 超节点间PD分离 模推理集群 KVCache通信 KVCache从单节点存滨退为 Scaie-Out网络,是连接超节点集群中计算与 集级资源 ADC日书2026 一提I建设中心的3
OCR:IMG:高芯片互联:提升多芯片之间的数据交换力 总体来看,Token生产效率的提升,本质是一场围 传统Cloudinfra以laaS为中心.聚焦计算、存 最终,算力底座的目标不是提供更多握立算力,而 如华为灵(UBLink)等高通互联技术; “数洲流动效事的系统优化,从PD分离推理 储、网络的池化与调度:而当Token成为衡量Ai 是构建面向A生产的高效计管体系,让单位资源产 高效并行计算架构:优化模型切分和任务调度 禁构,到减少无效面移、提升节点供给能力、夹缺 生产效率的核心单位后,单纯优化资源居已无法决 生更多有效Token, 式,提高多芯片协同计算效率,如Megaon-LM、 跨节点通信题,AlInfra正在从传统算力基础设 定最终的Token产出效率,因此,AlInfra的架构 DeepSpoed等支持张量并行、流水并行和专家井行 拖转向面向智能生产的新型计管体系,未来竞争的 边界南要进一步向上伸,在传统资基础没施之 算力调度层:解决“高效资源利用” 的大模型分布式计算框架: 关键,不是谁拥有更多算力,而是准能够让计算、 上增加模型运行、数据知识管理和Agent运行环填 算力调度层本质上是AlInfra的操作系统,负责连接 存储和通信形成更加高效的数据消动体系,持续、 等A服务能力,将底算力转化为可持续运管的A! 后资源、根型任务和业务需求,通过资源池化、 信与计题合优化:减少通信等待,提离分布式 稳定、高效地产生Token. 能力 性调度、任务编排和智能优化,实现: 推理效率,如HCCL集合通信优化、MoE场下针 对All-to-A通信的优化技术。 基于这一变化,Token-CentricAlInfra形成A 资源统一曾理:算不同芯片、不间代标设备差 Token-CentricAl Infra目标参考架构 算力底座、算力调度、AI服务平台三层架构,分别 异,形成统一A资源池: 解决“极致Token生产效率、高效力利用和持续 A能力供给”三个核心问题,最终实现从“资源供 动态资源各配:根据模型规模、推理阶和业务优 任务 务 住务执行 Sk生 期力 给‘到“暂生产体累”的演进。 先级,将任务匹配创最造合的计算资源: Model Knowledge&Data 算力底座层:解决“单位算力的Token生产 资薄弹性复用:通过训推润部、潮沙调度和优先级 工程(入、开信生用期理) 加工程 效率 管理,提高整体资源利用效率: Token A时代,企业建设重点不再是简单增加算力规模, D KKIH 而是构建面向A负数优化的统一算力底度,使计 高可靠运行:通过放障检测、任务迁移和资源 型工程工民 算、存储和网络能够围统模型维理、训练和Agent 复,保障AI生产连续运行。 任务高效的网,区别于传统CloudInfra面向通用计 oken-Centric AlInfra 算资源,A算力底注需要网时支撑多样化A负: 如果识算力底座决定企业拥有多少Token生产额 联型服务 Agent行环填 始点数服务 力,那么算力说度决定这能力能否被充分释放。 智源:以超节点及超节点集群为心,提供模 AI务 型练和推理所需的高性能计算能力。通过高速互 AI服务平台:解决“持续AI能力供给” 平白 A 沙特E 联、内存池化和大规模并行,提升单任务Token生 A服务平台主要包三类核心能力 行 化/K8 000 产效车: 型运行服务:通过推理引擎、训练引草和模型 用生租 力 统一资源管理及调度 资通:支挥数据处理、知识服务、Agent任务 服务管理,将力转化为确定、高效的Token生产 资池 AI网 AI存 编排和工具执行,为智应用提供业务执行能力: 力: 力 NnA ETA 座期 A存储与高速网络:录载模型镜像、KVCache、 数据与始识服务:通过向量数据库、知识图语和长 上下文状态和训练数据,通过离带宽、时起的数 期记亿,使Token具备企业业务知识,实现从通用 图2-10金业Token-centricA11nfra体构 通路保障计算资源持续快得有效数据。 智能到行业智能的转化: AIDC白度书2026 一CI中心的号[31
OCR:IMG:2.2 Token-CentricAl Infra Token生产效率四维评估要素 不网业务场原对Token生产效率的要求并不相网,如下表所示: 从CloudInfra到AlInfra的核心变化 场装类别 典型应用 业务特征 Token生产效率要求 典型指标 负从“云大数到AKDM”、CloudInfra主要 用、企业知识库、数据湖与模型推理练等新型负 承载云计算、大数据与数据库等业务负载(简称云 (简称“AKDM),以NPU为中心,呈现计算 智客 用户模亿:值请求 大数),以CPU为心,配全类型多数,兼 集、带宽密集、长时运行与高功的特, A素. 万级及以上:单次请求通 TTFTC500ms: 互联网2C类 生式推荐、 常为百级Token,复杂问 低时、高香吐、低成本 QPS万 容多元通用业务,Alinfra录数的则是Agent应 A助手 答和推理可达干级Token OutpuTPS持续升 全融风控、 Cloud Infra AlInfra 交分析 单次请求通常秒级完成: 实时决 值并发西级-千级:结 任时、高可靠、高质 TTFT500ms: 工业诊 接影明业务决策 SLA>99.99% 传统应用 AI应用 实时运维 前台应用 应用工具 改务同答 上下文通常万十万 Tokn;多轮交:知识高 高质量、高一敌、 TTFT90%: Agent 医疗助子. 结果可 专业询 数据库/数据湖 知识 数 软件开发、 单任务可包含10-100+次 以通算为中心 以智算为中心 型用:上下文可达10持续生成、状态复用、 持续生成、状态复用、 TPOT90%: 计算 存信 智算/通算超节点 存储 自动测试 续小时级及以上 支持小时级长任务 Scaleup Token生产效率可以通过四个维度进行衡量: TPOT(Time Per Output Token.Token生 DCN网络 Scale out Performance(性),Concurrency(并 成间),指首Token出后,每生成一个后续 发香吐).Cost(成本效率)、Quaity(生成质 Token所离的平均时间,TPOT决定连续储出过程 2-5:AiInfra相比Coudinfra的心变化 显). 的流畅程度,是衡量流式交互体验的重要指标。 oken成为连接算力、模型与用户体验的价值载体,AlInfra的核心使命是保障高质量Token持续、高 稳定地生成, 响应性能(Performance):用户体验指标 并发吞吐(Concurrency):性能评估指标 衡量用户从发起请求到获得有效响疫时长,主要瘤 衡量A系统在润足用户体验约束的情况下,单位时 标包括: 问能够持续生产Token的力,主要招标包活: TTFT(Time to First Token.Tokena) TPS(Token PerSecond.每秒Token处理 报从用户请求进入系统,到返回第1个输出Token )衡量单位时间Token处理能力,包括Output 所经历的时间。 TPS和TotalTPS。前者表示每秒输出Token数 2ADC日书2026 一地C设监中心的23
OCR:IMG:超节点通过高速总线很互联,数十到数干题A芯 2、基于超节点的推理架构创新,实现高效Token EP卡数越多,Decodei算耗时越小:EP卡数 但是借助于超节点的大带宽,整个系统仍处于最优 片在物理上集成于整机柜乃至跨机柜,在逻上购 生产 多,多卡之间All-to-A(A2A)通信排战城大, 状态。 合为“一台计算机”,网一超节点域A芯片互联应 超节点带来的统一计算域,为大模型推理策构提供 不少于32题,且应具有高带宽(大于400GB/s)、 了新的优化空间。 40:00 40% 低时起(小于500ns)和统一内存编址等特点。 Ad(ms) 30.00 传统服务题集群相比,超节点最大的变化在于: 大规模专家井行(大EP):颗放MoE模型吞吐滋力 30% 通信耗时 20.00 20% 站 MoE模型通过多个专家提升模型容量,但传统集群 KV 统一内存端址:让分布式资源成为共享内存池 受限于通效率,专家规模扩展困维,超节点提供 10.00 10% 福 重精时 传统A集群中,每A卡拥有独立片上内存,模型 的大规模内存池和高速互联,使更大规横专家并行 通信占比 成为可 0.00 和款据需要在不同设备之间不新搬运,超节点通过 16 32 64 288 0% 内存池化技术,将分布式内存费源抽象为统一地址 EP卡数(以DeepSeek288专家切分为例) 空间,使不间A芯片够直接访问运端内存资道。 以DeepSeek大EP方案为册,大EP可以实现 这章味者: 一卡一专家”,EP卡数从16卡增加到288卡 图2-15DeepSeekV3大EP通时和通占比 (包含共享专家),单卡权里占用从42GB持低至 P-D-C全对等架构:KVCache全局化消除重复 要重复Pref计算. ·模型参数可以跨芯片统一管理: 2.33GB,可以保持更多的KVCache(实现 计算,大降低TTFT 基于超节点统一内存编址,推理架构正在向 -KVCache可以跨实例共享: Batch Size从B增长到30),扩大超节点内存池。 在多轮对活和Agent任务中,大星请求会复用已有 P-D-C全对等方向演进:Pre负责上下文计算 ·大规模模型无期受单卡片上内存限制。 上下文。传统推理架构中,KVCache与单个实例 Decode负表Token生成、Cache负状态共享, 期定,不同实例之间KV无法共享,同一历史上下文 计算资源从“多个孤立设备”转变为“共享内存的 00 40 大型计算机 Global Scheduler 一 一 一 高带宽低时互联:降低通信对计算效率的影确 Prufll Chster Decode Chster 大候型尤其是MoE模型,本质上是通信密集型计算, iner-instanoe Router 1! Inter-instance Router 1 超节点通过高速互联和内存语文访问,将传统网络 Prufil instance Decodnginstanoe 通信转化为更接近本地访问的数照交换方式,大帽 rtra-inetance Router 降低通信开销。 32 64 288 Atin: Hytrid Parslelsn Ain: DP320 Ckeye Moget 其价值不仅是提升峰值算力,更重要的是:让更多 MoE: EP2 Mol: EP320 计算资源真正参与Token生产,而不是等特数据传 NPUserstn) 编,这些创新应接转化为业务收益一一在 2-14 DeepSeekV3大EP RDMAPane DeepSeek、Qwen等MoE模型推理中,端到瑞性 能获得3借以上提升,有力验证了超节点架构对 Token产出效率的实际增益。 图2-16基于节点+DeepSeek的P-D-C全对等构 ADC白书2026 一结I理设暂中心的[35
OCR:IMG:可以看到,Scale-Out网络承载的通信对象正在从 态优化通信路径:端网协同拥塞控制则通过网卡与 4、A存储:算力集群的长期记忆 传统的数据交换,扩展到模型状态、计算激活和上 交换设备协网,实现更低排队、更低尾延退的传 Agent时代,KVCache正在成为影响推理成本 Coding为例,任务持续数小时挺至数天,上下文达 下文记忆,成为支撑A推理集群规模化运行的关键 输,核心价值:提升网络带宽利用率,保障Token 和性能的关键手酸。典型Agent任务包含多轮工具 64K、128K基至百万Token级别,单任务产生的 基础没施。 生产的稳定效率。 调用和上下文交互,后续请求通常复用大量已有上 KVCache可能达到数百GB基至TB级别,如何长 下文,仅追加少量新内容,这种“只增不改”的交 期保存、共享和调度KVCache,正或为Allnfra Scale-Out网络的关键技术趋势 互联滨进:从单数中心走向跨算力域 互模式,使KVCache具备极高复用价值,以Ai 必须解决的新问题。 睡着A1集群从干卡走向万卡、十万卡规模, 图向大模型训练和互联网海量雅理等场景,A集群 Scale-Out网络正在围绕规模扩展、效率提升和购 会进一步扩大,网络互联将可能突敬传统数据中心 域互联持续演进。 边界, KVCache给Ai基础设施带来的关键挑战 架构演进:从多级Clos走向多平面与南平化组网 一方面,传统电交换网络在万卡,十万卡规模下 关键热战 简要说明 传统多级Clos网络随着规模扩大,会带来更多网络 面功耗和扩展压力,光路交换(OCS)开始 层级、更高互联成本和更大通信时延。多平面组网 入大规模A网络。OCS通过在光域建立高速查 片上内存存不下 超长上下文(64K~1Mtokens)导致单任务KV 将一张大规模多级Clos网拆分为多个彼此按立的概 连,减少传统交换层级,降低大规模互联的功耗 Cache高达数百GB基至TB级别,整出片上内存容量 层级子网,算力卡接口拆分后分别接入各平面,等 和时冠,但由于其连接模式更适合稳定、大规模流 效于把端口资源最大化地让给算力,同等端口开销 量,动态突发流量仍需要电交换承担灵活调度,两 下,可细网规模提升一个数量级,核心价值:突破 N 传统分级存储VO时延高 数据从NPU到SSD需经过DDR、PCl交换等多级中 者将在末来长期协同存在。 转,显著增加访问翅迟,难以满足推理的实时性要求 集群规模边界,让网络跟题算力持续扩展。 另一方面,受展于电力、土地和胶热资源,算力正 通信优化:从静态转发走向智能调度 在突破单一数据中心边界,Scale-Across(跨四 KVCache的频策读写会产重加别SSD的塞写磨损, A通信具有大带宽、高井发、流量模式复杂等特 区、跨数据中心算力互联)成为新的发展方向。未 SSD频繁塞写寿合短 每日全盘擦写次数(DWPD)可达10次以上,显著降 点,传统哈希负载均衡容易产生链路不均和通信瓶 来,头部企业将探素跨地域算力协同,更多企业 低SSD使用寿命 ,网络级负载均衡通过感知全局流量状态,动 可通过跨园区推理多活和容灾提升A服务可靠性。 同城DC 同城DC 超节点 超节点 节点 1- ScalaOn Scale Across 同城,+KM以内 图2-21持数据中心算力互联 AIDC白皮2026 公众号·智能交通技术
OCR:IMG:突破Token生产瓶颈的关键技术 资源需求冲突:Preti是高算力消耗型任务, 2、图统数据流动效率的三大优化方向 着Agent任务复杂度持续提升,多级分布式KV 除A芯片微构革新外,AlInfra的核心演进方向也 Decode则是高带宽消耗型任务, 在此基础上,进一步围绕数据流动效率开票三个方 Cache已成为Ai infra降任准理成本、提升资利 是聚集于数据流动效率:让不网阶段匹配不网资 向的优化 用率的关健能力。 通,让数据更少搬、更快到达计算单元。 ·合部著互拖累:长Promp的Prel请求占 用大量计算资源,明Decode的实应:为 减少数据服移:降低无效访问 提升数据供给航力:增强单节点Token生产效率 1、架层里构:Prefil-Decode解分离 了保障Decode的低时延与SLA,系统又必须频 随着上下文长度与对轮次急剧账账,KVCache 即使减少了无效数据搬移,随着模型规模持续增长 传统方案将Pr与Decode在网一集中,易引 留内存与算力,导效Pre算力利用率低下。 带来的存健与传输开销或倍放大,核心思路是尽可 和上下文不新加长,单个计算节点仍然面指巨大的 发费结配与性干批(Had-of-LneBiocing): 能复用计算结果、减少不必要的数据搬够: 数据供始压力。特别是在Decode阶段,硬型参数 和KVCache要持续供应给计算单元,因此,Al KVCache优化:通过压略、量化、淘达和高效管 intra离要提升整个节点的数供给航力,让计算单 调度器 理量路,降低KVCache的存继规模和访间压力: 元持续获得所数据,减少“等数据”的空转时间。 如LLM的PagedAnention,通过分页式管理提开 KVCache利用效率 高有效带宽存储体系:结合高规格存储介质,先进 封装与数据压缩/量化技术,全图突存储卷社系 Prefi集群 Decode集 PrefixCache:复用公共的上下文的计算结 ,最大化提升送人计算单元的单位时间有效数回量: P实例 D实D实例 D实例 ,避免重复的Pre计算,大幅减余数据生 P实 KVCache 成与搬运,用于多轮对话、固定SystemPrompt 存网网硬计:优化CPU、NPU、SSD之间的 推理引VLLM 理引vLLM 及Agont工具调用等场景: 数据流动路径,减少数据搬够开销,如华为NDS 智服务器 智算服务器 (NPUDirectStorage)等,通过数直通技术 多KVCache架梅:利用片上内存、DRAM内 能短数据访问路径: 存、SSD等不网存储级,根据数据访问顺率进行 热KVCache的分级管理与动态调度, 超节点构:通过高速对等互联总线,将多个A芯 片细织统统一计算单元,突破单芯片和单服务著资 构建片上内存+DRAM内存+SSD多级KV存 源限制,提高单节点模型承载能力粒推理吞吐, 参数面网络 如华为屏腾Atias超节点等。 禁上内存 十-百V 优化购芯片数据流动:突破大规模模型扩展斯领 2-8Profil1-Decode(P-D)分 DRAM 随着模型规模不断扩大,尤其是MoE构逐渐成为 -TB||V 重要方向,模型参数和计显任务被分布到多个芯片 P-D分离架构通过将商个阶段拆分到不网资源池 Decode集群:重访存带宽与通信互连 SSD 甚至多个节点,此时,不两只是单个芯片内部 实现异构负数的最优匹配 提升单位时间Token产出速率(TPOT) -P|V 的数据访间,而是不同计算责源之间的数题交换效 率,因此,离要进一步优化跨芯片、跨节点的数据 -Pre集群:重高否吐与算力利用率,通常采 其本质量解决塞理阶股之间的资源错配问题,让计 消动,让分布式计算资理形成高效协间的Token生 用高算力密度芯片,能短首Token时延(TTFT)。 算资源与业务负载更加匹配。 2-9多层级KV存 产系统 ADC日书2026 一地C设中心的(29
OCR:IMG:2、高可用调度:让A服务从“可请行”走向“持续 ·优先保障Decode持续运行: L4-A服务平台层:Token生产闭环的最后一环 运行 ·过降Pref弹性收短期冲击: 超节点集群将大量计算芯片、高通网络和存储组成 Allnfra的终目标,是将底层计算资理持续持化为 二者共网完成从庭层计算资源到企业级A服务的能 ·结合任务迁移、状态恢复和院节点重调度,降低 复杂系统,规越大,单点故障账率越高,对于金 可交付、可运营的暂能力,节点提供高效算力 力转化 故障影明。 、能源,改务等关键业务,A服务不仅常要运 供给,算力调度提升资源利用效率,而A服务平台 进一步连接模型、数据与业务应用,完成从算力资 硬型运行:释放A算力价值的核心软件引 行,更南要长期稳定运行。 未来高可用目标,是让故障从“服务中断事件”变 源到智能生产的价值转化。 硬型运行主要包括推理引掌和训练引缘。 成“资调整事件”. 因此,高可用调度需要从单点保护升级为图向业务 A服务平台主要包括三个核心能力: 推理引章负责将训练见或的根型转化为持续输出 连续性的系统保障。 3、智能消度:从资源管理走向A生产优化 Token的生产能力, 传统调度关注:哪查有空闲烫源?A时代需要进一 模型运行服务:将算力转化为Token生产力 多级部署:控制故障影响范围 步回答:“什么资源,在什么时间,以什么方式服 通过模型部署、推理优化和行管理,实现稳 代表技术包括MindIE、vLLM、SGLang等,其 通过多级资源隔商和瓦余部署,实现放障离: 务什么任务,前核产生最大业务价值? 定、高效的模型推理服务: 心价值在于,在有限硬件资源下,通过模型优化、 调度优化和款硬件协网,最大化Token生产效率, 超节点内: 因此,调度系统正在从资管理平台演进为A生产 数据基础服务:让Token具备企业知识能力 着大模型进入生产阶股,推理引擎正在从“硬型 通过多实例部圈,降低单卡或模决故障影明: 优化系统 通过知识库、数据管理和上下文服务,将企业 执行工具”演进为“A运行时平台”,主要体现在 数据转化为模型可理解、可调用的图能资产: 三个方图: 群内: 城知:建立AI负数品像 不同模型、不同任务具有不同资源特征:计算密 Agent行环填:让Token动业务行动 D-1 抛超节点邮署,抵节点级故障: 度、内存容量、内存带宽、信硬式,调度平台震 通过Agent框策、工具调用和任务编排,使模 第一、从型适配走向系统同优化,推理引 要形成模型级、任务圾算力面像,实现精准匹配。 型输出进一步转化为业务说程和自动化执行。 需要支持MoE、多模态、长上下文等复杂 数据中心间: 模型,并与超节点、网络、存储系统协同设 跨地域部署,应对机房级灾难。 预图:从被动扩客到提的现划 三者共同构成从算力→Token一知识一行动的 计,实现端到端效率握升。 传统扩能容依实时间值,未来调度将结合A预 :预测业务流量、提前准备资源、动态调整算力 暂能生产闭环,推动AInfra从资供给平台演进为 -02- 调度范图盖到哪里,故障隔离能力就伸到那里, 尚业务价值创造的智能生产平台。 供给,从“看到需求再响应”,走向“预则需求提 第二,从单实例优化走向集群级效率优化,通 前布局 1.硬型运行与服务:算力转化为Token的核心引 过PD分离、KVCache管理、连续批处理等 暂能恢复:从放障恢复到业务连续 超节点提供高密度算力供给,型运行与服务负责 机制,提高整体否吐能力,降低单位Token A推理不网验级的重要性不同,在户D分离架构下: 决:面向业务价值的全局调度 将这查计算资源转化为可持续交付的A能力,这一 生产成本, -Decode接影用户当前生体验: 未来企业可能问时拥有:多个超节点、多代算力资 源,调度系统常要根据业务价值,在全用范围优化 包括两个核心组成: -03- -Pre主要影新请求进入度。 资源:高优任务优先保障、低优任务得性运行、 型通行(ModelRuntime):决定Token生产 第三,从模型服务走向暂任务运行。随着 因此,面对爽源波动或故障时,调度系统离要具备 构资源统一利用。 效率: Agen、多轮交和杂工作流起,推理引 业务感知能力,例采用“P保D” 硬型服务(Model Serving):决定A能力交付 需要支持更长用期,更复杂的船能任务执行。 效率, ADC日度书2026 一地C出理设中心的4
OCR:IMG:-层次化KVCache:面向超长上下文推理,实现性能、体验、或本接合优 全局层次化KVCache共享体系 照级 名称 容量 时 KVCache 超节点 超节点 L1 片上内存 数十-百GB 奶秒级 活联KV,承载当前差理实例正在使用 NPU NPU NPU NPU NPU NPU 的热数据,提供最低延迟访间 L2 DDR内存 TB级 百纳形级 热KV,承载短期会话上下文,缓解片 上内存容量压力 CO OU L3 共享KV Cache 数+TB级 提秒级 温KV,在超节点题图内复用上下文, DOR内存 DDRA存 NDS直通 DDR内存 DORA存 实现购实例存共享 点内KVCache共享池 节点内KVCache共享池 集级A存信 PB 毫秒级 冷KV.提供跨超节点的持久化KV Cache理 Se-Ou() KVCache将根据访问额率和时延要求,在不网层 语义,通过生命周期感知合与图能磨损均衡,将 之间自动流动:热数据鞋留高速存绪(片上内存 写入放大降低70%以上,使每日全盘写入次数 /DDR内存)、温数据进入共享缓存池、长期数据 (DWPD)从10次以上降至3次以内,存储寿命 AI存储 进入大容量存储,最终目标是:将分散在不间计算 长2-3, KV语义卸载 全用磨损均衡 多流写入(冷热识别) 资源中的KVCache统一管理,使上层推理服务无 节点KVCache共享地 关注KVCache的物理位置,而够像访问统一 对于长上下文Agent应用,决定推理成本的不仅是 SSU SSU S5V SSU SSU 记忆空间一样用企业级KVCache能力. 算力规模,更是系统能西持续保存、共享和复用上 下文状态。在AgenticAl时代,具备统一上下文管 从主机搬运到NPU-SSD喜连(NDS):增短KV 理能力的AlInta,将以更任成本、更高效率支撑持 访问路径 续性的制能生产。 图2-22网存的多KV存日标构 传统架构中,KVCace访问通常需要经过存储 议栈-主机CPU-内存多级搬运,增加访问时起和资 源消耗,未泉A存健将通过A芯片直通访问、KV 从局部缓存到全周居次化KV共享池 又卸载、内存语义协议等技术,增计算芯片与存 着多级KVCache体系形成,存管理能力将或为Ai基础设地的公共能力,多个超节点之间可以共享KV 健之间的访路径,使KVCache访问逐接近内 Cache,使任推理实等复用已有KVCache,高PrefixCache命中率 存访问体验。 从SSD到SSU:提升存储介质寿命 SSD将向语义化存健单元(SSU,Semantic Storage Unit)演进,SSU感如KVCache数据 2ADC白书2026 一地CI设数中心的(43
OCR:IMG:A也给数据中心的安全带来了极大的冲击,数据中 风险,数据中心外部黑客动基于AI大模型的自动 三者构成一个完整的价值错条:Agent驱动Token “3P"参考框架 心内部的Agnt自主规划执行带来越权和数据泄露 化攻击也让传统防御体系面代差劣势。 消,Token消耗决定算力需求,算力需求决定瓦 P1:Production(智能生产运营)→P2:Prov- 特消耗,规地设计需要在每个环节上做出取舍和平 sioning(自治运维保障)一P3:Protection(变 衡,缺少了任何一个T的考量,ADC的规划都是 全防线构筑) 以"3T+3P"为核心的A1DC新范式 不完整的。 A算力本身已经成为生产要素,数据中心的定位也 是主要子盾,业务部门关注的问题是:“每天能等产 在发生变化:从或本中心到价值中心,其价值不再 出多少有效Token? 体现为“拥有多少资源”,而是体现为“能持续生 Production智生产运 成多少价值,行业公开数据量示,2025-2026 AIDC的规划设计需要一套全新的系统性思维,我 从藏力资源运营到A生产运营新范式 年中国头部科技企业A相关资本开支(Capex)同 们称之为以*3T和“3P”为核心的参考框架: 比善连增长50%以上:其中字节跳动2026年A基 设领域投入规模已上调至2000亿元以上, “3T”参考框架 Provisioning自运 P1 Protection安全防线构筑 T1:AgenT(应用驱动)一T2:Token(算力 同时头部企业的A基础设施团队正从运维成本中心 运营)一T3:WatT(物理支撑) 从设备运维到生产运维保理 P2 P3 构零任智体、强化内生安全,A的A 转向AI产能运营都了”,“机房有多少台服务著”不再 传统应用 AI应用 图1-2'3P考楼 Application 前自 店用工具 生产运营以Taken为计量单位动智能价值创造, 支撑、协网联动,共网保障AIDC从算力资源到 重构 业务国中台 运维保障以自治化手段保障系统连续可靠,安全控 价值的稳定转化。 BEAEEN 加讯 收 制以零信任和A防A守住业务安全他线,三者相互 以通算为中心 以智算为中心 AlInfra 重构 传统机房 AIDC机房 AIFacillty MW OWI 置构 供电 20 供电 30 R 中心 心 图1-1*3T'考 ADC日书2026 一CI中心的13
OCR:IMG:02 ” 每一次产业革命,都以基础设施的重建为先导。当智能需求的选代速度超越建设 周期,数据中心的规划逻辑与工程标准必须整体重写。新范式不止于架构图上的 第二章 设计,更要落成可建设、可交付的工程体系。 AIDC规划与建设 2.1 Agent-Centric应用与生态 进入AgenticAl时代,全业Al应用正从单次模型 设以Agent为中心的应用与生态,推动A真正入 调用走向长用期、复杂任务的完整交付,实现从 核心生严场景, “Token”到“任务”的本质联迁,这要求企业建 围绕“AKDM”参考框架进行规划 欧 Agent进入企业核心生产流程,单靠模型能力远 Knowledge:提供企业认如,将业务规则、流程 远不够,它需要知识来理解业务边界,需要数据 经验和本体沉淀为可复用资产 来支撑精准执行,要模型来能动推理决策,围境 “AKDM”相架建设企业AI应用与生态,是A规模 Data:提供可信事实,让每一步执行基于准确、实 福 化落地的关键: 时、可追的数 Agent:承担执行中柜,把组积的意图转化为任务 Model:提供据理引,支撑理解、生或、判断和 和行动 规划 应用/工具 网关 Agent 模型 如识 数 ModelA Model B ... 道算 存储 智 图2-1国AKDM考进行规划 ADC白度书2026 一回C10显设暂中心的[15