AI 工厂是一种新型基础设施,旨在制造实时运行且不间断的智能。在工业时代,发电厂将能源转化为电力;而在AI时代,AI工厂则将能源转化为Token——这正是推理模型、智能体以及各类智能系统的基本生产单位。
AI 工厂的经济效益由产出指标来定义:每秒生成的Token数量、每瓦特产出的Token数、单个Token成本,以及资源利用率和系统正常运行时间。在这种模式下,每瓦特性能直接转化为营收,而单个Token成本则决定了每一座AI工厂的经济效益。
AI 早已不再仅仅是软件,它已成为不可或缺的基础设施。
AI 工厂将超大规模的基础设施转化为源源不断的智能生产力。
AI 工厂能够在响应数十亿次请求的同时,同步调度海量计算资源。这些工厂由软件进行编排,内部运行着不间断工作的自主多智能体系统,全天候生产智能。这些智能体系统结合性能顶尖的AI模型(比如NVIDIA Nemotron等专有模型及开放模型)进行推理与规划。此外,开放模型能针对企业的特定领域需求进行定制、优化并安全部署——而这一切,都在AI工厂内一站式完成。
如今已投入实际生产的AI工厂,已在整个技术栈上实现了全面优化——涵盖模型、计算、网络、内存、软件、存储、电力和冷却等各个环节,以确保智能的持续输出。
在 AI计算领域,每瓦特性能已然成为衡量AI工厂竞争力的终极标准。过去,数据中心用于存储文件;如今,AI工厂则用于生产Token。对于AI提供商而言,这一产出直接决定了其营收;对于企业用户而言,单个Token成本则决定了他们能否实现AI的规模化盈利。
SemiAnalysis InferenceX基准测试,用现实应用的指标量化了这一转变。NVIDIA Blackwell Ultra GPU能够实现目前最低的单个Token成本,使得AI工厂能够在相同的功耗范围内,以更低的单位成本产出更多的智能。每瓦特产出更多的Token,意味着在同等的基础设施成本、空间或功耗下,能够获得更高的吞吐量。而更低的单个Token成本,则显著改善了大规模推理的经济效益。
基于NVIDIA Blackwell Ultra构建的AI工厂,每兆瓦的吞吐量提升了高达50倍,从而将单个Token成本降低至1/35——在规模化应用中完美平衡了性能、响应速度和能效。NVIDIA Dynamo框架则有助于编排长上下文推理和海量推理吞吐量,确保在工作负载日益交互化和复杂化的情况下,依然能保持极高的资源利用率。两者结合,充分展现了如今衡量AI工厂性能的新标准:即一座工厂能够以多高的效率实时产出智能。
NVIDIA Vera Rubin平台进一步推高了这条性能曲线。随着推理和智能体AI的规模不断扩大,基于Vera Rubin的系统旨在通过LPX技术,将每瓦特性能最高提升35倍,并凭借更深层次的全栈优化进一步降低Token成本。其最终成果,就是在工厂层面实现更加高效的智能生产。
AI 工厂可以从小规模起步,支持单一的业务部门或特定工作负载;也可以从零开始进行整体构建,以支持超大规模的高性能AI推理与训练。NVIDIA DSX参考设计将设计、仿真、运营以及生态系统技术进行了统一整合,旨在以最低的每兆瓦Token成本来构建十亿瓦级的超大型AI工厂。
构建这种十亿瓦级的AI工厂,需要的远不止是优化后的计算能力。它还需要一个共享的数字环境,以便在动工建设之前,将设施设计、硬件系统、电力、冷却和运营等环节进行联合建模,并在部署后持续进行优化。NVIDIA Omniverse DSX Blueprint通过连接设施、硬件和软件的数字孪生技术来支持这一工作流。它利用Omniverse、OpenUSD和SimReady资产,帮助合作伙伴验证设计方案股票配资在线,并在AI工厂的整个生命周期内优化运营。
元鼎证券:平台特点解析与最新证券业务服务指南提示:本文来自互联网,不代表本网站观点。