8月25日,思科与NVIDIA宣布将Cisco Secure AI Factory with NVIDIA参考架构扩展至机架级时代。这意味着企业建设AI基础设施,正在从单纯采购GPU,转向涵盖散热、网络、安全、管理和运维在内的整体工程交付。
这套机架级AI方案主要解决什么问题?
新方案面向企业AI应用不断提升的计算需求,集成支持从机架到织物的液冷散热,可支撑单机架超过200千瓦的功率密度。其重点并不只是把更多GPU放进一个机架,而是试图同时解决高功耗环境下的散热、网络连接、运行管理以及故障排查问题。
从应用场景来看,该方案主要面向三类任务:
- 推理型应用:为生成式AI等应用提供持续运行所需的基础设施支持。
- 智能体AI:支持智能体调用工具,并在相关沙箱环境中执行任务。
- 万亿参数模型训练:面向规模更大的模型训练需求提供底层算力与网络基础。
网络部分如何连接GPU与AI工厂?
在网络架构上,方案采用前后端分工的方式连接GPU和相关设备。
横向扩展网络采用NVIDIA Spectrum-X
在横向扩展部分,思科采用NVIDIA Spectrum-X交换芯片,并运行思科的NX-OS或SONiC系统来连接GPU。这一部分承担的是AI基础设施内部的扩展连接任务,重点在于支撑大规模GPU之间的网络组织。
前端网络由思科Silicon One芯片承担
在前端网络部分,思科使用Silicon One芯片承担同样的组网角色。这样一来,方案既覆盖了AI工厂内部的横向扩展连接,也覆盖了前端网络侧的连接需求。
简单来说,企业不再只是购买单独的GPU服务器或交换设备,而是需要考虑GPU如何连接、前端如何接入、不同网络部分如何协同运行。
思科和NVIDIA如何弥合AI部署鸿沟?
思科网络工程高级副总裁Will Eatherton与NVIDIA解决方案架构副总裁Marc Hamilton在theCUBE直播活动中介绍了双方的合作思路。
双方关注的核心问题是:企业从采购设备,到真正让AI应用稳定运行,中间仍然存在明显的部署鸿沟。设备买回来并不等于AI工厂已经建成,企业还需要处理网络连接、系统管理、安全防护、故障定位和运行维护等一系列问题。
因此,这套方案的重点是把不同基础设施组件纳入相对统一的体系中,让企业在建设AI环境时,不必只关注单个设备的性能,还要同步考虑整个系统如何部署和运行。
Nexus One和Cloud Control分别发挥什么作用?
Nexus One:提供统一网络管理平面
方案整合了思科此前推出的Nexus One统一网络管理平面。从来源内容来看,Nexus One承担的是统一管理网络基础设施的作用,帮助企业把不同网络部分纳入同一个管理体系。
Cloud Control:面向智能体IT运营
方案还整合了面向智能体IT运营的Cloud Control平台。该平台与智能体应用场景相对应,并提供内嵌安全和可观测性能力。
这意味着企业在运行智能体AI时,不仅要让智能体完成任务,还要能够观察系统状态、识别异常,并在出现问题时进行定位。对于需要调用工具、访问沙箱环境的生成式AI应用而言,这种运营能力尤其重要。
为什么说这不只是一个机架级方案?
Marc Hamilton强调,这套方案并不只是单纯的机架级解决方案,而是覆盖整个AI工厂的体系。
当生成式AI应用需要调用沙箱中的智能体执行工具调用时,问题可能并不只出现在某一台服务器或某一块GPU上。跨越前端和后端网络之后,企业需要对整个链路进行观察、定位和调试。
例如,智能体调用工具后没有得到预期结果,运维人员需要判断:问题究竟来自应用、沙箱、网络连接,还是后端GPU和相关基础设施。此时,如果不同环节各自使用独立的管理方式,故障排查就会变得更加复杂。
因此,方案强调建立统一的运营基础,把前后端网络、AI基础设施、智能体运行环境以及安全和可观测能力联系起来。
企业AI建设正在发生怎样的变化?
从这次方案扩展可以看出,企业AI建设正在从“买卡”走向“整体工程交付”。
过去,企业可能更多关注GPU数量、算力规格或单台设备性能。但随着模型规模扩大、智能体应用出现,以及AI任务对持续运行和复杂网络连接提出要求,企业必须同时考虑以下问题:
- 功率密度:单机架功率密度超过200千瓦后,散热不再是附属问题,而成为基础设施设计的重要部分。
- 液冷能力:从机架到织物的液冷散热被纳入方案,说明高密度算力环境需要更系统的散热支持。
- 网络协同:GPU、前端网络和横向扩展网络需要在统一架构中协同工作。
- 运维复杂度:AI应用、智能体、沙箱、工具调用和后端基础设施之间的链路更长,故障定位和调试难度随之增加。
- 安全与可观测性:AI系统不仅要运行,还需要持续观察状态,并具备内嵌的安全能力。
网络设备商与芯片厂商的深度绑定意味着什么?
思科与NVIDIA的合作将网络设备、网络芯片、GPU连接、液冷散热、统一管理平台和AI运营能力组合到同一套方案中。这种合作能够帮助企业减少从设备采购到实际部署之间的衔接工作,但也会带来新的行业影响。
来源内容指出,网络设备商与芯片厂商的深度绑定,将进一步抬高行业进入门槛。原因在于,企业AI建设越来越依赖完整的技术体系,而不是某一个孤立产品。想要参与竞争的厂商,需要同时具备硬件、网络、软件管理和运维服务等方面的能力。
这也说明,AI基础设施竞争正在从单点性能竞争,转向全栈能力和整体交付能力竞争。
结语:AI工厂的难点已经不只是算力
从机架级液冷,到GPU网络连接,再到统一管理、安全和可观测性,这套方案反映出企业落地AI时面对的真正难题:算力只是起点,如何让高密度基础设施稳定运行,如何让复杂网络能够被管理,如何在智能体调用工具时快速定位故障,同样决定着AI项目能否真正投入使用。
我认为:企业AI建设像一座刚刚开始运转的工厂,GPU是机器,网络是道路,液冷是维持机器运转的空气,而统一管理和可观测性则像工厂里的灯。只买机器而不修道路、不装灯,工厂自然难以长久运行。如今行业从“买卡”走向“整体工程交付”,看似是方案变得更复杂了,实则是AI从展示能力走向真正承担任务之后,必须面对的现实。门槛会因此升高,但能够把算力、网络与运维真正接起来的企业,才更有可能让AI从设备清单上的名词,变成持续工作的生产系统。
#AI算力
© 版权声明
文章版权归作者所有,未经允许请勿转载。






