8月25日,在Hot Chips芯片大会上,一家人工智能公司首次公开了自研推理系统Jalapeño的首批基准测试结果。从目前披露的信息看,Jalapeño并不只是单独设计一颗芯片,而是试图把模型、芯片、内存、网络和AI产品放在同一套系统中协同优化,目标是同时提升推理速度、并发服务能力与能源利用效率。
Jalapeño的测试结果说明了什么?
在SemiAnalysis的InferenceX基准测试中,Jalapeño相比当前最先进的推理处理器,取得了更高的单用户token输出量和每千瓦功耗吞吐量。
简单来说,这两项指标分别关注两个问题:
- 单用户token输出量:在单个用户请求下,系统能够以多快的速度生成内容,关系到用户等待响应的时间。
- 每千瓦功耗吞吐量:在相同电力消耗下,系统能够处理多少AI工作负载,关系到数据中心的能源利用效率。
该公司硬件负责人Richard Ho在媒体电话会上表示,测试结果显示,Jalapeño相对业界最先进水平实现了显著性能提升。按照这一说法,Jalapeño既能够在单位电力下服务更多AI工作负载,也能够更快返回响应。
这意味着,它的设计并没有只追求某一项指标,而是同时考虑了两类常见需求:
- 面对大规模用户请求时,保持较高的并发服务能力;
- 处理单个请求时,尽可能降低响应延迟。
此次对比对象包括NVIDIA Blackwell系统。来源内容没有披露具体测试分数,但明确指出,Jalapeño在单用户输出速度和单位功耗吞吐量方面取得了更好的结果。
Jalapeño是如何被设计出来的?
Jalapeño于去年10月首次公布,由这家人工智能公司与博通紧密合作开发。在研发过程中,该公司的自有模型也参与其中。
这体现出Jalapeño并非按照传统的“先做通用硬件、再让软件适配”的路径推进,而是让模型运行过程中遇到的实际问题反过来影响芯片和系统设计。
从来源内容来看,Jalapeño的核心思路可以概括为全栈设计:
- 模型层面:让系统设计能够适应AI模型的实际运行方式。
- 芯片层面:针对推理过程中的关键计算任务进行优化。
- 内存层面:更灵活地存放和调用模型状态。
- 网络层面:减少不同计算资源之间通信带来的限制。
- 产品层面:让硬件架构服务于实际AI产品的延迟和并发需求。
这种协同设计的重点,不是让某一个部件单独变得更强,而是尽量减少整个推理链路中的浪费。就像一条生产线,单台机器速度很快并不代表整条生产线效率高;如果物料运输、缓存和工序衔接存在瓶颈,最终产能仍然会受到限制。
为什么要重点优化prefill和通信阶段?
来源内容指出,Jalapeño重点优化了推理过程中经常成为瓶颈的prefill阶段和通信阶段。
prefill阶段影响什么?
在AI推理过程中,系统需要先处理用户输入的内容,再逐步生成输出。来源内容将其中的一个关键环节称为prefill阶段。这个阶段如果处理效率不足,就可能拖慢后续响应。
对于包含较长上下文的请求而言,系统需要处理更多输入信息。如果这一阶段占用大量时间,即使后续生成速度较快,用户仍然可能需要等待较长时间。因此,优化prefill,有助于改善整体响应效率。
通信阶段为什么会成为瓶颈?
AI推理并不是单个计算单元独立完成的。计算、内存和网络资源之间需要不断交换数据。如果不同资源之间的传输效率不高,计算单元就可能出现等待,硬件性能也无法充分发挥。
这就像一支分工明确的团队:有人负责计算,有人负责存储,有人负责传递信息。即使每个人工作能力都很强,只要信息传递不及时,整个团队的完成速度仍然会被最慢的环节拖住。
显式放置KV缓存,会带来什么变化?
Jalapeño的一项设计重点,是通过显式放置KV缓存等模型状态,让系统在计算的不同阶段灵活调用合适的计算、内存和网络资源。
来源内容没有进一步展开KV缓存的具体实现方式,但从已披露的信息看,这种设计的目标是让模型状态不再被固定地放在某一个位置,而是根据推理阶段的需求,调用更合适的资源。
这样做可能带来三方面作用:
- 减少资源闲置:让计算、内存和网络资源根据任务变化进行配合。
- 缓解通信压力:尽量减少模型状态传递过程中产生的等待。
- 改善系统响应:让不同推理阶段都能获得更匹配的硬件支持。
换句话说,Jalapeño关注的不是单纯提高某个计算单元的峰值性能,而是试图把推理过程中的数据移动、缓存管理和资源调度一起纳入优化范围。
Jalapeño什么时候会部署?
按照计划,Jalapeño将在2026年底进行小批量部署,更大规模的部署要等到2027年。
这说明,当前公开的仍然是早期基准测试结果,距离大规模商用部署还有一段时间。系统还需要经历小批量部署阶段,之后才可能进一步扩大应用规模。
此外,这家人工智能公司还计划将Jalapeño打造为多代平台,让AI产品、模型、芯片和内存能够持续协同演进。
如果这一计划能够持续推进,那么后续平台升级可能不再只是更换一代芯片,而是围绕模型能力、产品需求和系统架构进行整体调整。这样一来,硬件和模型之间的适配关系也会变得更加紧密。
Jalapeño会怎样影响AI推理市场?
来源内容将Jalapeño的出现视为超大规模AI厂商垂直整合算力供应链的标志性一步。
如果Jalapeño能够在2027年如期扩大部署,影响可能主要体现在两个方面。
第一,推理处理器市场可能面临新的竞争
当前AI产业对高性能推理处理器存在较大需求。Jalapeño如果能够在响应速度和单位功耗吞吐量方面保持已公布的优势,就可能直接挑战NVIDIA在推理市场的份额和定价权。
不过,来源内容只给出了基准测试结果和部署计划,并未披露最终市场份额,也没有说明未来一定能够实现多大规模的替代。因此,实际影响仍要等到小批量部署和大规模部署后才能进一步观察。
第二,数据中心采购格局可能被重塑
数据中心采购硬件时,不仅要考虑单颗芯片的性能,还要关注整体系统的功耗、通信效率、内存配置和并发服务能力。
Jalapeño采用全栈设计,重点优化prefill、通信和KV缓存等环节。如果这些设计能够在真实运行环境中转化为更低的单位成本和更快的响应速度,数据中心在采购推理算力时,可能会拥有新的选择。
这也意味着,未来的竞争或许不再只是“谁的芯片参数更高”,而是“谁能以更完整的系统方案,更稳定地服务更多AI工作负载”。
这项进展真正值得关注的地方是什么?
Jalapeño的意义,首先在于它把竞争重点从单一芯片性能,推进到了模型、芯片、内存、网络和产品的整体协同。
从目前披露的内容看,它试图解决的是AI推理中常见的系统性问题:计算资源并非始终是唯一瓶颈,prefill、通信、缓存和资源调度同样会影响最终速度与能耗。
如果这种全栈设计能够在实际部署中兑现,AI算力市场的竞争方式就可能发生变化。硬件厂商需要更加重视模型和产品,模型公司也可能更加深入地参与芯片与系统研发。
我认为:AI算力的竞争,表面上是在比芯片速度,实际上是在比一整套系统能否少走弯路。单个部件再锋利,若彼此之间互相等待,也不过是把力气耗在门槛上。Jalapeño真正值得观察的,不只是它在测试表上超过了谁,而是它能否把模型、硬件和数据中心的复杂环节拧成一股绳。若它最终能够按计划放量,推理市场的旧秩序或许就会出现新的裂缝。
#算力供应链
© 版权声明
文章版权归作者所有,未经允许请勿转载。






