d-Matrix 采用 NVIDIA NVLink Fusion 推进机架级 XPU 部署
- 作者

- 姓名
- Nino
- 职业
- Senior Tech Editor
人工智能(AI)硬件基础设施正在经历一场深刻的变革。随着 DeepSeek-V3、Llama 3.5 以及 Claude 3.5 Sonnet 等大语言模型(LLM)参数量迈向数千亿级别,企业生产环境中推理吞吐量的主要瓶颈,已经从单纯的 FLOPS 计算峰值,转移到了内存带宽以及节点间的互联延迟上。
在近期的一项重大基础设施更新中,知名 AI 推理芯片厂商 d-Matrix 正式宣布其下一代 Raptor XPU 架构将全面引入 NVIDIA NVLink Fusion。这一战略合作将 d-Matrix 标志性的数字存内计算(Digital In-Memory Computing, DIMC)技术直接融入 NVIDIA 的 NVLink Scale-Up 互联生态、NVIDIA MGX 模块化机架架构以及 Spectrum-X Scale-Out 网络中。
对于依赖 n1n.ai 等统一 API 平台来获取高速、稳定且具性价比 LLM 调用的开发者与企业架构师而言,这一硬件层面的突破预示着实时 AI 推理成本与延迟的进一步大幅降低。
技术瓶颈分析:为什么计算核心需要 NVLink 高速互联?
在大模型推理的工作负载中,通常分为两个关键阶段:Prefill 阶段(计算密集型,并行处理 Prompt Token)和 Decode 阶段(内存带宽密集型,自回归逐字生成 Token)。
当推理任务扩展至机架级(Rack-Scale)硬件集群时,传统的 PCIe(Peripheral Component Interconnect Express)总线成为了制约系统性能的致命瓶颈:
- PCIe Gen 5 带宽限制:标准的 PCIe Gen 5 x16 插槽双向带宽仅约 128 GB/s。对于需要频繁从显存提取模型权重参数的自回归生成任务,PCIe 带宽极易导致计算单元陷入饥饿状态。
- 跨芯片通信延迟高:传统网络拓扑在执行张量并行(Tensor Parallelism)或流水线并行(Pipeline Parallelism)时,会产生微秒级的通信开销。
- 内存碎片化与拓展困难:缺乏统一的高速内存互联总线,使得分布在不同卡上的内存无法高效共享,迫使开发者采取激进的量化手段或承担高额的序列化开销。
d-Matrix 针对内部计算与内存的瓶颈,提出了 数字存内计算(DIMC) 方案。通过直接在 SRAM 存储阵列内部执行矩阵乘法运算,d-Matrix Raptor XPU 实现了远超传统 HBM(高带宽内存)或 DDR 架构的内存带宽效率。
然而,当 DIMC 扩展到多卡及机架级别时,依然需要极其强大的外部互联织物(Fabric)。通过集成 NVIDIA NVLink Fusion,d-Matrix 将其超高速的存内计算架构与 NVIDIA 专有的高速互联协议打通,实现了单 XPU 高达 1.8 TB/s 的跨节点通信带宽。
深度拆解:NVLink Fusion、MGX 与 Spectrum-X 的融合架构
为了清晰理解这一技术集成的优势,我们需要对 NVLink Fusion 生态的核心技术组件进行拆解:
+-----------------------------------------------------------------------+
| NVIDIA MGX 机架 |
| |
| +-----------------------+ +-----------------------+ |
| | d-Matrix Raptor XPU | | d-Matrix Raptor XPU | |
| | (DIMC 存内计算引擎) | | (DIMC 存内计算引擎) | |
| +-----------+-----------+ +-----------+-----------+ |
| | | |
| +===================+===================+ |
| | |
| NVIDIA NVLink 交换机 |
| (单节点高达 1.8 TB/s 双向带宽) |
| | |
| +===================+===================+ |
| | | |
| +-----------+-----------+ +-----------+-----------+ |
| | NVIDIA Host CPU/GPU | | Spectrum-X 网络卡 | |
| +-----------------------+ +-----------------------+ |
+-----------------------------------------------------------------------+
1. NVLink 互联织物(Fabric)集成
NVLink Fusion 允许第三方芯片厂商(如 d-Matrix Raptor)直接接入 NVLink Switch 系统。这使得 Host CPU、NVIDIA GPU 与 d-Matrix XPU 之间能够建立直接的片间(Chip-to-Chip, C2C)内存寻址。开发者可以在异构 XPU 组合上直接运行张量并行算法,而无需绕道缓慢的主机 RAM 或 PCIe 路由。
2. NVIDIA MGX 模块化机架标准
NVIDIA MGX 是一种模块化参考架构,旨在简化高性能 AI 数据中心服务器机架的制造过程。通过兼容 MGX 标准,d-Matrix XPU 可以无缝插入现有的企业级机架中,与 NVIDIA Grace CPU 或 H100/H200/B200 等加速卡在同一机箱内高效协作。
3. Spectrum-X 以太网 Scale-Out 扩展
如果说 NVLink 解决了机架内部(Scale-Up)的高带宽通信问题,那么 NVIDIA Spectrum-X 则通过 RoCE(基于融合以太网的 RDMA)技术为跨机架(Scale-Out)集群提供了无损网络传输支持,确保集群规模扩展至成千上万个节点时吞吐量依然呈线性增长。
性能对比:传统 PCIe 方案 vs. d-Matrix NVLink Fusion 方案
下表展示了传统企业级推理节点与采用 NVLink Fusion 的 d-Matrix Raptor 机架配置的各项关键指标对比:
| 技术指标 | 标准 PCIe Gen 5 集群 | d-Matrix Raptor + NVLink Fusion | 性能提升倍率 |
|---|---|---|---|
| 互联带宽 (Interconnect Bandwidth) | ~128 GB/s (PCIe x16) | 最高 1,800 GB/s (NVLink Fabric) | 带宽提升 14 倍 |
| 节点间延迟 (Inter-Node Latency) | ~5.0 至 10.0 微秒 | < 1.0 微秒 | 延迟降低 5 倍以上 |
| 核心内存架构 | 片外 HBM3 / DDR5 | 片内数字 SRAM (DIMC) | 彻底消除 HBM 供货与带宽瓶颈 |
| 目标计算场景 | 训练与推理混合部署 | 专为低延迟高吞吐推理优化 | 极致性价比与能效比 |
| 机架系统兼容性 | 厂商自定义专有机架 | NVIDIA MGX 模块化标准 | 即插即用,极佳的兼容性 |
通过将跨节点通信延迟压低至 < 1.0 微秒,并最大化 SRAM 的读写带宽,d-Matrix 方案为生成式 AI 实时流式响应(首字延迟 TTFT 及每 Token 生成时间 TPOT)提供了强有力的硬件支撑。
像 n1n.ai 这样的统一 API 平台,正是基于底层硬件基础设施的不断迭代,才能为全球开发者提供低延迟、高可用的大模型接口服务。
开发者实战:测试与评估 LLM API 端点延迟
当硬件基础设施升级到 NVLink Fusion 这类高速互联架构后,上层应用开发者最直观的体验就是 Token 流式输出速率的显著提升以及首字延迟(TTFT)的降低。
以下是一个使用 Python asyncio 和 httpx 编写的完整基准测试脚本,用于精确测量调用 n1n.ai 等大模型 API 时的 TTFT 与 TPOT 性能指标:
import asyncio
import time
import httpx
import json
# 用于测量 LLM API 首字延迟 (TTFT) 和单 Token 生成时间 (TPOT) 的基准测试脚本
API_KEY = "YOUR_N1N_API_KEY"
API_URL = "https://api.n1n.ai/v1/chat/completions"
async def benchmark_llm_latency(prompt: str, model: str = "gpt-4o"):
headers = \{
"Authorization": f"Bearer \{API_KEY\}