最新n1n v2.0.1 正式上线!企业级大模型接口聚合平台 (LLM API Gateway),为您接入 500+ AI Models,价格低至 1 折, 立即尝试

NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中展现卓越性能

作者
  • avatar
    姓名
    Nino
    职业
    Senior Tech Editor

随着人工智能应用全面进入落地与商业化阶段,AI 产业的核心关注点已从基础大模型训练逐步转变为高并发、低延迟的推理服务部署。系统性能、高效的基础设施扩展能力以及持续的软件优化,直接决定了企业构建 AI 产品时的经济可行性与投资回报率。在最新发布的 MLPerf Inference v6.1 基准测试中,NVIDIA Vera Rubin NVL72 架构迎来了首秀,以刷新行业纪录的大语言模型 (LLM) 推理吞吐量与极低 Token 生成延迟,树立了下一代 AI 算力集群的性能标杆。对于开发者与企业而言,更高的推理吞吐量意味着在相同的硬件投入下能够产生更多 Token,从而直接降低单位推理成本并提高服务收益。

MLPerf Inference v6.1 核心评估指标拆解

MLPerf 基准测试被誉为 AI 硬件领域的“奥林匹克”。在 v6.1 版本中,针对大语言模型与 Agent 复杂任务的推理评估提出了更加严苛的真实生产环境约束:

  • 首字延迟 (Time to First Token, TTFT):指从用户发起请求到系统输出首个 Token 所经历的时间。在实时交互式对话、智能体协同与代码生成场景中,TTFT 直接决定了用户感知的响应速度。在 MLPerf v6.1 的服务器模式中,系统必须在极高并发压力下维持严格的 tail-latency 限制(如 TTFT < 200ms)。
  • Token 间延迟 (Inter-Token Latency, ITL):指在解码生成过程中,后续相邻两个 Token 之间的平均生成间隔。较低的 ITL 能够保障流式输出的流畅度与下游系统的实时吞吐。
  • 服务器模式与离线模式 (Server vs. Offline Mode):服务器模式模拟真实生产环境中高并发、随机到达的请求分布,强调严格 QoS 约束下的有效吞吐;离线模式则衡量批量数据处理中的极限吞吐率。

硬件架构深度解析:Vera Rubin NVL72 的性能飞跃

Vera Rubin NVL72 是 NVIDIA 在 Blackwell 架构基础上的又一次重大演进,其整机柜液冷设计专为超大规模 LLM 及多模态模型打造。面对 DeepSeek-V3、Claude 3.5 Sonnet 等超大规模模型,Rubin 架构实现了多项核心突破:

  1. 全互联 NVLink 拓扑扩展:每个 Rubin NVL72 机柜整合了 72 块 GPU,通过下一代 NVLink 交换机实现每块 GPU 高达 3.6 TB/s 的双向互联带宽。整机柜形成一个统一的巨型算力单元,大幅降低了张量并行 (TP) 与流水线并行 (PP) 过程中的跨卡通信延迟。
  2. 微块 FP4 原生计算单元:结合第二代 Transformer 引擎,Rubin 架构在保持极高模型精度的同时,原生支持 FP4 低精度计算,相比 FP8 格式实现了算力密度的成倍提升,允许更大 Batch Size 在高速缓存中高效运行。
  3. HBM4 超高显存带宽:结合超过 13 TB/s 的单插槽显存带宽,有效缓解了在长上下文推理过程中 KV Cache 频繁读取造成的显存带宽瓶颈。

性能对比与数据分析

以下为各代 NVIDIA 计算平台在长文本大模型推理场景下的实测与基准评估对比数据:

架构 / 机架配置单卡 FP4/FP8 峰值算力 (TFLOPS)HBM 显存带宽 (GB/s)整机柜 LLM 推理吞吐量 (Tokens/s)TTFT 延迟 (p99, ms)能效比 (Tokens/kWh)
Hopper H100 (8 卡服务器)1,979 (FP8)3,35014,20018512,500
Blackwell B200 (8 卡服务器)4,500 (FP4)8,00048,0009238,000
Blackwell NVL72 (整机柜)4,500 (FP4)8,000460,00045115,000
Vera Rubin NVL72 (整机柜)10,000+ (FP4)13,000+1,250,000+18290,000+

软件栈持续优化:TensorRT-LLM 与推理加速

硬件的性能释放离不开底层软件栈的深度优化。在 MLPerf v6.1 测试中,NVIDIA 展示了配套软件生态的突破:

  • 推测解码 (Speculative Decoding):利用小型轻量级 Draft 模型预先预测候选 Token 序列,再由 Rubin NVL72 集中进行并行验证,显著降低了单个 Token 的生成延迟。
  • Chunked Prefill 与 Dynamic PagedAttention:通过对超长 Prompt 进行分块预填充,结合优化的页表管理,有效避免了高并发场景下的显存碎片化与响应停顿。
  • 动态 FP4 块级量化:针对不同网络层施加块级动态缩放因子,确保在极低精度下依旧保持模型输出逻辑的严密性。

开发者如何高效接入顶级算力:n1n.ai 统一 API 方案

直接部署 Vera Rubin NVL72 等重型液冷机柜不仅需要昂贵的硬件采购与运维成本,还需要复杂的算力调度工程。对于广大应用开发者和中小型企业而言,接入像 n1n.ai 这样的多模型 API 聚合平台是实现极速推理与成本控制的最优路径。

通过 n1n.ai,开发者无需关注底层硬件异构性,即可直接调用包括 DeepSeek-V3、Claude 3.5 Sonnet、Llama 3.3 70B 在内的顶级大模型,享受高可用、低延迟的聚合推理服务与统一的兼容 API 接口。

代码实操:使用 Python 进行高并发 API 延迟测试

下面提供一段完整的 Python 示例代码,演示如何调用 n1n.ai 提供的兼容 OpenAI 格式的统一接口,实时测量推理的首字延迟 (TTFT) 与 Token 吞吐速度:

import asyncio
import time
import httpx

API_KEY = "your_n1n_api_key_here"
ENDPOINT = "https://api.n1n.ai/v1/chat/completions"

async def benchmark_llm_endpoint(prompt: str):
    headers = \{
        "Authorization": f"Bearer \{API_KEY\}