模型评测2026年10月2日使用 TLX 优化 Blackwell GPU 上的锯齿状闪存注意力机制深入探讨如何在 NVIDIA Blackwell B200 GPU 上利用 Tile Language Extensions (TLX) 优化锯齿状闪存注意力机制(JFA),为迈向 FlashAttention-4 (FA4) 奠定坚实的技术基础。阅读全文 →
AI教程2026年9月26日三张 RTX 3090 显卡实现 Qwen3.8-Flash-Next 80 Token 每秒的高效推理优化指南深入探讨如何利用专家使用频率排序、动态分级量化策略以及修改 llama.cpp CUDA 内核,在 3 张消费级 RTX 3090 显卡上以 80 tokens/s 的速度完整运行 125B 参数的 Qwen3.8-Flash-Next 混合专家模型。阅读全文 →
行业资讯2026年9月13日在 Windows 系统中运行 AMD 显卡的 CUDA 工作负载:架构解析与实战指南深入探讨如何在 Windows 环境下利用 ZLuda、HIP SDK 及 SCALE 等二进制翻译层与编译器工具链,在 AMD Radeon 显卡上运行 NVIDIA CUDA 程序与 AI 框架,并提供云端 API 备用方案。阅读全文 →
模型评测2026年9月5日PyTorch 2026 大会硬件加速与计算基础设施指南深入探讨 PyTorch 2026 北美大会核心议题,详解 PyTorch 2.x 编译器架构、异构芯片后端、Triton 自定义算子开发及大规模分布式并行计算基础设施。阅读全文 →
模型评测2026年9月3日PyTorch 2.14 正式发布:NVGEMM 与 CuTeDSL 深度集成 TorchInductor 性能飞跃PyTorch 2.14 正式发布!通过将基于 CuTeDSL 生成的 CUTLASS 算子与 NVGEMM 引入 TorchInductor,实现了显存尾部融合(Epilogue Fusion)的重大突破,大幅降低大模型训练与推理延迟。阅读全文 →
AI教程2026年7月23日从零开始构建 LLM 推理运行时:H100 深度优化指南深入探讨如何从底层构建高性能 LLM 推理运行时,涵盖 CUDA 图、权重打包以及 H100 硬件优化策略,并解析开发过程中的核心挑战。阅读全文 →
AI教程2026年5月22日TitanCore Core-1 使用 C++ CUDA 和 ZeRO-3 构建万亿参数大模型训练基础设施深入了解 TitanCore Core-1,这是一个专为万亿参数 LLM 训练设计的高性能 C++/CUDA 基础设施,通过 ZeRO-3 和自定义融合算子实现 2.6倍的性能提升。阅读全文 →
行业资讯2026年5月11日CUDA 证明英伟达是一家软件公司虽然全世界都在关注英伟达的 H100 和 Blackwell GPU,但其万亿美元霸权的真正秘密在于 CUDA。本文深入探讨了软件而非仅仅是硅片,如何为 AI 开发创造了不可逾越的护城河。阅读全文 →
模型评测2026年2月14日利用 Claude 和 Codex 自动化构建 GPU 自定义算子深入探讨 Claude 3.5 Sonnet 和 OpenAI Codex 等现代大语言模型如何通过生成高性能 Triton 和 CUDA 内核来彻底改变 GPU 编程方式。阅读全文 →