---
title: "- SemiAnalysis发布全球首个完全开源的多轮Agentic编码推理基准测试AgentX 1.0，基于1百万上下文长度和300万美元投入，测试覆盖100"
topic_id: 55521152225418484
created_at: 2026-08-24T20:31:36.757+0800
source: zsxq
type: topic
cssclasses: zsxq-vault
---

# - SemiAnalysis发布全球首个完全开源的多轮Agentic编码推理基准测试AgentX 1.0，基于1百万上下文长度和300万美元投入，测试覆盖100

- 序号：098
- 星球链接：[打开网页](https://wx.zsxq.com/group/15522451881222/topic/55521152225418484)
- 附件：图片 0，音频 0，文档 0
- 音频文件：_无音频_

## 图片

_无图片_

## 正文

- SemiAnalysis发布全球首个完全开源的多轮Agentic编码推理基准测试AgentX 1.0，基于1百万上下文长度和300万美元投入，测试覆盖1000+颗GPU芯片。自2025年11月Claude Code引爆以来，长上下文多轮Agentic工作负载已主导生产推理流量。核心结论：1）NVIDIA CUDA护城河依然坚固——在Qwen3.5、GLM 5.3、MiniMax M3等模型上NVIDIA对AMD保持5-20倍的性能/美元优势；2）AMD MI355X在DeepSeek V4等特定工作负载上可与B200竞争，但软件栈存在显著差距，尤其是长上下文多轮场景；3）Agentic推理本质是系统级问题（KV缓存管理、路由、卸载），而非单纯的芯片/内核问题，上下文并行（DCP/PCP）是CUDA护城河的重要组成部分；4）AgentX已催生70+个上游PR优化，显著提升了vLLM、SGLang、TensorRT-LLM的生产推理性能。

SemiAnalysis于2026年8月24日发布AgentX 1.0——全球首个完全开源的多轮Agentic编码推理基准测试，测试数据集基于1百万token上下文长度，投入超300万美元开发。本次测试覆盖MI355X、GB300 NVL72、GB200 NVL72、B300、B200、MI325、MI300X、H200、RTX Pro等多款芯片共1000+颗GPU，并使用约2MW持续算力运行。
报告核心结论：。自2025年11月Claude Code引爆以来，长上下文、多轮Agentic工作负载已迅速主导生产推理流量，到2026年4月OpenAI企业级Agentic支出已超过ChatGPT消费级支出。在这一全新工作负载范式下，NVIDIA凭借完整软件栈（vLLM/SGLang/TensorRT-LLM全栈优化）、DCP/PCP上下文并行等核心特性，在Qwen3.5、GLM 5.3、MiniMax M3等模型上对AMD保持5倍至20倍的性能/美元优势；但AMD MI355X在DeepSeek V4 Pro等模型上已具备竞争力，呈现出"接近但尚未追平NVIDIA"的态势。

AgentX测试方法论革新
与传统的固定序列长度基准测试（如8k1k、1k1k等）不同，AgentX引入，包含四大关键特征：
：单个会话包含数十至数百次用户/助手交互，远超聊天机器人的单次交互
：系统提示、工具定义与多轮对话使上下文快速堆积
：对话线性进展时，turn n-1的输出会拼接到turn n，绝大部分上下文可由KV缓存命中（命中率可达95%+）
：会话会启动多个短生命周期子Agent，产生突发性KV缓存模式
这意味着Agentic推理本质是——KV张量需高效跨节点/跨rank传输（NIXL、MORI-IO、Mooncake）、请求需按前缀位置智能路由（LLM-d、Dynamo、vLLM/SGLang router）、长上下文需要KV分层卸载到DRAM甚至SSD（Mooncake Store、LMCache等）。
四大前沿模型测试结果
（约1.6万亿参数，490亿激活参数）：
ISL中位数88k、p90达272k、p99达675k，OSL相对较短
单节点性能：MI355X开源vLLM落后于AMD专有ATOM引擎
B300 vLLM相较B200 vLLM的归一化性能相近，B300凭借50%更多HBM容量可"榨取"更高吞吐量
8月21日之后，由于Inferact和NVIDIA在vLLM的优化，B200性能/美元已超越MI355X
（2.8万亿参数）：
模型过大，单B200服务器无法容纳，需wide EP/wide TP或pipeline parallelism
B200因pipeline parallelism与推测解码不兼容性能糟糕，被MI355X击败
Hopper（SM90）需要为K3定制调优的内核
在40-60秒端到端延迟区间，MI355X ATOM在性能/美元上甚至击败GB300 NVL72 vLLM
：

B300 TRT-LLM TP2占据M3冠军位置
AMD软件在长上下文场景下表现糟糕，工程领导层过度激励短上下文单轮调优
AMD在GPU到CPU的KV缓存卸载效率低下，缺少hipMemcpyBatchAsync API（ROCm 7.14之前）
：
使用GatedDeltaNet（GDN），MIT/NVIDIA Research发明的混合注意力架构
NVIDIA SGLang vs SGLang，NVIDIA对AMD有
B300 FP4相对H100在Qwen3.5上有
：在OSS SGLang性能上，NVIDIA再次击败AMD，在150 tok/s/user的p90交互性下，NVIDIA有——AMD即便免费赠送硬件，仅运营成本就足以让NVIDIA更便宜。
B300 vs B200的关键差异：HBM容量
报告深入对比了B300与B200在DeepSeek V4上的缓存行为：
指标B300 (384并发)B200 (196并发)
HBM缓存命中率
91%
73%
DRAM卸载命中率
1.36%
~20%
HBM KV缓存工作集
约4300万tokens
约2200万tokens
B300的50%额外HBM容量使其能在更高并发下保持绝大部分请求在HBM中命中，从而显著降低延迟；而B200必须依赖DRAM卸载，但卸载为write-through缓存，仅在DRAM可用容量为HBM KV缓存容量的1.5-3倍时才有效。
AMD软件栈差距的核心诊断
——绝大多数AI实验室不愿在生产中使用ATOM（仅阿里巴巴一个小型广告业务单元使用）
——AMD工程激励过度倾向短上下文单轮调优
——直到ROCm 7.14才补齐hipMemcpyBatchAsync API
——vLLM支持矩阵中所有AMD后端均标记为"unsupported"
——AMD应加速将ATOM优化反向移植到vLLM
AgentX的产业影响力
AgentX最宝贵的产出并非初始结果，而是对生产推理栈的实质性优化，覆盖：
vLLM：混合注意力前缀缓存改进、CPU KV卸载支持、ROCm侧解码层优化
SGLang：滑动窗口与前缀页冲突解决、HiCache异构内存支持、DP缓存亲和路由
TensorRT-LLM：边界感知增量分词（1,087次转换全部正确）、HiSparse长上下文KV传输
典型优化数据：
HiCache GDN checkpoint使吞吐量从47,771提升至53,004 tok/s/GPU（92.4%缓存命中率）
SGLang运行时上下文长度传递改造：并发384时输出吞吐+26.75%、TTFT均值-36.25%
可配置解码间隔：DSv4 Pro输出吞吐+141%，p99 token间延迟降低97.3%
TRT-LLM增量分词：处理时间从185.1ms降至11.3ms

本报告为，不针对单个公司给出明确投资评级或估值目标价。但报告对相关公司的相对竞争格局提供了重要定性判断：
：CUDA护城河依然坚固，特别是在前沿大模型推理上占据绝对优势，B300产品相比B200有实质性性能提升（HBM容量驱动）
：MI355X在DeepSeek V4等特定工作负载已具竞争力，但软件栈仍是短板；AMD与SemiAnalysis的合作正在加速改善软件质量
：Agentic工作负载现已成为推理流量主导，基础设施投资逻辑发生重要转变
：开源权重模型性能快速追赶前沿，MI355X在中国市场具备特别价值

：AgentX虽已尽力模拟真实工作负载，但生产环境的不可预测性仍可能导致结果偏差；SemiAnalysis本身也强调工作负载画像在快速演变，3-4周后将发布更新文章
：报告明确指出AMD与SemiAnalysis长期合作正在加速软件现代化，未来2-3周内可能有显著优化跟进
：8月底Rubin即将到达测试场，年底前TPU和下一代AMD产品将纳入，可能改变竞争格局
：报告批评NVIDIA端到端训练研究"让美国尴尬"，被Qwen3.8 27B等小模型击败，说明NVIDIA在非底层研究领域并非全无弱点
：高吞吐量配置通常会牺牲首token延迟，本报告中的所有数据都是权衡曲线的特定切片，单点性能可能不具代表性
：报告自承该指标"对高TTFT惩罚过重，未能捕捉PD分离等优化的全部细节"
：报告涉及中国多家前沿模型与芯片合作伙伴，地缘政治因素可能影响实际产业生态

## 总体总结

主题正文
1. - SemiAnalysis发布全球首个完全开源的多轮Agentic编码推理基准测试AgentX 1.0，基于1百万上下文长度和300万美元投入，测试覆盖1000+颗GPU芯片。
2. 核心结论：1）NVIDIA CUDA护城河依然坚固——在Qwen3.5、GLM 5.3、MiniMax M3等模型上NVIDIA对AMD保持5-20倍的性能/美元优势；
3. SemiAnalysis于2026年8月24日发布AgentX 1.0——全球首个完全开源的多轮Agentic编码推理基准测试，测试数据集基于1百万token上下文长度，投入超300万美元开发。
4. 本次测试覆盖MI355X、GB300 NVL72、GB200 NVL72、B300、B200、MI325、MI300X、H200、RTX Pro等多款芯片共1000+颗GPU，并使用约2MW持续算力运行。
5. 自2025年11月Claude Code引爆以来，长上下文、多轮Agentic工作负载已迅速主导生产推理流量，到2026年4月OpenAI企业级Agentic支出已超过ChatGPT消费级支出。
6. 在这一全新工作负载范式下，NVIDIA凭借完整软件栈（vLLM/SGLang/TensorRT-LLM全栈优化）、DCP/PCP上下文并行等核心特性，在Qwen3.5、GLM 5.3、MiniMax M3等模型上对AMD保持5倍至20倍的性能/美元优势；
7. 这意味着Agentic推理本质是——KV张量需高效跨节点/跨rank传输（NIXL、MORI-IO、Mooncake）、请求需按前缀位置智能路由（LLM-d、Dynamo、vLLM/SGLang router）、长上下文需要KV分层卸载到DRAM甚至SSD（Mooncake Store、LMCache等）。
8. ：在OSS SGLang性能上，NVIDIA再次击败AMD，在150 tok/s/user的p90交互性下，NVIDIA有——AMD即便免费赠送硬件，仅运营成本就足以让NVIDIA更便宜。
