- SemiAnalysis发布全球首个完全开源的多轮Agentic编码推理基准测试AgentX 1.0,基于1百万上下文长度和300万美元投入,测试覆盖100
- 序号:098
- 星球链接:打开网页
- 附件:图片 0,音频 0,文档 0
- 音频文件:无音频
图片
无图片
正文
- SemiAnalysis发布全球首个完全开源的多轮Agentic编码推理基准测试AgentX 1.0,基于1百万上下文长度和300万美元投入,测试覆盖1000+颗GPU芯片。自2025年11月Claude Code引爆以来,长上下文多轮Agentic工作负载已主导生产推理流量。核心结论:1)NVIDIA CUDA护城河依然坚固——在Qwen3.5、GLM 5.3、MiniMax M3等模型上NVIDIA对AMD保持5-20倍的性能/美元优势;2)AMD MI355X在DeepSeek V4等特定工作负载上可与B200竞争,但软件栈存在显著差距,尤其是长上下文多轮场景;3)Agentic推理本质是系统级问题(KV缓存管理、路由、卸载),而非单纯的芯片/内核问题,上下文并行(DCP/PCP)是CUDA护城河的重要组成部分;4)AgentX已催生70+个上游PR优化,显著提升了vLLM、SGLang、TensorRT-LLM的生产推理性能。
SemiAnalysis于2026年8月24日发布AgentX 1.0——全球首个完全开源的多轮Agentic编码推理基准测试,测试数据集基于1百万token上下文长度,投入超300万美元开发。本次测试覆盖MI355X、GB300 NVL72、GB200 NVL72、B300、B200、MI325、MI300X、H200、RTX Pro等多款芯片共1000+颗GPU,并使用约2MW持续算力运行。 报告核心结论:。自2025年11月Claude Code引爆以来,长上下文、多轮Agentic工作负载已迅速主导生产推理流量,到2026年4月OpenAI企业级Agentic支出已超过ChatGPT消费级支出。在这一全新工作负载范式下,NVIDIA凭借完整软件栈(vLLM/SGLang/TensorRT-LLM全栈优化)、DCP/PCP上下文并行等核心特性,在Qwen3.5、GLM 5.3、MiniMax M3等模型上对AMD保持5倍至20倍的性能/美元优势;但AMD MI355X在DeepSeek V4 Pro等模型上已具备竞争力,呈现出"接近但尚未追平NVIDIA"的态势。
AgentX测试方法论革新 与传统的固定序列长度基准测试(如8k1k、1k1k等)不同,AgentX引入,包含四大关键特征: :单个会话包含数十至数百次用户/助手交互,远超聊天机器人的单次交互 :系统提示、工具定义与多轮对话使上下文快速堆积 :对话线性进展时,turn n-1的输出会拼接到turn n,绝大部分上下文可由KV缓存命中(命中率可达95%+) :会话会启动多个短生命周期子Agent,产生突发性KV缓存模式 这意味着Agentic推理本质是——KV张量需高效跨节点/跨rank传输(NIXL、MORI-IO、Mooncake)、请求需按前缀位置智能路由(LLM-d、Dynamo、vLLM/SGLang router)、长上下文需要KV分层卸载到DRAM甚至SSD(Mooncake Store、LMCache等)。 四大前沿模型测试结果 (约1.6万亿参数,490亿激活参数): ISL中位数88k、p90达272k、p99达675k,OSL相对较短 单节点性能:MI355X开源vLLM落后于AMD专有ATOM引擎 B300 vLLM相较B200 vLLM的归一化性能相近,B300凭借50%更多HBM容量可"榨取"更高吞吐量 8月21日之后,由于Inferact和NVIDIA在vLLM的优化,B200性能/美元已超越MI355X (2.8万亿参数): 模型过大,单B200服务器无法容纳,需wide EP/wide TP或pipeline parallelism B200因pipeline parallelism与推测解码不兼容性能糟糕,被MI355X击败 Hopper(SM90)需要为K3定制调优的内核 在40-60秒端到端延迟区间,MI355X ATOM在性能/美元上甚至击败GB300 NVL72 vLLM :
B300 TRT-LLM TP2占据M3冠军位置 AMD软件在长上下文场景下表现糟糕,工程领导层过度激励短上下文单轮调优 AMD在GPU到CPU的KV缓存卸载效率低下,缺少hipMemcpyBatchAsync API(ROCm 7.14之前) : 使用GatedDeltaNet(GDN),MIT/NVIDIA Research发明的混合注意力架构 NVIDIA SGLang vs SGLang,NVIDIA对AMD有 B300 FP4相对H100在Qwen3.5上有 :在OSS SGLang性能上,NVIDIA再次击败AMD,在150 tok/s/user的p90交互性下,NVIDIA有——AMD即便免费赠送硬件,仅运营成本就足以让NVIDIA更便宜。 B300 vs B200的关键差异:HBM容量 报告深入对比了B300与B200在DeepSeek V4上的缓存行为: 指标B300 (384并发)B200 (196并发) HBM缓存命中率 91% 73% DRAM卸载命中率 1.36% ~20% HBM KV缓存工作集 约4300万tokens 约2200万tokens B300的50%额外HBM容量使其能在更高并发下保持绝大部分请求在HBM中命中,从而显著降低延迟;而B200必须依赖DRAM卸载,但卸载为write-through缓存,仅在DRAM可用容量为HBM KV缓存容量的1.5-3倍时才有效。 AMD软件栈差距的核心诊断 ——绝大多数AI实验室不愿在生产中使用ATOM(仅阿里巴巴一个小型广告业务单元使用) ——AMD工程激励过度倾向短上下文单轮调优 ——直到ROCm 7.14才补齐hipMemcpyBatchAsync API ——vLLM支持矩阵中所有AMD后端均标记为"unsupported" ——AMD应加速将ATOM优化反向移植到vLLM AgentX的产业影响力 AgentX最宝贵的产出并非初始结果,而是对生产推理栈的实质性优化,覆盖: vLLM:混合注意力前缀缓存改进、CPU KV卸载支持、ROCm侧解码层优化 SGLang:滑动窗口与前缀页冲突解决、HiCache异构内存支持、DP缓存亲和路由 TensorRT-LLM:边界感知增量分词(1,087次转换全部正确)、HiSparse长上下文KV传输 典型优化数据: HiCache GDN checkpoint使吞吐量从47,771提升至53,004 tok/s/GPU(92.4%缓存命中率) SGLang运行时上下文长度传递改造:并发384时输出吞吐+26.75%、TTFT均值-36.25% 可配置解码间隔:DSv4 Pro输出吞吐+141%,p99 token间延迟降低97.3% TRT-LLM增量分词:处理时间从185.1ms降至11.3ms
本报告为,不针对单个公司给出明确投资评级或估值目标价。但报告对相关公司的相对竞争格局提供了重要定性判断: :CUDA护城河依然坚固,特别是在前沿大模型推理上占据绝对优势,B300产品相比B200有实质性性能提升(HBM容量驱动) :MI355X在DeepSeek V4等特定工作负载已具竞争力,但软件栈仍是短板;AMD与SemiAnalysis的合作正在加速改善软件质量 :Agentic工作负载现已成为推理流量主导,基础设施投资逻辑发生重要转变 :开源权重模型性能快速追赶前沿,MI355X在中国市场具备特别价值
:AgentX虽已尽力模拟真实工作负载,但生产环境的不可预测性仍可能导致结果偏差;SemiAnalysis本身也强调工作负载画像在快速演变,3-4周后将发布更新文章 :报告明确指出AMD与SemiAnalysis长期合作正在加速软件现代化,未来2-3周内可能有显著优化跟进 :8月底Rubin即将到达测试场,年底前TPU和下一代AMD产品将纳入,可能改变竞争格局 :报告批评NVIDIA端到端训练研究"让美国尴尬",被Qwen3.8 27B等小模型击败,说明NVIDIA在非底层研究领域并非全无弱点 :高吞吐量配置通常会牺牲首token延迟,本报告中的所有数据都是权衡曲线的特定切片,单点性能可能不具代表性 :报告自承该指标"对高TTFT惩罚过重,未能捕捉PD分离等优化的全部细节" :报告涉及中国多家前沿模型与芯片合作伙伴,地缘政治因素可能影响实际产业生态
总体总结
主题正文
-
- SemiAnalysis发布全球首个完全开源的多轮Agentic编码推理基准测试AgentX 1.0,基于1百万上下文长度和300万美元投入,测试覆盖1000+颗GPU芯片。
- 核心结论:1)NVIDIA CUDA护城河依然坚固——在Qwen3.5、GLM 5.3、MiniMax M3等模型上NVIDIA对AMD保持5-20倍的性能/美元优势;
- SemiAnalysis于2026年8月24日发布AgentX 1.0——全球首个完全开源的多轮Agentic编码推理基准测试,测试数据集基于1百万token上下文长度,投入超300万美元开发。
- 本次测试覆盖MI355X、GB300 NVL72、GB200 NVL72、B300、B200、MI325、MI300X、H200、RTX Pro等多款芯片共1000+颗GPU,并使用约2MW持续算力运行。
- 自2025年11月Claude Code引爆以来,长上下文、多轮Agentic工作负载已迅速主导生产推理流量,到2026年4月OpenAI企业级Agentic支出已超过ChatGPT消费级支出。
- 在这一全新工作负载范式下,NVIDIA凭借完整软件栈(vLLM/SGLang/TensorRT-LLM全栈优化)、DCP/PCP上下文并行等核心特性,在Qwen3.5、GLM 5.3、MiniMax M3等模型上对AMD保持5倍至20倍的性能/美元优势;
- 这意味着Agentic推理本质是——KV张量需高效跨节点/跨rank传输(NIXL、MORI-IO、Mooncake)、请求需按前缀位置智能路由(LLM-d、Dynamo、vLLM/SGLang router)、长上下文需要KV分层卸载到DRAM甚至SSD(Mooncake Store、LMCache等)。
- :在OSS SGLang性能上,NVIDIA再次击败AMD,在150 tok/s/user的p90交互性下,NVIDIA有——AMD即便免费赠送硬件,仅运营成本就足以让NVIDIA更便宜。