【国联民生计算机】🚀集智股份:ARM CPU时代的“硅基流动” [太阳]推理架构重塑,ARM CPU+GPU异构协同成为新路径 今日美股CPU龙头ARM领涨芯片

图片

无图片

正文

【国联民生计算机】🚀集智股份:ARM CPU时代的“硅基流动”

[太阳]推理架构重塑,ARM CPU+GPU异构协同成为新路径

今日美股CPU龙头ARM领涨芯片板块,AI时代ARM CPU价值正在逐步显现。

Agentic AI工作负载下GPU利用率趋于间歇化,高核心密度ARM CPU可承担请求路由、Prompt预处理、KV Cache管理及部分Decode任务。

异构推理架构下,MoE模型中Attention与共享专家常驻GPU、路由专家卸载至CPU内存,''GPU Prefill+CPU Decode''进一步提升集群资源利用率,降低LLM服务长期TCO。

[太阳]Fedimoss研究:192核ARM CPU推理性能获实测验证

Fedimoss数据显示,AmpereOne 192核ARM CPU在AIO框架优化下,Llama-3.2-1B吞吐量达4242.553 tokens/s,Qwen3-30B-A3B达769.691 tokens/s。某加密货币服务商部署后营销文章生成周期从2天缩短至60分钟。

[太阳]集智股份:ARM CPU时代的''硅基流动''

公司控股子公司之江易算掌握FPGA、CPU、GPU软件异构计算核心技术,与Fedimoss(盛见科技)战略合作打造Agentic时代AI Inference生产底座。

Fedimoss负责ARM架构CPU推理优化及CPU+GPU异构方案,之江易算负责算力集成应用与企业场景交付。旗下EasyInfer采用GPU+ARM CPU混合架构,定位1M长文本与代码专家场景复杂推理底座,打造ARM CPU时代的“硅基流动”。

风险提示:商业化落地进度不及预期;行业竞争加剧。

总体总结

主题正文

  1. Agentic AI工作负载下GPU利用率趋于间歇化,高核心密度ARM CPU可承担请求路由、Prompt预处理、KV Cache管理及部分Decode任务。
  2. 异构推理架构下,MoE模型中Attention与共享专家常驻GPU、路由专家卸载至CPU内存,''GPU Prefill+CPU Decode''进一步提升集群资源利用率,降低LLM服务长期TCO。
  3. [太阳]Fedimoss研究:192核ARM CPU推理性能获实测验证
  4. Fedimoss数据显示,AmpereOne 192核ARM CPU在AIO框架优化下,Llama-3.2-1B吞吐量达4242.553 tokens/s,Qwen3-30B-A3B达769.691 tokens/s。
  5. 公司控股子公司之江易算掌握FPGA、CPU、GPU软件异构计算核心技术,与Fedimoss(盛见科技)战略合作打造Agentic时代AI Inference生产底座。
  6. Fedimoss负责ARM架构CPU推理优化及CPU+GPU异构方案,之江易算负责算力集成应用与企业场景交付。
  7. 旗下EasyInfer采用GPU+ARM CPU混合架构,定位1M长文本与代码专家场景复杂推理底座,打造ARM CPU时代的“硅基流动”。
  8. 风险提示:商业化落地进度不及预期;