【国联民生计算机】🚀集智股份:ARM CPU时代的“硅基流动” [太阳]推理架构重塑,ARM CPU+GPU异构协同成为新路径 今日美股CPU龙头ARM领涨芯片
- 序号:497
- 星球链接:打开网页
- 附件:图片 0,音频 0,文档 0
- 音频文件:无音频
图片
无图片
正文
【国联民生计算机】🚀集智股份:ARM CPU时代的“硅基流动”
[太阳]推理架构重塑,ARM CPU+GPU异构协同成为新路径
今日美股CPU龙头ARM领涨芯片板块,AI时代ARM CPU价值正在逐步显现。
Agentic AI工作负载下GPU利用率趋于间歇化,高核心密度ARM CPU可承担请求路由、Prompt预处理、KV Cache管理及部分Decode任务。
异构推理架构下,MoE模型中Attention与共享专家常驻GPU、路由专家卸载至CPU内存,''GPU Prefill+CPU Decode''进一步提升集群资源利用率,降低LLM服务长期TCO。
[太阳]Fedimoss研究:192核ARM CPU推理性能获实测验证
Fedimoss数据显示,AmpereOne 192核ARM CPU在AIO框架优化下,Llama-3.2-1B吞吐量达4242.553 tokens/s,Qwen3-30B-A3B达769.691 tokens/s。某加密货币服务商部署后营销文章生成周期从2天缩短至60分钟。
[太阳]集智股份:ARM CPU时代的''硅基流动''
公司控股子公司之江易算掌握FPGA、CPU、GPU软件异构计算核心技术,与Fedimoss(盛见科技)战略合作打造Agentic时代AI Inference生产底座。
Fedimoss负责ARM架构CPU推理优化及CPU+GPU异构方案,之江易算负责算力集成应用与企业场景交付。旗下EasyInfer采用GPU+ARM CPU混合架构,定位1M长文本与代码专家场景复杂推理底座,打造ARM CPU时代的“硅基流动”。
风险提示:商业化落地进度不及预期;行业竞争加剧。
总体总结
主题正文
- Agentic AI工作负载下GPU利用率趋于间歇化,高核心密度ARM CPU可承担请求路由、Prompt预处理、KV Cache管理及部分Decode任务。
- 异构推理架构下,MoE模型中Attention与共享专家常驻GPU、路由专家卸载至CPU内存,''GPU Prefill+CPU Decode''进一步提升集群资源利用率,降低LLM服务长期TCO。
- [太阳]Fedimoss研究:192核ARM CPU推理性能获实测验证
- Fedimoss数据显示,AmpereOne 192核ARM CPU在AIO框架优化下,Llama-3.2-1B吞吐量达4242.553 tokens/s,Qwen3-30B-A3B达769.691 tokens/s。
- 公司控股子公司之江易算掌握FPGA、CPU、GPU软件异构计算核心技术,与Fedimoss(盛见科技)战略合作打造Agentic时代AI Inference生产底座。
- Fedimoss负责ARM架构CPU推理优化及CPU+GPU异构方案,之江易算负责算力集成应用与企业场景交付。
- 旗下EasyInfer采用GPU+ARM CPU混合架构,定位1M长文本与代码专家场景复杂推理底座,打造ARM CPU时代的“硅基流动”。
- 风险提示:商业化落地进度不及预期;