---
title: "⚡Minimax即将发布新模型H3：高变现潜力场景的帕累托前沿候选 H3是开放通用的统一多模态视频模型，支持文本、图片、视频和音频混合输入，最多输入12份素材；"
topic_id: 82255442812145522
created_at: 2026-07-31T08:49:47.848+0800
source: zsxq
type: topic
cssclasses: zsxq-vault
---

# ⚡Minimax即将发布新模型H3：高变现潜力场景的帕累托前沿候选 H3是开放通用的统一多模态视频模型，支持文本、图片、视频和音频混合输入，最多输入12份素材；

- 序号：307
- 星球链接：[打开网页](https://wx.zsxq.com/group/15522451881222/topic/82255442812145522)
- 附件：图片 0，音频 0，文档 0
- 音频文件：_无音频_

## 图片

_无图片_

## 正文

⚡Minimax即将发布新模型H3：高变现潜力场景的帕累托前沿候选

H3是开放通用的统一多模态视频模型，支持文本、图片、视频和音频混合输入，最多输入12份素材；单次生成5-15秒、24FPS视频，支持1440p和原生双声道。能力重点包括复杂动作、物体关系、指令遵循和多参考一致性。据科技博主实测，墨镜广告从一张模特图生成完整时尚片；赛博朋克案例同时处理角色、UI、英文名和交互；动态海报保留原有人物和版式，只修改动作与文字效果。高变现潜力场景里，审美是生产力，直接决定客户是否采用、需要返工几次。

H3主打高潜力变现场景。广告、电商、游戏和UI预算明确、需求高频，客户还会反复修改人物、商品、文案和版式。商用内容一直是MiniMax持续投入的方向，H3可以沿着原素材定向修改，再叠加MiniMax的语音、音乐和Media Agent，覆盖从生成到交付的流程。

多模态是下一代大模型的主线。Gartner预计，到2027年，多模态方案将占生成式AI解决方案的40%，而2023年仅为1%。Stanford 2026 AI Index进一步指出，视频模型正从生成逼真画面，走向对动作、声音、物体关系和多份素材的统一理解。广告、电商、游戏和UI最需要这些能力，也有明确的采购预算和交付标准，有望成为最快兑现商业价值的方向。

赔率标的。H3或兼顾模型升级溢价和价格优势。保守预期，7e美金ARR*8=400e，M3前置验证+自建算力仍有训练试错机会。中性预期，10e美金ARR*20=1400，对应2+赔率。

## 总体总结

主题正文
1. H3是开放通用的统一多模态视频模型，支持文本、图片、视频和音频混合输入，最多输入12份素材；
2. 能力重点包括复杂动作、物体关系、指令遵循和多参考一致性。
3. 商用内容一直是MiniMax持续投入的方向，H3可以沿着原素材定向修改，再叠加MiniMax的语音、音乐和Media Agent，覆盖从生成到交付的流程。
4. Gartner预计，到2027年，多模态方案将占生成式AI解决方案的40%，而2023年仅为1%。
5. Stanford 2026 AI Index进一步指出，视频模型正从生成逼真画面，走向对动作、声音、物体关系和多份素材的统一理解。
6. 广告、电商、游戏和UI最需要这些能力，也有明确的采购预算和交付标准，有望成为最快兑现商业价值的方向。
7. H3或兼顾模型升级溢价和价格优势。
8. 保守预期，7e美金ARR*8=400e，M3前置验证+自建算力仍有训练试错机会。
