MiniMax H3 团队 Reddit 被问爆:2K 要开源,图像模型在路上,Apache-2.0 也在考虑了 文章

InfoQ 中文2026-08-08BLOGzh作者: 李冬梅

详细信息

来源站点
InfoQ 中文
作者
李冬梅
文章类型
BLOG
语言
zh
发布日期
2026-08-08

摘要

MiniMax H3 开放权重之后,开发者最关心的几个问题,终于有了官方回应。8 月 7 日晚上 10 点,MiniMax H3 团队来到 Reddit 的 r/StableDiffusion 社区举行 AMA(Ask Me Anything)。MiniMax H3 团队公开回应一切参与此次交流的包括 H3 研究负责人 dacongya,研究员 Luigi、Nero、Kiro,系统工程师 Reynor,以及 MiniMax 开发者关系负责人 Ryanlee。团队表示,讨论范围将涵盖模型架构与训练、视频生成、图生视频与参考生成、推理优化以及未来计划。这场讨论受到相当高的关注。截至发稿时,帖子已经积累超过 300 条评论,目前已经在 Reddit 页面被标记为“Finished”。而从整个讨论看,社区关注的重心已经从 H3 在某个 Benchmark 上超过了谁,换成了一些更实际的问题,比如 2K 能不能本地跑?Sparse Attention 什么时候开放?有没有 4 步版本?为什么 Ref2Vid 比 I2V 糊?能不能拿它直接生成图片?Context-IR 怎么在本地复现?MiniMax 以后还会不会继续开放模型?这些问题,也恰好指向一个开放模型发布之后真正困难的部分——开放权重只是第一步,围绕训练、推理、工具链和模型能力边界的东西,到底能开放到什么程度,才真正决定一个模型最终能形成多大的开发者生态。H3 是 MiniMax 7 月 31 日正式发布的全模态视频生成模型,可以同时理解文本、图像、视频和声音组成的上下文,并生成最长 15 秒、最高 2K 分辨率、带原生双声道的视频。MiniMax 当时表示,会在符合法律法规的前提下开放模型权重。而在这次 AMA 中,MiniMax 第一次比较具体地回应了开放之后的下一步。InfoQ 整理了 Reddit 社区中讨论热度比较高的提问和H3团队的回答,以飨读者。一些关键问题用于最终 2K 输出的模型会不会发布?社区最集中的问题,首先指向 H3 的 2K 能力。H3 发布时,MiniMax 将 2K 输出背后的方案称为 In-context Regeneration。按照官方此前的解释,它没有走传统视频模型常见的独立超分路线,而是让模型结合原有的多模态上下文,对低分辨率结果再次生成高分辨率版本。