核心观点:MiniMax H3 适合把已经审核的海报、馆舍照片、角色设定、动作参考和声音意图组合成4—15秒短视频。它的优势不是“自动做完整宣传片”,而是一次处理文字、图片、视频和音频参考,并直接生成带立体声的短镜头。图书馆应把它用于低风险、可审核的宣传素材;活动名称、时间、地点、Logo、二维码和引用信息仍在后期制作。
一、为什么把 MiniMax H3 设为主力工具
MiniMax H3 是 MiniMax 于2026年7月31日发布的通用多模态视频模型。官方将它定位为“全模态生成模型”:同一任务可以同时接收文字、图片、视频和音频,输出最长15秒、最高2K并带原生立体声的视频。MiniMax H3 官方发布说明
对图书馆短视频制作而言,这一能力直接解决了三个实际问题。
- 画面有依据。 馆员可以把已经通过审核的活动主视觉设为首帧,减少主体和配色偏离。
- 动作有参照。 馆员可以提供一段已获授权的动作或运镜视频,让模型参考节奏,而不必只靠文字描述。
- 声音可以进入生成过程。 音乐气氛、环境声和节奏参考可以与画面一起提交,适合制作短预告、片头和氛围镜头。
H3 因此适合作为本期实验室的主力工具。原有的可灵AI和Vidu继续保留:可灵AI适合馆员在成熟的消费端界面中快速试做,Vidu适合已有工作流或API项目继续使用。选型的标准不是模型榜单,而是素材类型、授权条件、可用入口、预算和审核要求。
二、开发方、访问方式与模型版本
MiniMax 是一家通用人工智能公司。H3 目前有三类访问方式。
- 网页创作。 普通馆员可以从海螺AI进入视频创作。网页端开放的具体模型、积分、并发和地区权限会随账号变化,应以登录后的页面为准。
- 开放平台API。 技术团队可在MiniMax开放平台创建密钥,并按照视频生成指南提交异步任务。服务返回
task_id;客户端轮询任务状态,成功后从content.url下载成片。 - 开放权重。 MiniMax 在官方GitHub仓库和Hugging Face提供模型材料。自行部署需要较高GPU资源、推理维护能力和许可审查,通常不适合只做少量宣传片的图书馆。
开放平台目前列出两个版本。官方视频生成指南
- MiniMax-H3。 支持文生视频、首帧或首尾帧生成,以及图片、视频、音频混合参考;输出768P或2K;时长4—15秒。
- MiniMax-H3-Max。 偏重速度;当前支持文生视频和图生视频;输出480P或768P;时长5—15秒。需要混合参考或2K时仍应选 H3。
对馆员的简化判断是:只有一句描述时,可先用 H3 Max 快速试方向;已有主视觉并需要原生音画,或要同时参考图片、动作和声音时,选 H3。
三、H3 能做什么
文生视频
只提交提示词,从零生成一个短镜头。适合知识网络、数据流、纸张翻动、光影变化等抽象视觉。它不适合生成必须与真实馆舍一致的纪实画面。
首帧和首尾帧生成
提交一张首帧,或同时提交首帧和尾帧,再说明动作与运镜。图书馆最常用的是“审核后的无文字海报作为首帧”,让画面只发生轻微运动。首尾帧适合把两个已确认画面连接起来,但中间过程仍可能变形。
全能参考生成
H3 可以组合参考图片、视频和音频。开放平台当前规定:图片不超过9张;视频不超过3段且总时长不超过15秒;音频不超过3段且总时长不超过15秒;混合文件总数不超过12个。单个视频、图片、音频的大小上限分别为50MB、30MB和15MB,API请求体上限为64MB,官方建议较大素材通过URL传入。模型输入条件
这项能力最有价值,也最容易误用。素材多不等于控制更精确。每一份参考素材都应有明确角色,例如“图1只参考人物服装”“视频1只参考镜头运动”“音频1只参考节奏”。没有角色说明时,模型可能混合不应混合的特征。
提示词增强与2K再生成
开放平台还提供 H3-Context-IR,用多模态上下文生成结构化增强提示词;它只返回提示词,不生成视频。已有合格的 H3 768P 成片时,可再生成2K版本。两项功能都适合技术试点,但不应替代人工检查。增强后的提示词可能改变原意,2K也不会自动修复人物、文字和物理错误。H3-Context-IR与视频再生成说明
四、费用与免费额度
截至2026年9月5日,MiniMax开放平台按生成秒数计费。按量付费价格
- MiniMax H3 768P:0.50元/秒;生成8秒约4元,15秒约7.5元。
- MiniMax H3 2K:0.80元/秒;生成8秒约6.4元,15秒约12元。
- MiniMax H3 Max 480P:0.33元/秒。
- MiniMax H3 Max 768P:0.50元/秒。
- H3 的音频输入当前不收费;参考图片前5张免费,超出部分0.20元/张;参考视频按时长和分辨率另计。
- 768P成片再生成2K,输出部分为0.30元/秒;原始输入素材按规则重新计费。
- H3-Context-IR 当前按Token计费,输入和输出价格不同,调用前应查看价格页。
官方的视频资源包页面明确提示,现有海螺视频模型资源包不支持 MiniMax H3;H3 应按量付费或联系商务。视频资源包说明 官方没有承诺长期固定的H3免费额度。网页端如显示赠送积分,应把它视为账号当期权益,不写进项目预算。
预算不能只算最终成片。一条8秒768P镜头若生成3个候选,生成成本约12元;若三条都再做2K,费用还会增加。实际项目还应计入失败重试、素材制作、剪辑、字幕、配音、音乐授权和人工审核。
五、图书馆适用场景
阅读推广和活动预告
把已经审核的书展海报、读书会主视觉或无文字插画转成5—10秒竖版预告。模型负责光影、翻页、粒子和镜头运动;活动名称、日期、地点和报名二维码由后期添加。
主题策展和数字展览
以展览主视觉、展品局部和氛围音乐为参考,生成章节片头、转场或循环背景。涉及馆藏实物和历史图像时,应保存来源与授权记录,不能让生成内容冒充原件影像。
馆舍与服务宣传
用授权的馆舍照片制作概念性镜头,例如从建筑外观缓慢推进到阅读空间。若模型改变建筑结构、消防标识或服务设施,成片只能标注为创意演示,不能当作导览或事实记录。
数据库和信息素养培训
生成抽象片头、章节过渡和概念动画,例如把散乱文献卡片组织成检索网络。数据库界面、检索步骤、字段名称和统计数字必须使用真实录屏或人工制作。
馆员培训
用同一素材和提示词比较不同模型、分辨率、时长与参考模式。培训重点应放在任务拆分、版权检查、质量评分和成本记录,而不是只展示成功样片。
批量内容试点
技术团队可通过API批量生成同一视觉规范下的片头或转场。批量不等于无人审核。每条视频仍需要进入人工复核、后期处理和发布审批。
六、H3 不适合承担的任务
- 真实事件记录。 模型生成的视频不能作为讲座、展览、馆舍改造或历史事件的影像证据。
- 准确文字呈现。 书名、引文、日期、Logo和二维码可能变形,必须后期叠加。
- 长篇完整叙事。 4—15秒更适合一个镜头、一个动作或一个转场。多镜头内容应先分镜,再逐条生成和剪辑。
- 高风险人物再现。 未经授权的人脸、声音、儿童影像、专家形象和名人形象不应上传或生成。
- 专业事实表达。 模型不会核验馆藏数据、活动信息、学术观点或历史细节。事实应来自业务系统、原始文件和可靠文献。
- 自动通过审核。 2K只提高输出规格,不保证主体一致、物理合理和内容合规。
七、七步标准工作法
- 写清任务单。 先确定平台、画幅、时长、用途、发布日期、目标受众和必须出现的信息。
- 整理授权素材。 首帧、尾帧、馆舍照片、人物、音乐、环境声和参考视频逐项标注来源、授权范围和保留期限。
- 选择生成模式。 无素材用文生视频;已有主视觉用首帧;需要明确终点用首尾帧;需要参考人物、动作、声音或剪辑节奏时用全能参考。
- 写关系明确的提示词。 依次说明主体、动作、镜头、环境、声音、时长和限制。混合参考时说明每份素材的用途。
- 先做768P小样。 每次只改变一个变量,如运镜或动作幅度;生成2—3个候选并评分。不要一开始批量生成2K。
- 人工复核和后期制作。 逐帧检查主体、手部、书页、建筑、文字、声音和闪烁;在剪辑软件中加入真实标题、字幕、Logo、二维码和片尾标识。
- 保存制作记录。 保存提示词、输入素材清单、模型版本、任务ID、费用、生成日期、修改说明、授权证明、最终文件和审批结论。
八、三个可复现案例
案例一 把阅读推广主视觉做成8秒竖版预告
任务背景
图书馆已有一张通过审核的9:16无文字主视觉:打开的书、蓝金色光点和稳定的背景书架。目标是在公众号视频号或短视频平台发布8秒预告。
操作步骤
- 删除首帧中的活动文字、二维码和Logo,只保留画面。
- 选择 MiniMax H3 的图生视频模式,上传首帧。
- 设置8秒、768P;比例随首帧自适应。
- 使用同一提示词生成3个候选,只比较主体稳定性和运动幅度。
- 选出合格镜头;确有发布需要时再生成2K或进入剪辑软件。
- 后期加入活动名称、日期、地点、Logo、字幕和AIGC标识。
可直接复制的提示词
保持参考首帧的构图、书本造型、蓝金配色和背景书架不变。镜头在8秒内非常缓慢地向前推进。打开的书只自然翻动一页,少量蓝金色光点从书页升起,在上方形成简洁的抽象知识网络。环境光逐渐变亮,运动克制、稳定、连续。保留画面上方和下方的字幕安全区。生成自然的轻微翻页声和安静的室内环境声,不生成音乐。不要增加人物、文字、Logo、二维码或新的书籍;不要改变书本结构;不要出现快速转场、闪烁、抖动和镜头突跳。
预期输出
3条8秒竖版候选,至少1条可作为无字底片进入后期;声音只有翻页与室内环境声。
馆员人工复核要点
检查书本是否多页粘连、封面是否变化、书架是否弯曲、光点是否遮挡字幕区、声音是否与翻页同步。任何生成文字都应舍弃,不要尝试“修到能认”。
案例二 用图片、动作和声音参考制作主题策展预告
任务背景
图书馆准备“城市记忆”主题展,需要12秒横版片头。已有授权的老照片扫描件、展览主视觉、一段缓慢横移动作参考和一段环境声。目标是营造氛围,不复原具体历史事件。
操作步骤
- 选2张有明确授权的图片:图1只参考主视觉色调,图2只参考历史照片的纸张质感。
- 选1段2—5秒的横移视频,只参考运镜,不参考其中人物和场景。
- 选1段无人物对白的城市环境声,只参考节奏和空间感。
- 选择 MiniMax H3 全能参考模式,设置12秒、16:9、768P。
- 在提示词中明确每份素材的角色,先生成2个候选。
- 后期加入展览名称、文献出处、日期和片尾说明。
可直接复制的提示词
制作12秒横版主题展片头。图片1只用于蓝灰色调和版式气质,不复制其中任何文字;图片2只用于旧纸张、胶片颗粒和边缘磨损的质感,不把照片人物重新生成。镜头运动只参考视频1的缓慢横移速度,不参考视频1的场景和主体。声音只参考音频1的城市空间感和节奏,不复制可识别的人声。画面从抽象的旧纸纹理开始,几张无文字的文献卡片依次进入画面,最后排列成稳定的展览背景。镜头连续、运动平缓、无快速剪辑。不得生成具体历史事件、真实人物面孔、文字、印章、Logo或地图边界;不得让文献卡片变形或相互穿透。
预期输出
一段可用于展览开场的抽象片头。它只表达“城市记忆与文献”的主题,不声称还原任何历史现场。
馆员人工复核要点
确认没有生成可识别但未经授权的人脸、错误文字、伪造印章或似是而非的地图;核对环境声中是否夹带人声、音乐或其他版权内容;在发布页明确说明画面为AI生成的视觉演绎。
案例三 用API测试批量片头的稳定性和成本
任务背景
技术部门准备评估是否为三个信息素养课程统一生成6秒片头。试点只使用自制的无文字首帧,不涉及读者信息和馆藏数据。
操作步骤
- 在服务端保存
MINIMAX_API_KEY,不要写入网页前端、共享文档或代码仓库。 - 为三个课程各准备一张首帧,计算文件校验值并登记授权来源。
- 向
https://api.minimax.cn/v2/video_generation提交MiniMax-H3任务,设置6秒和768P。 - 保存返回的
task_id;每10秒查询一次/v2/query/video_generation/{task_id}。 - 成功后立即把
content.url指向的文件下载到本地,并记录状态、时间和费用。官方API流程与示例 - 每条片头按同一量表评分,只有全部关键项合格才进入后期。
可直接复制的任务表达
模型:MiniMax-H3。模式:首帧图生视频。时长:6秒。分辨率:768P。保持首帧构图、颜色和主体不变;镜头缓慢向前推进;三个抽象文献节点依次连接成稳定的检索路径;不生成文字、人物、Logo、数据库界面、快速转场或闪烁。记录字段:课程编号|任务ID|首帧SHA-256|提示词版本|提交时间|完成时间|状态|生成费用|重试次数|主体一致性|运动连续性|声音合规|人工结论|本地文件路径。
预期输出
3条6秒768P测试片,纯生成费用约9元,不含参考视频、超额图片、重试和后期。如果每条生成两个候选,预算约18元。
馆员人工复核要点
检查实际账单与估算是否一致;记录失败任务是否收费;确认下载文件已保存、任务ID可追溯、密钥没有出现在日志中;不要把一次成功当作批量稳定性的证明。
九、怎样写出更可控的提示词
H3 的提示词可以很长,但长并不等于有效。馆员可使用以下顺序。
- 任务和规格: 8秒、9:16、宣传底片、无文字。
- 主体和不变项: 保持首帧构图、人物服装、馆舍结构或主视觉配色。
- 动作: 一本书翻一页,读者抬头一次,镜头缓慢前推。
- 环境变化: 光线逐渐变亮,少量粒子移动。
- 声音: 只要翻页声和室内环境声,不要对白和音乐。
- 参考关系: 图1参考角色,视频1参考动作,音频1参考节奏。
- 限制: 无文字、无Logo、无新增人物、无突切、无形变、无闪烁。
不要同时要求“推近、环绕、升空、快速切换、人物行走、书页飞舞、标题出现”。一个短镜头保留一个主要动作和一个辅助变化,通常更容易审核。
十、新手最容易犯的八个错误
- 把15秒当作一部完整宣传片,塞入多个场景和大量信息。
- 未处理海报上的小字和二维码,直接把它作为首帧。
- 上传许多参考素材,却不说明每份素材的用途。
- 先做2K和多版本,尚未确认构图与动作就消耗预算。
- 只看第一帧和最后一帧,不逐帧检查中间的变形与闪烁。
- 让模型生成活动名称、书名、引文、日期、Logo和数据库界面。
- 上传未授权的人脸、声音、馆藏图像、商业音乐或保密材料。
- 发布时不说明AI生成,也不保存提示词、任务ID、授权和修改记录。
十一、隐私、数据安全、版权与许可
云端上传要遵守最小必要原则
MiniMax开放平台隐私政策说明,用户的交互内容和输入可能上传到云端处理;平台还会处理账号、设备、日志和服务使用信息。MiniMax开放平台隐私政策 图书馆不应上传读者借阅记录、联系方式、未公开研究资料、内部系统画面、敏感空间照片或未经授权的录音录像。必须上传的素材应先去除无关个人信息。
素材权利由使用者负责
开放平台用户协议要求用户对上传的客户内容和数据拥有合法权利,并承担获得授权、告知和同意的责任。MiniMax开放平台用户协议 馆员应把人脸、声音、儿童影像、馆藏数字化图片、第三方海报、音乐、字体和商标列入发布前检查。
开放权重不等于无限制使用
H3 采用 MiniMax H3 Community License Agreement,不是 Apache或MIT许可证。许可证对适用地区、商业服务、品牌展示和公开生成内容披露作出条件;其中还要求公开传播机器生成内容时清楚披露。较大规模商业服务和特定地区部署需要单独审查。MiniMax H3 Community License Agreement
图书馆如只通过网页或API制作宣传片,仍应遵守平台协议和素材权利要求;如计划本地部署、对外提供生成服务或二次分发模型,应由法务和信息化部门先审查许可证,不要根据“开放权重”四个字直接上线。
公开发布要添加AI标识
公开发布应按我国《人工智能生成合成内容标识办法》及平台规则添加显式或隐式标识。国家互联网信息办公室发布信息 若画面涉及真实馆舍、历史场景或人物,还应在说明中写清“AI生成视觉演绎”或同等含义,避免被误认为纪实资料。
十二、可灵AI和Vidu继续承担什么角色
可灵AI
可灵AI保留为消费端候选工具。馆员已经熟悉其网页或客户端流程、需要快速图生视频、或者所在机构已有会员与审查经验时,可以继续使用。模型、积分、分辨率和会员权益变化较快,应以可灵AI官方页面的登录信息为准。
Vidu
Vidu保留为参考生成和API候选工具。已有 Vidu API 工作流、需要与 H3 做稳定性和成本对照,或已积累多主体参考素材时,可继续使用。调用前核对Vidu开放平台文档和当前价格。
选型建议
- 需要图片、动作视频和声音一起进入生成过程:优先测试 MiniMax H3。
- 只做简单图生视频并重视生成速度:比较 H3 Max、可灵AI和Vidu的当期表现。
- 已有成熟API和审核流程:不要为追新而迁移,先用同一组素材做盲测。
- 涉及敏感数据、本地部署或对外商业服务:先审查数据条款、许可证和基础设施成本。
十三、8分钟快闪演示脚本
- 0:00—0:40 说明任务:把一张通过审核的无文字主视觉做成8秒底片,不让模型生成活动信息。
- 0:40—1:20 展示 H3、H3 Max 和三种输入模式,解释本次为什么选 H3 首帧生成。
- 1:20—2:10 检查首帧比例、文字、二维码、人物授权和字幕安全区。
- 2:10—3:10 按“主体、动作、镜头、声音、限制”写提示词。
- 3:10—3:50 设置8秒、768P,提交任务;说明本次单条估算约4元。
- 3:50—5:10 查看预先生成的成功样片和失败样片,逐帧指出书页变形、背景弯曲、闪烁和声音不同步。
- 5:10—6:10 演示评分表:主体一致性、运动连续性、事实风险、声音合规、字幕安全区。
- 6:10—7:10 展示后期加入真实标题、日期、Logo、二维码、字幕和AIGC标识。
- 7:10—8:00 展示制作记录和审批结论;提醒现场任务可能排队,演示前备好成功、失败样片各一条。
十四、一页式操作清单
生成前
- ☐ 明确渠道、比例、时长、分辨率和文件规格;
- ☐ 判断文生、首帧、首尾帧或全能参考模式;
- ☐ 首帧删除活动文字、二维码和不稳定小元素;
- ☐ 图片、视频、音频、人脸和声音已有授权;
- ☐ 去除读者信息、内部界面和其他敏感内容;
- ☐ 估算候选数、重试、输入素材和2K费用。
生成中
- ☐ 每个镜头只有一个主要动作;
- ☐ 每份参考素材都写明用途;
- ☐ 明确主体不变项和负面限制;
- ☐ 先做768P小样,再决定是否2K;
- ☐ 保存提示词版本、模型、任务ID和费用;
- ☐ 逐帧检查主体、建筑、书页、文字和闪烁;
- ☐ 检查声音同步、人声、音乐和异常噪声。
发布前
- ☐ 真实标题、日期、地点、Logo和二维码均由后期加入;
- ☐ 核对活动信息、馆藏信息、引文和字幕;
- ☐ 核查肖像、声音、图片、音乐、字体和商标权利;
- ☐ 不把生成画面表述为真实记录或历史证据;
- ☐ 添加AIGC标识和必要的创意演绎说明;
- ☐ 保存源素材、成片、授权、费用、修改和审批记录。
十五、结论与采用建议
MiniMax H3 可以作为AI4L工具实验室的视频生成主力工具,重点承担短镜头、原生音画和多模态参考任务。可灵AI与Vidu继续作为候选工具,用于消费端快速创作、既有工作流和横向比较。
图书馆采用H3时,建议从一个低风险任务开始:一张已审核的无文字主视觉、一个8秒镜头、两个或三个候选、统一评分表、后期叠加全部事实信息。试点通过后再扩展到主题策展、培训片头和API批量任务。生成视频的价值在于缩短素材制作时间,发布责任仍由馆员和机构承担。
参考来源与延伸阅读
- MiniMax H3 官方发布说明,发布于2026年7月31日。
- MiniMax开放平台视频生成指南,模型模式、规格、输入限制与API流程,访问于2026年9月5日。
- MiniMax开放平台API概览,模型清单与能力范围,访问于2026年9月5日。
- MiniMax开放平台按量付费价格,访问于2026年9月5日。
- MiniMax开放平台视频资源包说明,访问于2026年9月5日。
- MiniMax H3 官方GitHub仓库,模型规格、在线入口和部署说明。
- MiniMax H3 Community License Agreement,许可日期2026年8月2日。
- MiniMax开放平台隐私政策。
- MiniMax开放平台用户协议。
- 可灵AI官方网站。
- Vidu开放平台介绍及价格说明。
- 人工智能生成合成内容标识办法。
- 项目内部资料:《面向图书馆工作的AI应用深度调研报告》及AI4L工具实验室任务卡。
更新提示: 视频模型、网页入口、价格、免费额度、并发、输入限制和数据条款变化较快。正式采购、培训或API接入前,应再次核验官方页面,并在内部记录核验日期。

留下评论