从静态图书馆员AI工具系列之十五:主视觉到原生音画预告片–图书馆员如何用 MiniMax H3 制作可审核的短视频

Open notebook with compass, pens, and coffee on a wooden desk

核心观点:MiniMax H3 适合把已经审核的海报、馆舍照片、角色设定、动作参考和声音意图组合成4—15秒短视频。它的优势不是“自动做完整宣传片”,而是一次处理文字、图片、视频和音频参考,并直接生成带立体声的短镜头。图书馆应把它用于低风险、可审核的宣传素材;活动名称、时间、地点、Logo、二维码和引用信息仍在后期制作。

一、为什么把 MiniMax H3 设为主力工具

MiniMax H3 是 MiniMax 于2026年7月31日发布的通用多模态视频模型。官方将它定位为“全模态生成模型”:同一任务可以同时接收文字、图片、视频和音频,输出最长15秒、最高2K并带原生立体声的视频。MiniMax H3 官方发布说明

对图书馆短视频制作而言,这一能力直接解决了三个实际问题。

  1. 画面有依据。 馆员可以把已经通过审核的活动主视觉设为首帧,减少主体和配色偏离。
  2. 动作有参照。 馆员可以提供一段已获授权的动作或运镜视频,让模型参考节奏,而不必只靠文字描述。
  3. 声音可以进入生成过程。 音乐气氛、环境声和节奏参考可以与画面一起提交,适合制作短预告、片头和氛围镜头。

H3 因此适合作为本期实验室的主力工具。原有的可灵AI和Vidu继续保留:可灵AI适合馆员在成熟的消费端界面中快速试做,Vidu适合已有工作流或API项目继续使用。选型的标准不是模型榜单,而是素材类型、授权条件、可用入口、预算和审核要求。

二、开发方、访问方式与模型版本

MiniMax 是一家通用人工智能公司。H3 目前有三类访问方式。

  • 网页创作。 普通馆员可以从海螺AI进入视频创作。网页端开放的具体模型、积分、并发和地区权限会随账号变化,应以登录后的页面为准。
  • 开放平台API。 技术团队可在MiniMax开放平台创建密钥,并按照视频生成指南提交异步任务。服务返回 task_id;客户端轮询任务状态,成功后从 content.url 下载成片。
  • 开放权重。 MiniMax 在官方GitHub仓库Hugging Face提供模型材料。自行部署需要较高GPU资源、推理维护能力和许可审查,通常不适合只做少量宣传片的图书馆。

开放平台目前列出两个版本。官方视频生成指南

  • MiniMax-H3。 支持文生视频、首帧或首尾帧生成,以及图片、视频、音频混合参考;输出768P或2K;时长4—15秒。
  • MiniMax-H3-Max。 偏重速度;当前支持文生视频和图生视频;输出480P或768P;时长5—15秒。需要混合参考或2K时仍应选 H3。

对馆员的简化判断是:只有一句描述时,可先用 H3 Max 快速试方向;已有主视觉并需要原生音画,或要同时参考图片、动作和声音时,选 H3。

三、H3 能做什么

文生视频

只提交提示词,从零生成一个短镜头。适合知识网络、数据流、纸张翻动、光影变化等抽象视觉。它不适合生成必须与真实馆舍一致的纪实画面。

首帧和首尾帧生成

提交一张首帧,或同时提交首帧和尾帧,再说明动作与运镜。图书馆最常用的是“审核后的无文字海报作为首帧”,让画面只发生轻微运动。首尾帧适合把两个已确认画面连接起来,但中间过程仍可能变形。

全能参考生成

H3 可以组合参考图片、视频和音频。开放平台当前规定:图片不超过9张;视频不超过3段且总时长不超过15秒;音频不超过3段且总时长不超过15秒;混合文件总数不超过12个。单个视频、图片、音频的大小上限分别为50MB、30MB和15MB,API请求体上限为64MB,官方建议较大素材通过URL传入。模型输入条件

这项能力最有价值,也最容易误用。素材多不等于控制更精确。每一份参考素材都应有明确角色,例如“图1只参考人物服装”“视频1只参考镜头运动”“音频1只参考节奏”。没有角色说明时,模型可能混合不应混合的特征。

提示词增强与2K再生成

开放平台还提供 H3-Context-IR,用多模态上下文生成结构化增强提示词;它只返回提示词,不生成视频。已有合格的 H3 768P 成片时,可再生成2K版本。两项功能都适合技术试点,但不应替代人工检查。增强后的提示词可能改变原意,2K也不会自动修复人物、文字和物理错误。H3-Context-IR与视频再生成说明

四、费用与免费额度

截至2026年9月5日,MiniMax开放平台按生成秒数计费。按量付费价格

  • MiniMax H3 768P:0.50元/秒;生成8秒约4元,15秒约7.5元。
  • MiniMax H3 2K:0.80元/秒;生成8秒约6.4元,15秒约12元。
  • MiniMax H3 Max 480P:0.33元/秒。
  • MiniMax H3 Max 768P:0.50元/秒。
  • H3 的音频输入当前不收费;参考图片前5张免费,超出部分0.20元/张;参考视频按时长和分辨率另计。
  • 768P成片再生成2K,输出部分为0.30元/秒;原始输入素材按规则重新计费。
  • H3-Context-IR 当前按Token计费,输入和输出价格不同,调用前应查看价格页。

官方的视频资源包页面明确提示,现有海螺视频模型资源包不支持 MiniMax H3;H3 应按量付费或联系商务。视频资源包说明 官方没有承诺长期固定的H3免费额度。网页端如显示赠送积分,应把它视为账号当期权益,不写进项目预算。

预算不能只算最终成片。一条8秒768P镜头若生成3个候选,生成成本约12元;若三条都再做2K,费用还会增加。实际项目还应计入失败重试、素材制作、剪辑、字幕、配音、音乐授权和人工审核。

五、图书馆适用场景

阅读推广和活动预告

把已经审核的书展海报、读书会主视觉或无文字插画转成5—10秒竖版预告。模型负责光影、翻页、粒子和镜头运动;活动名称、日期、地点和报名二维码由后期添加。

主题策展和数字展览

以展览主视觉、展品局部和氛围音乐为参考,生成章节片头、转场或循环背景。涉及馆藏实物和历史图像时,应保存来源与授权记录,不能让生成内容冒充原件影像。

馆舍与服务宣传

用授权的馆舍照片制作概念性镜头,例如从建筑外观缓慢推进到阅读空间。若模型改变建筑结构、消防标识或服务设施,成片只能标注为创意演示,不能当作导览或事实记录。

数据库和信息素养培训

生成抽象片头、章节过渡和概念动画,例如把散乱文献卡片组织成检索网络。数据库界面、检索步骤、字段名称和统计数字必须使用真实录屏或人工制作。

馆员培训

用同一素材和提示词比较不同模型、分辨率、时长与参考模式。培训重点应放在任务拆分、版权检查、质量评分和成本记录,而不是只展示成功样片。

批量内容试点

技术团队可通过API批量生成同一视觉规范下的片头或转场。批量不等于无人审核。每条视频仍需要进入人工复核、后期处理和发布审批。

六、H3 不适合承担的任务

  1. 真实事件记录。 模型生成的视频不能作为讲座、展览、馆舍改造或历史事件的影像证据。
  2. 准确文字呈现。 书名、引文、日期、Logo和二维码可能变形,必须后期叠加。
  3. 长篇完整叙事。 4—15秒更适合一个镜头、一个动作或一个转场。多镜头内容应先分镜,再逐条生成和剪辑。
  4. 高风险人物再现。 未经授权的人脸、声音、儿童影像、专家形象和名人形象不应上传或生成。
  5. 专业事实表达。 模型不会核验馆藏数据、活动信息、学术观点或历史细节。事实应来自业务系统、原始文件和可靠文献。
  6. 自动通过审核。 2K只提高输出规格,不保证主体一致、物理合理和内容合规。

七、七步标准工作法

  1. 写清任务单。 先确定平台、画幅、时长、用途、发布日期、目标受众和必须出现的信息。
  2. 整理授权素材。 首帧、尾帧、馆舍照片、人物、音乐、环境声和参考视频逐项标注来源、授权范围和保留期限。
  3. 选择生成模式。 无素材用文生视频;已有主视觉用首帧;需要明确终点用首尾帧;需要参考人物、动作、声音或剪辑节奏时用全能参考。
  4. 写关系明确的提示词。 依次说明主体、动作、镜头、环境、声音、时长和限制。混合参考时说明每份素材的用途。
  5. 先做768P小样。 每次只改变一个变量,如运镜或动作幅度;生成2—3个候选并评分。不要一开始批量生成2K。
  6. 人工复核和后期制作。 逐帧检查主体、手部、书页、建筑、文字、声音和闪烁;在剪辑软件中加入真实标题、字幕、Logo、二维码和片尾标识。
  7. 保存制作记录。 保存提示词、输入素材清单、模型版本、任务ID、费用、生成日期、修改说明、授权证明、最终文件和审批结论。

八、三个可复现案例

案例一 把阅读推广主视觉做成8秒竖版预告

任务背景

图书馆已有一张通过审核的9:16无文字主视觉:打开的书、蓝金色光点和稳定的背景书架。目标是在公众号视频号或短视频平台发布8秒预告。

操作步骤

  1. 删除首帧中的活动文字、二维码和Logo,只保留画面。
  2. 选择 MiniMax H3 的图生视频模式,上传首帧。
  3. 设置8秒、768P;比例随首帧自适应。
  4. 使用同一提示词生成3个候选,只比较主体稳定性和运动幅度。
  5. 选出合格镜头;确有发布需要时再生成2K或进入剪辑软件。
  6. 后期加入活动名称、日期、地点、Logo、字幕和AIGC标识。

可直接复制的提示词

保持参考首帧的构图、书本造型、蓝金配色和背景书架不变。镜头在8秒内非常缓慢地向前推进。打开的书只自然翻动一页,少量蓝金色光点从书页升起,在上方形成简洁的抽象知识网络。环境光逐渐变亮,运动克制、稳定、连续。保留画面上方和下方的字幕安全区。生成自然的轻微翻页声和安静的室内环境声,不生成音乐。不要增加人物、文字、Logo、二维码或新的书籍;不要改变书本结构;不要出现快速转场、闪烁、抖动和镜头突跳。

预期输出

3条8秒竖版候选,至少1条可作为无字底片进入后期;声音只有翻页与室内环境声。

馆员人工复核要点

检查书本是否多页粘连、封面是否变化、书架是否弯曲、光点是否遮挡字幕区、声音是否与翻页同步。任何生成文字都应舍弃,不要尝试“修到能认”。

案例二 用图片、动作和声音参考制作主题策展预告

任务背景

图书馆准备“城市记忆”主题展,需要12秒横版片头。已有授权的老照片扫描件、展览主视觉、一段缓慢横移动作参考和一段环境声。目标是营造氛围,不复原具体历史事件。

操作步骤

  1. 选2张有明确授权的图片:图1只参考主视觉色调,图2只参考历史照片的纸张质感。
  2. 选1段2—5秒的横移视频,只参考运镜,不参考其中人物和场景。
  3. 选1段无人物对白的城市环境声,只参考节奏和空间感。
  4. 选择 MiniMax H3 全能参考模式,设置12秒、16:9、768P。
  5. 在提示词中明确每份素材的角色,先生成2个候选。
  6. 后期加入展览名称、文献出处、日期和片尾说明。

可直接复制的提示词

制作12秒横版主题展片头。图片1只用于蓝灰色调和版式气质,不复制其中任何文字;图片2只用于旧纸张、胶片颗粒和边缘磨损的质感,不把照片人物重新生成。镜头运动只参考视频1的缓慢横移速度,不参考视频1的场景和主体。声音只参考音频1的城市空间感和节奏,不复制可识别的人声。画面从抽象的旧纸纹理开始,几张无文字的文献卡片依次进入画面,最后排列成稳定的展览背景。镜头连续、运动平缓、无快速剪辑。不得生成具体历史事件、真实人物面孔、文字、印章、Logo或地图边界;不得让文献卡片变形或相互穿透。

预期输出

一段可用于展览开场的抽象片头。它只表达“城市记忆与文献”的主题,不声称还原任何历史现场。

馆员人工复核要点

确认没有生成可识别但未经授权的人脸、错误文字、伪造印章或似是而非的地图;核对环境声中是否夹带人声、音乐或其他版权内容;在发布页明确说明画面为AI生成的视觉演绎。

案例三 用API测试批量片头的稳定性和成本

任务背景

技术部门准备评估是否为三个信息素养课程统一生成6秒片头。试点只使用自制的无文字首帧,不涉及读者信息和馆藏数据。

操作步骤

  1. 在服务端保存 MINIMAX_API_KEY,不要写入网页前端、共享文档或代码仓库。
  2. 为三个课程各准备一张首帧,计算文件校验值并登记授权来源。
  3. https://api.minimax.cn/v2/video_generation 提交 MiniMax-H3 任务,设置6秒和768P。
  4. 保存返回的 task_id;每10秒查询一次 /v2/query/video_generation/{task_id}
  5. 成功后立即把 content.url 指向的文件下载到本地,并记录状态、时间和费用。官方API流程与示例
  6. 每条片头按同一量表评分,只有全部关键项合格才进入后期。

可直接复制的任务表达

模型:MiniMax-H3。模式:首帧图生视频。时长:6秒。分辨率:768P。保持首帧构图、颜色和主体不变;镜头缓慢向前推进;三个抽象文献节点依次连接成稳定的检索路径;不生成文字、人物、Logo、数据库界面、快速转场或闪烁。记录字段:课程编号|任务ID|首帧SHA-256|提示词版本|提交时间|完成时间|状态|生成费用|重试次数|主体一致性|运动连续性|声音合规|人工结论|本地文件路径。

预期输出

3条6秒768P测试片,纯生成费用约9元,不含参考视频、超额图片、重试和后期。如果每条生成两个候选,预算约18元。

馆员人工复核要点

检查实际账单与估算是否一致;记录失败任务是否收费;确认下载文件已保存、任务ID可追溯、密钥没有出现在日志中;不要把一次成功当作批量稳定性的证明。

九、怎样写出更可控的提示词

H3 的提示词可以很长,但长并不等于有效。馆员可使用以下顺序。

  1. 任务和规格: 8秒、9:16、宣传底片、无文字。
  2. 主体和不变项: 保持首帧构图、人物服装、馆舍结构或主视觉配色。
  3. 动作: 一本书翻一页,读者抬头一次,镜头缓慢前推。
  4. 环境变化: 光线逐渐变亮,少量粒子移动。
  5. 声音: 只要翻页声和室内环境声,不要对白和音乐。
  6. 参考关系: 图1参考角色,视频1参考动作,音频1参考节奏。
  7. 限制: 无文字、无Logo、无新增人物、无突切、无形变、无闪烁。

不要同时要求“推近、环绕、升空、快速切换、人物行走、书页飞舞、标题出现”。一个短镜头保留一个主要动作和一个辅助变化,通常更容易审核。

十、新手最容易犯的八个错误

  1. 把15秒当作一部完整宣传片,塞入多个场景和大量信息。
  2. 未处理海报上的小字和二维码,直接把它作为首帧。
  3. 上传许多参考素材,却不说明每份素材的用途。
  4. 先做2K和多版本,尚未确认构图与动作就消耗预算。
  5. 只看第一帧和最后一帧,不逐帧检查中间的变形与闪烁。
  6. 让模型生成活动名称、书名、引文、日期、Logo和数据库界面。
  7. 上传未授权的人脸、声音、馆藏图像、商业音乐或保密材料。
  8. 发布时不说明AI生成,也不保存提示词、任务ID、授权和修改记录。

十一、隐私、数据安全、版权与许可

云端上传要遵守最小必要原则

MiniMax开放平台隐私政策说明,用户的交互内容和输入可能上传到云端处理;平台还会处理账号、设备、日志和服务使用信息。MiniMax开放平台隐私政策 图书馆不应上传读者借阅记录、联系方式、未公开研究资料、内部系统画面、敏感空间照片或未经授权的录音录像。必须上传的素材应先去除无关个人信息。

素材权利由使用者负责

开放平台用户协议要求用户对上传的客户内容和数据拥有合法权利,并承担获得授权、告知和同意的责任。MiniMax开放平台用户协议 馆员应把人脸、声音、儿童影像、馆藏数字化图片、第三方海报、音乐、字体和商标列入发布前检查。

开放权重不等于无限制使用

H3 采用 MiniMax H3 Community License Agreement,不是 Apache或MIT许可证。许可证对适用地区、商业服务、品牌展示和公开生成内容披露作出条件;其中还要求公开传播机器生成内容时清楚披露。较大规模商业服务和特定地区部署需要单独审查。MiniMax H3 Community License Agreement

图书馆如只通过网页或API制作宣传片,仍应遵守平台协议和素材权利要求;如计划本地部署、对外提供生成服务或二次分发模型,应由法务和信息化部门先审查许可证,不要根据“开放权重”四个字直接上线。

公开发布要添加AI标识

公开发布应按我国《人工智能生成合成内容标识办法》及平台规则添加显式或隐式标识。国家互联网信息办公室发布信息 若画面涉及真实馆舍、历史场景或人物,还应在说明中写清“AI生成视觉演绎”或同等含义,避免被误认为纪实资料。

十二、可灵AI和Vidu继续承担什么角色

可灵AI

可灵AI保留为消费端候选工具。馆员已经熟悉其网页或客户端流程、需要快速图生视频、或者所在机构已有会员与审查经验时,可以继续使用。模型、积分、分辨率和会员权益变化较快,应以可灵AI官方页面的登录信息为准。

Vidu

Vidu保留为参考生成和API候选工具。已有 Vidu API 工作流、需要与 H3 做稳定性和成本对照,或已积累多主体参考素材时,可继续使用。调用前核对Vidu开放平台文档当前价格

选型建议

  • 需要图片、动作视频和声音一起进入生成过程:优先测试 MiniMax H3。
  • 只做简单图生视频并重视生成速度:比较 H3 Max、可灵AI和Vidu的当期表现。
  • 已有成熟API和审核流程:不要为追新而迁移,先用同一组素材做盲测。
  • 涉及敏感数据、本地部署或对外商业服务:先审查数据条款、许可证和基础设施成本。

十三、8分钟快闪演示脚本

  • 0:00—0:40 说明任务:把一张通过审核的无文字主视觉做成8秒底片,不让模型生成活动信息。
  • 0:40—1:20 展示 H3、H3 Max 和三种输入模式,解释本次为什么选 H3 首帧生成。
  • 1:20—2:10 检查首帧比例、文字、二维码、人物授权和字幕安全区。
  • 2:10—3:10 按“主体、动作、镜头、声音、限制”写提示词。
  • 3:10—3:50 设置8秒、768P,提交任务;说明本次单条估算约4元。
  • 3:50—5:10 查看预先生成的成功样片和失败样片,逐帧指出书页变形、背景弯曲、闪烁和声音不同步。
  • 5:10—6:10 演示评分表:主体一致性、运动连续性、事实风险、声音合规、字幕安全区。
  • 6:10—7:10 展示后期加入真实标题、日期、Logo、二维码、字幕和AIGC标识。
  • 7:10—8:00 展示制作记录和审批结论;提醒现场任务可能排队,演示前备好成功、失败样片各一条。

十四、一页式操作清单

生成前

  • ☐ 明确渠道、比例、时长、分辨率和文件规格;
  • ☐ 判断文生、首帧、首尾帧或全能参考模式;
  • ☐ 首帧删除活动文字、二维码和不稳定小元素;
  • ☐ 图片、视频、音频、人脸和声音已有授权;
  • ☐ 去除读者信息、内部界面和其他敏感内容;
  • ☐ 估算候选数、重试、输入素材和2K费用。

生成中

  • ☐ 每个镜头只有一个主要动作;
  • ☐ 每份参考素材都写明用途;
  • ☐ 明确主体不变项和负面限制;
  • ☐ 先做768P小样,再决定是否2K;
  • ☐ 保存提示词版本、模型、任务ID和费用;
  • ☐ 逐帧检查主体、建筑、书页、文字和闪烁;
  • ☐ 检查声音同步、人声、音乐和异常噪声。

发布前

  • ☐ 真实标题、日期、地点、Logo和二维码均由后期加入;
  • ☐ 核对活动信息、馆藏信息、引文和字幕;
  • ☐ 核查肖像、声音、图片、音乐、字体和商标权利;
  • ☐ 不把生成画面表述为真实记录或历史证据;
  • ☐ 添加AIGC标识和必要的创意演绎说明;
  • ☐ 保存源素材、成片、授权、费用、修改和审批记录。

十五、结论与采用建议

MiniMax H3 可以作为AI4L工具实验室的视频生成主力工具,重点承担短镜头、原生音画和多模态参考任务。可灵AI与Vidu继续作为候选工具,用于消费端快速创作、既有工作流和横向比较。

图书馆采用H3时,建议从一个低风险任务开始:一张已审核的无文字主视觉、一个8秒镜头、两个或三个候选、统一评分表、后期叠加全部事实信息。试点通过后再扩展到主题策展、培训片头和API批量任务。生成视频的价值在于缩短素材制作时间,发布责任仍由馆员和机构承担。


参考来源与延伸阅读

  1. MiniMax H3 官方发布说明,发布于2026年7月31日。
  2. MiniMax开放平台视频生成指南,模型模式、规格、输入限制与API流程,访问于2026年9月5日。
  3. MiniMax开放平台API概览,模型清单与能力范围,访问于2026年9月5日。
  4. MiniMax开放平台按量付费价格,访问于2026年9月5日。
  5. MiniMax开放平台视频资源包说明,访问于2026年9月5日。
  6. MiniMax H3 官方GitHub仓库,模型规格、在线入口和部署说明。
  7. MiniMax H3 Community License Agreement,许可日期2026年8月2日。
  8. MiniMax开放平台隐私政策
  9. MiniMax开放平台用户协议
  10. 可灵AI官方网站
  11. Vidu开放平台介绍价格说明
  12. 人工智能生成合成内容标识办法
  13. 项目内部资料:《面向图书馆工作的AI应用深度调研报告》及AI4L工具实验室任务卡。

更新提示: 视频模型、网页入口、价格、免费额度、并发、输入限制和数据条款变化较快。正式采购、培训或API接入前,应再次核验官方页面,并在内部记录核验日期。



留下评论