用原创语音驱动人物开口
MiniMax H3 Max Lip Sync 实际输出:虚构成年人物照片、5.42 秒合成问候语音、480P、关闭转写引导。示例保留原始语音,可点击下方按钮对照。开口幅度、牙齿和人物细节可能随生成变化。
收听原始语音套餐最高可省 73%
循环浏览站内全部其他 AI 视频模型与特效,点击卡片即可切换工具。
MiniMax H3 Max Lip Sync 实际输出:虚构成年人物照片、5.42 秒合成问候语音、480P、关闭转写引导。示例保留原始语音,可点击下方按钮对照。开口幅度、牙齿和人物细节可能随生成变化。
收听原始语音H3 Max Lip Sync 对口型使用一张照片和一段真实上传的录音。录音提供台词、语速、停顿与情绪,照片提供可见的人物或角色。输出是带有这段声音的生成视频。它不是在文生视频提示词里写一句对白,也不会根据文字自动创建新声音。如果你已经准备好一小段经过确认的配音,并希望给它配上说话人像,这个工作流更直接。
选择一张清楚的人像,再上传短 PCM WAV 录音。不要把字幕、对白框或文字烘焙进照片;声音会作为实际音频传给模型,不需要在提示词里重复描述。分别保存照片与配音,也方便更换表演而不必重新制作人像素材。
准备五秒到 14.8 秒的完整音频。本页面会拒绝超长录音,而不是悄悄删掉结尾。请让整句话以及自然的起止停顿都落在文件范围内。较长脚本应先按句子拆成独立片段,清楚命名,再分别生成与剪辑。
支持 480P、768P、1080P 和 2K。先用较小输出检查人物身份、嘴型节奏与表情,再决定是否提高分辨率。更高分辨率不能自动修复模糊原图、裁断的声音或被遮挡的嘴部。输出画幅会根据原图选择最接近的支持比例。
转写辅助帮助模型理解录音内容并匹配嘴型,本页默认关闭。它不是字幕编辑器或翻译工具;生成片段仍可能出现多余或不准确的文字。开启辅助时,尤其遇到演唱或特殊发音,应完整检查画面文字与嘴型,而不只听声音。
使用你自己的照片、同意参与的成年表演者照片,或你有权使用的原创虚构角色。建议从正面或轻微侧脸的头肩构图开始,让嘴唇清楚可见,脸部周围留一点空间。避免手、话筒、头发或服装遮住嘴部。一张图里只有一个明确说话者,比多人合影更容易检查。
先录制或剪好最终台词,再导出未压缩的单声道或双声道 PCM WAV。长度为五秒到 14.8 秒,文件不超过 12MB。听清是否存在爆音、缺字、重叠人声、突然剪断或过强噪声。语速、情绪、重音和停顿都来自这份录音,而不是一段隐藏脚本。
音频控件会验证文件并显示测得时长。提交前播放上传后的音频,确认没有误选同名旧版本。照片人物与声音应属于你获准表达的同一角色。把这两个源文件保存在项目目录里,方便以后追溯某条通过审核的视频来自哪些输入。
选择输出分辨率和转写辅助开关,查看生成按钮旁的实时要求,再提交一次。任务处理时可在结果区或生成历史中查看状态,避免因为等待而重复提交。任务完成后打开实际视频,从开头听到结尾,再判断是否适合使用。
这个工作流更依赖输入素材的质量,而不是长提示词。照片和声音会直接提供给对口型模型;一句泛泛的“电影级效果”不能替代清晰的人脸与完整录音。
图片宽高比必须在 0.4 到 2.5 之间。在支持范围内,尽量让人脸大到无需放大就能检查。极侧脸、远处小脸、张嘴过大的表情、运动模糊和严重遮挡都增加不确定性。不要期待把低清截图设置为 2K 后,就能还原原图不存在的嘴唇或牙齿细节。
第一轮测试尽量使用一个音量稳定的主要说话者。合唱、嘈杂采访或多层混音不一定能给单个人脸提供明确表演。音乐还可能盖住便于判断同步的辅音。可以先单独使用人声,确认嘴型后,再在编辑器里添加你有权使用的音乐。
音频第一帧立即开口、最后一帧突然断气,即使嘴型跟得上也会显得生硬。说话前留一小段安静,让最后一个音节完整结束。不要为了凑到五秒把一句短话不自然地拉长;用正常语速录一句完整问候、介绍或表达。
把 MP3 文件改名为 .wav 并不会转换音频。请在音频编辑器里导出未压缩 PCM WAV,使用常规采样率。上传端会检查 WAV 结构和实际样本数量,不会只相信文件名或浏览器时长。当前界面不接受压缩 WAV 变体,请先导出为未压缩 PCM WAV 后再上传。
用自己的照片和声音制作简短欢迎语、频道介绍或说明。让内容具体到一段短片能讲清楚,并在观众可能误解制作方式时明确说明这是合成呈现,而不是现场实拍。
让你拥有权利的插画角色说出由你或获授权配音者演绎的台词。先使用嘴部结构清楚的角色,而不是面具或没有五官的形象。风格化角色同样需要检查牙齿、唇缘、表情和身份是否在运动中漂移。
在与同事审核脚本时,制作一段短讲解员视频,用来讨论语速和表达。不要让人误以为某位真实员工说过未经其批准的话。内容里的事实声明必须另外核验,画面流畅不代表说法真实。
使用自己的照片与录音制作短问候。名字、口音、语气都应在录音中准确表达。使用他人的照片或声音之前取得许可,不要制作欺骗性背书、身份冒充,或把生成场景说成真实事件记录。
任务完成表示文件已返回,不等于每一帧都达到创意要求。对口型必须在运动中、开声音判断。封面无法证明某个辅音是否对齐,也无法看出人物中途是否变脸。
先不暂停播放一次,观察声音与嘴部是否存在明显延迟。再重点看开头、发音清晰的中间短句和最后一个词。小的时差在二次剪辑或与真人讲话素材拼接后可能更明显。
把整条视频中的人物与原图比较,关注嘴角、牙齿、下颌、眼睛和发际线的闪烁或形变。同时检查衣服、背景是否足够稳定。如果人脸不稳定,应先改善源图构图,再考虑提高输出分辨率。
听清是否漏掉结尾、出现意外静音、重复音节或节奏变化。对同步有较高要求时使用耳机。除了网页播放器,也打开下载的视频,确认交付文件包含预期声音,并能进入你平时使用的编辑流程。
将最终照片、录音、输出和人物许可一起保存。需要修订时,一次只调整一个变量:原图构图、音频表演、转写辅助或输出分辨率。这样每次测试更容易判断,也能减少无意义的重复生成。
先听源文件。声音很轻、长时间只有伴奏,或照片中的脸太小,都可能让结果难以判断。使用清楚的头肩构图和单人短录音,找到发音明确的一个词,对照对应视频时刻,分清是表情幅度较小,还是同步确实失败。
换用表情更自然、光线均匀的源图。强阴影、极端角度或高度风格化嘴部提供的结构信息较少。下一次保持同一音频,便于判断原图变化是否改善一致性。不要通过增加另一张脸来补偿;本页只有一个图像输入,面向单个明确说话者。
分别核对格式、长度和体积。WAV 容器可能装的是压缩音频,短音频也可能超过体积上限,导出的片段还可能比五秒略短。重新导出普通 PCM WAV,并检查实际文件。如果上传授权过期,需要重新上传后再提交,这不代表已经创建了新的视频任务。
同步只是可信表演的一部分。大笑照片配严肃录音、过快语速或夸张语调都可能显得不协调。再次生成前先统一表情、情绪和语气,并在最终展示尺寸上审核。手机上不起眼的小问题,在全屏演示时可能非常明显。
如果已有经过批准的短表演,希望生成对应的说话人像,本页是更直接的起点。你提供实际音频,不是让模型重新发明说话方式。保持单人清楚讲话的目标,不要混入复杂场景转换、快速运镜或多人对话。
通用 H3 Max 适合通过镜头说明描述主体、动作、环境、运镜和声音。它的控件与支持分辨率和专用对口型模型不同。应根据手头素材与目标选择工具,而不是因为同属一个模型家族,就认为各项能力完全互通。
生成表演通过审核后,再添加字幕、获授权音乐、片头和品牌元素。对文字清晰度有要求时,不要把文字先放进人物照片。这能把生成动画的不确定部分与确定性的排版工作分开,让你不必重新生成人脸就能修改成片呈现。
不能。请上传你希望出现在视频里的声音。本页让照片人物跟随该录音说话,不会克隆声音,也不会把文字脚本转换成配音。
使用未压缩的单声道或双声道 PCM WAV,长度五秒到 14.8 秒,不超过 12MB。请从音频编辑器导出,不要只改扩展名。服务器会验证实际音频时长。
本页单次不支持。请把长内容拆成经过确认的短句,分别生成后再剪辑。选择自然句子边界,使每段都有完整起止。
支持。对口型入口提供 480P、768P、1080P 和 2K,与另外的 H3 Max 文生视频生成器不同。建议先检查短草稿,再提高输出规格。
登录后上传录音并选择分辨率,生成器会在提交操作附近显示实时要求,并随服务器验证的音频长度和输出设置更新。
不保证。构图、画风、发音、噪声与表演都会影响结果。发布前请开声音检查全片,尤其是嘴部、牙齿、身份和最后一句话。
本生成器使用 H3 Max Lip Sync,以图片加音频驱动单个人像对口型,和 H3 Max 文生视频、H3 Max Turbo 是不同功能。已经准备好所需的人声表演,并希望让照片中的一张脸随录音说话或演唱时,可以选择这个工作流。