文生视频与六种画幅
没有源素材时,用文字描述完整镜头。21:9 适合超宽画面,16:9 适合常规视频,4:3 和 1:1 适合紧凑构图,3:4 与 9:16 适合竖屏。画幅改变画布与构图;分辨率和时长在生成器中单独选择。
先写一个能在所选时长内完成的镜头,选择输出参数,并在本生成器内查看实时所需积分后提交。
MiniMax H3 Max
fal 官方 MiniMax H3 Max 输出示例
此素材来自 fal 官方模型页,用于说明供应商能力,不代表 NanoPic 已付费实测。

MiniMax H3 Max 是 fal 基于 MiniMax H3 做的高速后训练版本。它能把文字说明,或按顺序提供的一至两张画面,变成 5–15 秒的 480P/768P 视频,并在返回文件中包含同步音频。更有效的用法不是堆叠形容词,而是把它当作镜头制作工具:明确主体、一个可见动作、一个镜头决定、环境和由画面事件产生的声音。创意还不稳定时先用 5 秒 480P,只有构图和运动值得保留后再增加时长或升级 768P。
下列控件严格对应 fal 当前公开的 H3 Max 端点结构;NanoPic 不会把不支持的选项偷偷转换到另一个模型。
没有源素材时,用文字描述完整镜头。21:9 适合超宽画面,16:9 适合常规视频,4:3 和 1:1 适合紧凑构图,3:4 与 9:16 适合竖屏。画幅改变画布与构图;分辨率和时长在生成器中单独选择。
上传一张图片固定开场构图;当最终状态很重要时,再按顺序添加第二张图片,例如让产品转到英雄角度,或让房间从白天过渡到夜晚。图生视频沿用源图几何关系,因此 NanoPic 会移除独立画幅选择,避免向供应商发送无效参数。
端点支持 5–15 秒内的每个整数。短测试更容易诊断,一个动作也不容易被无关场景打断。长视频适合对白、揭示或多阶段运动,提示词最好写清每个节拍的先后顺序。
480P 适合测试提示词、动作和运镜;镜头逻辑稳定后,再用 768P 获得更细致的输出。fal 这组端点没有提供 1080P 或 2K,因此页面不会显示这些标签。完成后返回的是可保存到任务记录的视频文件。
端点直接生成含同步音频的视频,不需要 NanoPic 额外拼接声音。应把环境声、台词、音乐和音效写到可见事件上,例如开关移动时发出点击声。必须打开最终视频试听,静态封面无法证明声音是否存在或同步。
Balanced 适合日常迭代;Quality 会让供应商花更多处理时间整理提示词,fal 的结构说明称可能多花约 30 秒。扩写不能替代清晰镜头,也不会自动切换分辨率或变成 H3 Max Turbo。
把每次生成当作一个受控制作决策。先用聚焦测试回答最重要的问题,比一开始同时解决所有创意问题更有效。
希望模型同时设计构图和运动时选择文生视频;产品角度、人物外观、色彩或地点必须从确定画面开始时选择图生视频。只有确实需要结尾状态,并且能描述两张图之间的合理路径时才添加尾帧。主体身份、透视和光线同时大幅变化,会让转场目标含糊。专用适配器会按界面顺序把第一张图发送为 image_url,第二张发送为 end_image_url。
选择生成场景五秒视频先写一个主动作和一个运镜,把身份与连续性要求放在装饰性风格词之前,然后按时间顺序描述动作、机位、光线、环境运动和声音。十至十五秒可以拆成开场、发展和最终停顿。台词长度要符合真实语速,不要同时要求镜头固定、手持跟拍和环绕。
查看提示结构先生成一段短 480P 草稿,逐项检查轮廓稳定、手脸连续、物体接触、运镜方向、事件顺序和声画同步。如果失败,一次只改变一类指令。直接升级 768P 不会修复含糊调度,只会以更高规格渲染同一份计划。
尝试短草稿短草稿通过后,再为复杂运动或对白增加秒数,并在细节确实有价值时切换 768P。确认任务进入 COMPLETED,打开返回视频并试听音轨,对照提示词和源画面检查。保存成功任务的时长、分辨率、画幅、扩写模式和种子,为下一轮提供可复现的基线。
查看控制项好的提示词像给摄影、演员、美术和声音团队的短制作说明。模型可以扩写,但创意层级仍由你决定。
先写主角及不能漂移的属性:年龄范围、发型、服装、产品材质、车辆轮廓或建筑特征。有首帧时,说明哪些内容必须保持、哪些允许运动。把“更有电影感”换成能在画面中观察到的决定。
按出现顺序写动作。短片通常只需要一个有明确终点的动词;长片再增加节拍,不要塞进完整广告。放下杯子、关门、落地等接触事件能连接运动和声音,也能帮助检查物理关系是否合理。
明确景别、镜头质感、机位高度和一个主运镜。缓慢推进、横向跟拍、受控环绕、升降揭示或固定微距都比抽象风格词更可执行。写清哪些内容必须留在画面内,以及结尾是否需要停顿,避免互相冲突的镜头要求。
描述主光、时间、反差、颜色关系、天气和材质反应。湿地、拉丝金属、纸张纤维、半透明布料和皮肤需要不同的光线表达。蒸汽、树叶、倒影和尘埃等环境运动应该服务主体,而不是抢走注意力。
先指明说话者,台词要能在所选时长自然说完。把音效连到来源与时刻,例如盒子合上时发出轻微卡扣声。环境声与音乐分开描述;需要安静也应明确写出。口型与同步必须在实际视频中检查。
写清不要字幕、不要重复人物、不要品牌标记、不要切镜和不要新增物体等限制。尾帧只是视觉终点,提示词仍需解释如何到达。种子适合做受控对比,但其他参数变化后不能保证完全相同的输出。
当速度重要,同时镜头仍需要明确运动和声音方向时,H3 Max 更有价值。
把稳定产品图变成旋转、揭示、装配或材质近景。用源图保护初始轮廓,不要把必须准确的标签和事实交给生成画面,除非后期会替换;商用前逐帧检查反射、文字和几何。
用 9:16 测试竖屏开场,用 1:1 设计信息流画面,用 16:9 制作横屏段落。活动文案应在剪辑软件添加,不要依赖模型拼写。五秒草稿应该在没有解释时也能读懂视觉创意。
规划一个手势、反应、入场或短台词,用可观察语言写服装、视线、身体方向和情绪变化。首帧能固定外观起点,但人脸、手部和身份敏感细节仍需检查整个视频。
把分镜或文字镜头变成导演、剪辑和客户讨论节奏的动态参考。它适合交流机位和动作,不代表正式制作会完全一致。短测试成功后,增加时长能让揭示和结尾停顿更自然。
围绕明确焦点探索天气、时段、水面、交通、植物或人群氛围。先确定尺度和机位高度,避免背景运动淹没主体。生成的地点与事件不能当作真实纪录证据。
用有顺序的首尾帧测试受控变形或机位穿越。结构相近的画面更容易找到合理路径;写清什么改变、什么固定、何时稳定到最终状态。端点主体完全无关时,应把结果视为探索性变形,而不是连续性可靠的镜头。
三者使用独立路由、不同供应商和控制项。NanoPic 没有把现有 H3 改名来制造 Max 标签。
需要 fal 的 H3 Max 文生或首尾帧端点,以及 480P/768P、5–15 秒控制时选择本页。fal 还列出单独的 H3 Max 参考端点,但当前公开表单无法安全约束该端点混合参考图、视频与音频的输入规则,因此暂不开放。
Turbo 提供同样的两种公开创作模式、时长、分辨率和固定画幅。它是独立 fal 模型别名,不是向 H3 Max 端点发送的速度开关。
NanoPic 现有 MiniMax H3 使用已验证 KIE 模型 ID,提供 768P/2K,从 4 秒开始,并有独立参考图片路由。不要用 Max 或 Turbo 的设置推断它。
生成前确认真实路由、参数、输入规则、声音行为与验证状态。
是。fal 公布并保持 active 状态的公开别名是 minimax/h3-max/text-to-video 与 minimax/h3-max/image-to-video;MiniMax 模型指南说明 H3 Max 是 fal 基于 H3 做的高速后训练版本。NanoPic 将这些 ID 与现有 KIE H3 完全分开。
本页开放文生视频和图生视频。图生需要首帧,可选第二张作为尾帧。fal 也有支持图片、视频与音频素材的参考端点,但在 NanoPic 能可靠计算参考 token 前暂不开放。
时长为 5–15 秒内任意整数,分辨率为 480P 或 768P。文生支持 21:9、16:9、4:3、1:1、3:4 和 9:16;图生沿用首帧几何关系,不发送独立画幅。
fal 将它作为原生视听生成端点,返回视频文件。可在提示中描述台词、环境、音乐和动作音效;必须打开最终视频试听,图片预览无法确认同步与质量。
在生成器内选择场景、时长与分辨率。已登录用户会在生成操作区看到提交当前任务所需的实时 NanoPic 积分。
会。时长和分辨率会影响当前需求,提交前应以生成器内部实时显示的数值为准。
它让供应商花更多处理时间整理提示,fal 称可能多约 30 秒。它不会选择 Turbo、提高分辨率、延长视频,也不能保证含糊或过载的提示自动变得合理。
尚未。本地测试覆盖路由、请求结构、队列轮询、输出解析、参数归一化与严格拒绝行为;页面样例来自 fal 官方模型页。付费 NanoPic 真实生成需要单独批准,通过后才能宣称生产就绪。
从 5 秒 480P、一个主体、一个动作、一个运镜开始,把声音绑定到可见事件;提交前确认模型与设置。