不到 3 秒
生成 5 秒、768p 视频所需时间短于成片播放时长,大幅缩短从灵感到可见画面的等待周期(数据来自 fal 官方测试)。
将文字或图片生成 480p/768p 有声视频。H3 Max 的生成速度快于视频播放,让你更快检查镜头、调整方向并尝试下一版。
H3 Max AI 视频生成器结合了 fal 的额外训练与联合优化的推理引擎。相比开放权重的基础模型,它最突出的优势是速度,同时改善了提示词遵循与视觉质量。
生成 5 秒、768p 视频所需时间短于成片播放时长,大幅缩短从灵感到可见画面的等待周期(数据来自 fal 官方测试)。
fal 报告的吞吐量约为原始 H3 官方接口的 35 倍。该数据比较的是托管接口;自行部署基础模型时,速度取决于硬件与推理配置。
视频原生同步生成声音。在提示词中写入对白、环境音或动作音效,每次尝试都能同时检查画面与声音,再调整下一版。
从开放权重的基础模型,到 fal 后训练的新模型,最显著的变化是速度。H3 Max 将后训练与专用推理引擎结合,让创意更快变成结果。
原始官方接口:fal 速度对比中的基准。
据 fal:不到 3 秒生成 5 秒、768p 视频,吞吐量约为基准的 35 倍。
原始 H3 模型;开放的基础权重可用于继续训练。
由 fal 进行后训练,并与自有推理引擎联合优化。
H3 Base 权重与推理代码已公开,可以自行部署;完整托管工作流未全部开放。
当前通过托管 API 使用。截至 2026 年 9 月 3 日,未查到官方公开的 Max 权重。
可生成带原生音频的视频,是 Max 的基础模型。
保留原生音频;fal 在提速的同时,通过后训练提升提示词遵循与画面美感。
Base:768p;官方托管服务:768p / 2K,4–15 秒。
480p / 768p,5–15 秒。不到 3 秒的数据对应 5 秒、768p 片段。
从产品动态到风格化人物,浏览下一段场景的创作方向,用这些参考完善自己的镜头提示词。
跟随教程准备输入素材、描述一个镜头、选择可用设置,并检查生成的 H3 Max 视频。
快速试稿时,可选择 768p、5–10 秒和 Balanced 提示词扩展。先写清一个场景及其声音,每轮只改一个细节。H3 Max 支持 480p/768p 与 5–15 秒时长。
说明人物、产品、物体或地点,并写出需要保持稳定的服装、材质、颜色或尺寸。
选择一个主要动作,只补充对场景有帮助的小动作,并为每个环节留出足够时间。
说明地点、时间、光线、天气和必要的背景活动,让视觉环境保持稳定。
明确景别,并选择一种运镜,例如缓慢推进、横向跟拍、固定广角或环绕镜头。
按顺序写出开始、变化与结束。使用首尾帧时,描述两张图片之间如何运动。
写出需要的对白、环境音、配乐或动作音效,并说明它们何时出现。
当一个创意需要尝试几版时,H3 Max 的优势最明显。更快的生成让你有更多时间比较镜头并完善最好的方向。
为同一活动尝试产品亮相、动作开场和特写三种方向。先比较前几秒的效果,再投入完整剪辑。
把刚想到的开场变成短片初稿,再调整构图或节奏。在思路还清晰时,连续试出几个方向。
用一句简短讲解搭配一个可见动作,检查两者是否把概念讲清楚,再调整下一版。多个短片可作为较长课程的素材。
从产品图片出发,比较轻微环绕和细节揭示两种镜头。逐版检查外形与标签,筛选值得保留的方向。
把讨论中的运镜变成短片草稿,用画面沟通构图和节奏。在团队仍围绕同一场景讨论时,更快试出下一版。
用同一个简单动作,尝试黏土、纸艺或像素风格。保持提示词主体一致,让每个短片都帮助你选择视觉方向。
根据已有素材选择文生视频、图生视频或首尾帧输入方式。
从文字创意开始
创作原创场景时,描述主体、动作、镜头、声音与输出比例。
适合视觉概念、氛围尝试和不同运镜方案。
从视觉参考开始
用图片确定人物、产品或开场构图,再描述接下来怎么动;视频比例跟随起始图。
适合产品照片、人像、插画和需要明确开场的镜头。
引导首尾画面
用结束帧引导最终姿态或构图,并描述自然运动,同时保持主体与风格一致。
适合有计划的展示、姿态变化或需要指定结尾画面的镜头。
让输入匹配创作任务
文字适合探索,图片固定开场,两帧引导首尾;两帧之间的动作仍需写清楚。
了解 H3 Max 的生成速度、原生音频、输出设置,以及它与开放权重 H3 基础模型的区别。