详细介绍
FLUX.1 是 Black Forest Labs 推出的多模态生成模型,能用来从文本或图像生成视频、图片等内容。
它适合做创意内容生成,比如用一段文字或一张图生成带音效的短视频,或者生成风格多样的高质量图片。有个问题是如果你需要处理视频输入(比如编辑或扩展已有视频),它也能支持这类视频到视频的生成任务。
主要功能
| 功能 | 说明 |
|---|---|
| 文本/图像生成视频 | 支持仅基于文本和/或静态图像(包括参考图、关键帧)生成视频 |
| 视频生成视频 | 支持基于已有视频进行续写、扩展、编辑或风格化生成新视频 |
| 多模态统一模型 | 一个模型同时支持图像、视频、音频和动作预测等多种模态 |
| 可选音频生成 | 生成视频时可同步生成多语言语音、音效和环境音 |
定价方案
采用按量付费模式,没有订阅费或席位费,只为你生成的内容付费。FLUX 3 Video 本周免费试用。
| 方案 | 价格 | 包含内容 |
|---|---|---|
| FLUX 3 Video Draft | $0.06/s(文本/图像→视频,HD) $0.12/s(文本/图像→视频,FHD) |
快速、低成本探索,仅支持文本/图像生成视频 |
| FLUX 3 Video | $0.17/s(文本/图像→视频,HD) $0.29/s(视频→视频,HD) $0.41/s(文本/图像→视频,FHD) $0.53/s(视频→视频,FHD) |
平衡质量、成本和延迟,支持文本/图像→视频和视频→视频 |
使用建议
适合内容创作者、视频制作人或开发者用来快速生成带音效的短视频或多风格图片。
也适合机器人研究领域,用于根据视觉观察和文本指令预测物理动作结果。
具体使用体验和详细功能,建议访问官网了解。
使用场景
1
生成包含多镜头、原生音频和环境音的短视频
问题
制作短视频需要分别处理画面、配音和音效,流程繁琐
解决
使用 FLUX.3 从文本、图像或关键帧出发,一次性生成包含多镜头、可选多语言语音、音效与环境音的视频片段
2
生成具有复杂提示、高精度文字渲染和多样艺术风格的图像
问题
现有图像生成工具难以准确呈现复杂描述中的细节和文字内容
解决
利用 FLUX.3 的图像生成功能,输入复杂提示,获得符合真实世界逻辑、文字准确且风格多样的图像
3
基于视觉观察和文本指令预测机器人控制动作
问题
机器人系统需将视觉输入与任务指令结合,以推断物理执行动作
解决
通过 FLUX.3 的行动预测功能,输入视觉观测和文本指令,输出预期物理结果的视觉表示及对应的机器人控制动作
常见问题
用户评分
—
0 人评分
5星
0
4星
0
3星
0
2星
0
1星
0
为此工具评分
