$100 AI 音乐视频:Claude Fable 5 对比 GPT-5.6 Sol
所有帖子 视频对比 智能体 $100 AI 音乐视频:Claude Fable 5 对比 GPT-5.6 Sol 我们给 Claude Fable 5 和 GPT-5.6 Sol 同一首歌、一个预算、网络搜索和本地 ffmpeg,然后让它们各自自主导演一部音乐视频。 TryAI · 2026 年 7 月 16 日 · 8 分钟阅读
我们构建了一个小型智能体框架,任务只有一个:给模型一首歌、一个硬性美元预算和一套工具,然后不干预,让它自主制作完整的音乐视频。模型自行研究有哪些视频模型存在、生成片段、观看自己的素材、用 ffmpeg 剪辑,并组装出最终成片。
我们上次对决的几位读者表示,想看看模型之间工具使用方式的具体差异,因此我们给前沿模型分配了一个开放式、长周期任务,让每个模型自行决定研究什么、生成什么以及如何剪辑。我们记录了每一次工具调用,这样你就能看到每个模型的具体工作方式(完整日志见下文)。
我们运行了两个模型:Claude Fable 5 和 GPT-5.6 Sol,每个模型在两个预算档位($25 和 $100)下各运行一次,共四次运行。每次运行都使用同一首歌(Bruno Mars 和 Mark Ronson 的《Uptown Funk》)、一段简短文字描述以及一份带时间戳的歌词文本。
设置
每个模型运行一个自主工具调用循环,包含六个工具:
- plan:用于思考的工具(无成本,无操作)。
- web_search:用于研究生成模型及其 API,并获取音乐视频相关信息(如有需要)。
- get_budget:用于检查剩余预算。
- generate_image 和 generate_video:唯一消耗预算的工具。模型可以选择任意 FAL 或 Replicate 模型,并传递自己的参数。
- run_command:本地 shell,提供 ffmpeg/ffprobe,用于分析音频、剪切和拼接片段,以及合成最终视频。
一旦预算归零,付费生成将被拒绝,但模型可以继续剪辑。每次模型消息、工具调用、扣费和错误都被记录下来。整个框架在 github.com/hershalb/music-video-arena 开源,因此你可以自行运行。
四个视频
以下每个片段都是模型最终自主生成的 output.mp4,完整长度并混入了原曲。
- Claude Fable 5 · $25
- GPT-5.6 Sol · $25
- Claude Fable 5 · $100
- GPT-5.6 Sol · $100
数据
所有四次运行均自主完成(未达到步骤或时间限制),并生成了有效的完整长度视频,混入了原曲。
| 模型 | 预算 ↕ | 实际耗时 ↕ | 步骤数 ↕ | 图片数 ↕ | 视频数 ↕ | 失败调用 ↕ | 生成花费 ↕ | 输出分辨率 ↕ | |------|--------|------------|----------|----------|----------|------------|------------|--------------| | Claude Fable 5 | $25 | 39分10秒 | 25 | 0 | 54 | 1 | $24.30 | 1280x720 | | GPT-5.6 Sol | $25 | 42分52秒 | 38 | 61 | 46 | 10 | $23.18 | 1280x720 | | GPT-5.6 Sol | $100 | 49分39秒 | 34 | 0 | 70 | 2 | $36.57 | 1280x720 | | Claude Fable 5 | $100 | 38分56秒 | 28 | 0 | 80 | 0 | $48.60 | 1920x1080 |
“生成花费”是计量的 FAL 成本,即预算上限。在 $25 预算下,两个模型几乎用尽。在 $100 预算下,它们分别花费了 $36.57(Sol)和 $48.60(Fable),因此更多预算确实转化为了更多素材。这不包括运行模型本身的成本,我们将在下方补充。
完成视频的时间
每个模型构建的内容
在自行选择工具的情况下,模型出现了分化。四次运行中有三次完全采用文本到视频方式。只有 GPT-5.6 Sol($25 预算)使用了图像到视频流程(先生成静态图像,再将其动画化)。GPT-5.6 Sol($100 预算)在一次运行中混合使用了三种不同的视频模型。
| 运行 | 图像模型 | 视频模型 | 方法 | |------|----------|----------|------| | Fable 5 · $25 | 无 | Wan 2.5 t2v($0.05/秒) | 仅文本到视频 | | Sol · $25 | FLUX schnell($0.003/张) | Wan 2.2-5b i2v($0.10/秒) | 关键帧,然后图像到视频 | | Sol · $100 | 无 | Wan 2.5($0.05/秒)、Veo 3.1 Lite($0.10/秒)、Hailuo 2.3 Standard($0.28/视频) | 文本到视频,混合模型 | | Fable 5 · $100 | 无 | Seedance 1.0 Pro t2v(~$0.12/秒,1080p) | 仅文本到视频 |
价格为 FAL 列出的费率,除非另有说明,否则按输出视频每秒显示。Hailuo 2.3 Standard 按视频计费(约 $0.28 每 6 秒片段),Seedance 1.0 Pro 按 token 计费(约 $0.62 每 5 秒 1080p 片段,以上显示为其有效每秒费率)。每次运行生成的独立片段数量从 46 到 80 不等。
工具使用情况
每次运行的工具调用次数(包括尝试,含失败的生成调用)。
- Claude Fable 5 · $25
- GPT-5.6 Sol · $25
- Claude Fable 5 · $100
- GPT-5.6 Sol · $100
每次运行的完整日志,包括每次计划、工具调用和命令,可在此查看:
- Fable 5 · $25
- Sol · $25
- Sol · $100
- Fable 5 · $100
过程中的错误
“失败调用”是指返回错误的生成请求(主要是提供商的临时网络故障)。这些请求未被收费,但模型花费了步骤进行重试。
Token 使用量
| 运行 | 输入 tokens | 输出 tokens | 推理 tokens | 缓存输入 tokens | |------|-------------|-------------|-------------|-----------------| | Fable 5 · $25 | 1,476,900 | 44,341 | 不适用 | 0 | | Sol · $25 | 2,956,270 | 33,220 | 9,656 | 2,558,029 | | Sol · $100 | 2,097,572 | 31,715 | 12,330 | 1,819,050 | | Fable 5 · $100 | 2,264,610 | 48,029 | 不适用 | 0 |
每次运行的总成本
预算仅计量生成(FAL)花费。加上 Claude Fable 5(输入 $10 / 输出 $50 每百万 tokens)和 GPT-5.6 Sol(输入 $5 / 输出 $30 每百万 tokens)的 LLM token 成本,得出每次运行的总成本。
| 运行 | 生成花费 | LLM token 成本 | 总成本 | |------|----------|----------------|--------| | Fable 5 · $25 | $24.30 | $16.99 | $41.29 | | Sol · $25 | $23.18 | $4.27 | $27.45 | | Sol · $100 | $36.57 | $3.25 | $39.82 | | Fable 5 · $100 | $48.60 | $25.05 | $73.65 |
对于 Claude Fable 5,仅 token 成本就达到 $16.99 到 $25.05,约占每次运行总成本的 30-40%。GPT-5.6 Sol 的 token 成本在类似 token 量下保持在 $3-4 左右。
方法说明
所有四次运行的输入相同:歌曲、一段简短文字描述以及一份带时间戳的歌词文本。每个模型自行选择 FAL 上的生成模型,并自行进行 ffmpeg 剪辑。实际耗时包括模型自身的重试以及等待提供商队列的时间。生成花费是基于每个模型价格表的最佳估算。
自行尝试
该框架是开源的:github.com/hershalb/music-video-arena。将其指向你自己的歌曲和预算,替换你想要对决的任意模型,看看它们能构建出什么。欢迎提交 Issue 和 PR,我们非常希望收到关于该设置的反馈。
我们的看法
这些音乐视频没有一个是出色的,但观察模型如何达成结果是相当有趣的。