Opus 5.5 的意外强项:解释型动效视频

Latent Space7 小时前

概览

Opus 5.5 本周发布后,早期反馈整体偏正面。一个值得注意的现象是:除了常规基准测试和模型排名,它在“解释型视频”和“动效设计”场景中引发了大量讨论。

一些用户展示了用 Opus 5.5 生成的短视频:包括 15 秒动态作品集式动效、UI 状态变形动画、产品介绍风格视频,以及带声音设计的 90 秒动效演示。多条示例强调这些视频主要由代码生成,而不是使用 After Effects 等传统动效工具完成。

使用热度

有平台在 Opus 5.5 发布约一周后表示,在其 Anthropic 模型使用中,Opus 5.5 已经成为按消费占比和 token 占比计算的第一名,并且从 Opus 5 切换到 Opus 5.5 的速度很快。

这说明,至少在部分开发者和模型调用平台中,Opus 5.5 的迁移势头较强。

动效视频成为社交热点

围绕 Opus 5.5 的讨论中,最显眼的是动效视频案例:

  • 有用户使用“Max effort”模式,让模型生成一段 15 秒动态 motion graphics 视频,目标是展示“像简历作品集一样”的动效设计能力。
  • 有用户称整段视频由代码生成,“0 After Effects”,并公开了用于复现类似动效的提示词模板。
  • 该模板会先要求用户提供 8 到 12 个希望图形变换成的 UI 状态,例如按钮、加载器、播放器等。
  • 也有用户复盘发现,很多所谓“一句话生成”的高质量视频,背后可能包含更完整的工作流,而不只是单次提示词。
  • 还有用户尝试生成与 Supabase 相关的展示视频,并表示效果不错。
  • 另有案例让 Opus 5.5 生成 90 秒动效与声音工程演示,并称其还生成了钢琴配乐。

这些案例并不能直接证明模型在所有视频生成任务中稳定可靠,但显示出一个趋势:Opus 5.5 在“用代码组织视觉叙事、动效节奏和 UI 转场”方面,正在被大量创作者测试。

基准表现与推理强度

围绕 Opus 5.5 的性能讨论还包括一些基准测试结果:

  • 在 SimpleBench 上,Opus 5.5 被报告达到 88.4%。
  • 在视觉评测中,有评测者称其是 Anthropic 目前最好的视觉模型:优于 Fable 5 和 GPT-6 Sol,但弱于 GPT-6 Astra;同时成本约比 Fable 5.1 低 60%。
  • 在 Terminal-Bench-Science 上,Opus 5.5 的表现会随推理强度变化:低强度约 24%,xhigh 模式约 62%,max 模式反而降至约 59%。
  • 有观点建议避免使用 “max” 模式,因为它会施加最低推理预算,未必总能带来更好结果。

观察

这次讨论的有趣之处在于,Opus 5.5 的亮点并不只来自传统文本推理或代码任务,而是出现在“解释型动效视频”这种跨越代码、视觉设计和叙事节奏的复合场景中。

不过,目前这些案例主要来自用户展示和社交平台反馈,仍需要更系统的评测来判断其稳定性、可控性和生产环境适用性。

评论

请登录后发表观点

暂无数据