GPT-5.6 Sol
决策快,先搭完整生产管线,再做少量关键修正。
观察到的优势
网格水密、单组件;整体叙事与交付效率突出。
本轮问题
体量偏保守且过重,切片 62.65 分钟,刚刚越过硬门槛。
MULTIMODAL AGENT · TWO TASKS · SINGLE RUN
同图、同 Prompt、Pi 0.82.0、thinking=max:六模型各跑一轮 3D 白模,四模型各跑一轮 30 秒 MG 动画。证据来自运行日志、生成脚本、统一渲染成品、网格/切片检查与视频逐帧统计。
证据边界:每模型仅一轮,下面是“本轮行为倾向”,不是稳定能力、普遍模型性格或底层架构定论。
3D TASK
6 模型
程序化 SDF / 网格提取路线。
MG TASK
4 模型
PIL / NumPy 逐帧与 ffmpeg。
TOP 3D SCORE
53 / 60
Kimi K3,本轮自动评分。
DENSEST MOTION
Kimi
15 fps 抽样近静止帧 13.8%。
PROGRAMMATIC 3D

决策快,先搭完整生产管线,再做少量关键修正。
观察到的优势
网格水密、单组件;整体叙事与交付效率突出。
本轮问题
体量偏保守且过重,切片 62.65 分钟,刚刚越过硬门槛。
工程与质检优先,长时间推导后多轮抽帧、构图和动作修正。
观察到的优势
3D 自动分最高(53/60),水密、单组件,切片 51.29 分钟。
本轮问题
耗时最长,且漏交 README;深度推理没有自动保证交付清单完整。
强规划、强符号化,把视觉特征拆成明确几何元素,并主动修复预览、法线和索引问题。
观察到的优势
造型特征抓取明确,切片 49.54 分钟。
本轮问题
自述水密,但独立检查仍发现 21 条非流形边、47 个退化三角。
反复局部修补,日志记录了字体、遮挡、图标、对比度和并行渲染等问题的修正。
观察到的优势
四项媒体硬规格全部通过,执行闭环完整。
本轮问题
人物抽象偏通用,身份特征弱;网格 2 组件,切片 74.45 分钟。
倾向堆高分辨率、复杂 SDF 与自证文档。
观察到的优势
特征清单完整,脚本组织较工程化。
本轮问题
复杂度失控:48.7 万三角、3157 条非流形边、2822 个退化三角,切片 73.54 分钟;“水密”自述与独立检查冲突。
算法野心大,构建了最长的自制 marching-cubes 管线,并推翻失败首版。
观察到的优势
最终网格水密、单组件。
本轮问题
丢失坐标/打印语义:高度落在 Y 轴、底面稳定性失败,切片 70.46 分钟。
QWEN COUNTEREXAMPLE

本轮更直接的解释在生成脚本里:Qwen 在 build_model.py 中把闭眼弧显式写成裁切后的 torus_y,再用较小的平滑并集接到脸上,因此轮廓天然更硬、边界更清楚。
其他模型也走了“看图 → 文字/代码规划 → SDF 基元 → 网格”的相近路线,只是选择凹刻椭球、球链或更强平滑。图像能支持的有限结论是:Qwen 本轮倾向把视觉特征离散成清晰、可命名、可编程的符号,并偏爱硬边几何基元。
若要验证架构假设,应设计保留连续视觉信息的反事实题:只改变微妙曲率、遮挡和材质,不改变可命名语义,再观察错误是否稳定呈现“文字摘要瓶颈”。
30-SECOND MOTION GRAPHICS

| 模型 | 本轮时间 | 近静止帧 | 证据化解读 |
|---|---|---|---|
| GPT-5.6 Sol | 约 5 分 49 秒 | 22.5% | 导演、剪辑和故事完成度最好,镜头类型多、起承转合完整;有明显纯色转场,因此近静止比例不是最低。 |
| Kimi K3 | 约 36 分 24 秒 | 13.8% | 持续运动最密,角色与剧情衔接稳定;代价是本题运行最慢,并漏交 README。 |
| Qwen 3.8 Max | 单轮记录 | 61.2% | 分镜完整,但更像一组设计良好的关键帧与场景切换,连续动画活动量最低。 |
| Doubao Seed Evolving | 单轮记录 | 27.2% | 动作量不是最低、硬规格也全部完成;短板主要是造型与美术抽象,整体观感最生硬。 |
逐帧变化只是运动密度代理,不等于审美评分。更准确的本轮表述是:GPT 的导演、剪辑和故事完成度最好;Kimi 的连续动画活动量最高;Qwen 最偏关键帧/场景切换;豆包的主要短板是造型与美术质量,不是没有动起来。
WHAT THIS SAMPLE SUPPORTS