返回模型测试

MULTIMODAL AGENT · TWO TASKS · SINGLE RUN

多模态模型两题运行倾向

同图、同 Prompt、Pi 0.82.0、thinking=max:六模型各跑一轮 3D 白模,四模型各跑一轮 30 秒 MG 动画。证据来自运行日志、生成脚本、统一渲染成品、网格/切片检查与视频逐帧统计。

证据边界:每模型仅一轮,下面是“本轮行为倾向”,不是稳定能力、普遍模型性格或底层架构定论。

3D TASK

6 模型

程序化 SDF / 网格提取路线。

MG TASK

4 模型

PIL / NumPy 逐帧与 ffmpeg。

TOP 3D SCORE

53 / 60

Kimi K3,本轮自动评分。

DENSEST MOTION

Kimi

15 fps 抽样近静止帧 13.8%。

PROGRAMMATIC 3D

六模型 3D 白模:同题不同取舍

GPT-5.6 Sol、Kimi K3、Qwen 3.8 Max、Doubao Seed Evolving、Claude Fable 5 与 Grok 4.5 的统一 3D 白模四视图对比
六模型统一四视图。图像用于观察造型与几何呈现;水密、组件数、非流形边和切片时间来自独立检查,不从画面主观猜测。

GPT-5.6 Sol

决策快,先搭完整生产管线,再做少量关键修正。

观察到的优势

网格水密、单组件;整体叙事与交付效率突出。

本轮问题

体量偏保守且过重,切片 62.65 分钟,刚刚越过硬门槛。

Kimi K3

工程与质检优先,长时间推导后多轮抽帧、构图和动作修正。

观察到的优势

3D 自动分最高(53/60),水密、单组件,切片 51.29 分钟。

本轮问题

耗时最长,且漏交 README;深度推理没有自动保证交付清单完整。

Qwen 3.8 Max

强规划、强符号化,把视觉特征拆成明确几何元素,并主动修复预览、法线和索引问题。

观察到的优势

造型特征抓取明确,切片 49.54 分钟。

本轮问题

自述水密,但独立检查仍发现 21 条非流形边、47 个退化三角。

Doubao Seed Evolving

反复局部修补,日志记录了字体、遮挡、图标、对比度和并行渲染等问题的修正。

观察到的优势

四项媒体硬规格全部通过,执行闭环完整。

本轮问题

人物抽象偏通用,身份特征弱;网格 2 组件,切片 74.45 分钟。

Claude Fable 5

倾向堆高分辨率、复杂 SDF 与自证文档。

观察到的优势

特征清单完整,脚本组织较工程化。

本轮问题

复杂度失控:48.7 万三角、3157 条非流形边、2822 个退化三角,切片 73.54 分钟;“水密”自述与独立检查冲突。

Grok 4.5

算法野心大,构建了最长的自制 marching-cubes 管线,并推翻失败首版。

观察到的优势

最终网格水密、单组件。

本轮问题

丢失坐标/打印语义:高度落在 Y 轴、底面稳定性失败,切片 70.46 分钟。

QWEN COUNTEREXAMPLE

“硬眉毛”不能证明 VL / LLM 分离

Qwen 3.8 Max 正式版在上、Preview 在下的 3D 白模四视图对比
正式版在上、Preview 在下。严格旧题 A/B:3D 为 48/60 对 55/60;单轮不能宣称正式版已全面提升。

本轮更直接的解释在生成脚本里:Qwen 在 build_model.py 中把闭眼弧显式写成裁切后的 torus_y,再用较小的平滑并集接到脸上,因此轮廓天然更硬、边界更清楚。

其他模型也走了“看图 → 文字/代码规划 → SDF 基元 → 网格”的相近路线,只是选择凹刻椭球、球链或更强平滑。图像能支持的有限结论是:Qwen 本轮倾向把视觉特征离散成清晰、可命名、可编程的符号,并偏爱硬边几何基元。

不能由此证明:服务端一定是“小视觉模型先描述,再喂文本模型”;也不能区分独立 VL/LLM、视觉编码器接入统一主干或其他实现。

若要验证架构假设,应设计保留连续视觉信息的反事实题:只改变微妙曲率、遮挡和材质,不改变可命名语义,再观察错误是否稳定呈现“文字摘要瓶颈”。

30-SECOND MOTION GRAPHICS

四模型 MG:故事完成度与运动密度要分开

GPT-5.6 Sol、Kimi K3、Qwen 3.8 Max 与 Doubao Seed Evolving 的 30 秒 MG 动画精选代表帧
四模型动画代表帧。静态拼图用于展示造型、构图和场景;持续运动判断来自视频逐帧变化统计。
模型本轮时间近静止帧证据化解读
GPT-5.6 Sol约 5 分 49 秒22.5%导演、剪辑和故事完成度最好,镜头类型多、起承转合完整;有明显纯色转场,因此近静止比例不是最低。
Kimi K3约 36 分 24 秒13.8%持续运动最密,角色与剧情衔接稳定;代价是本题运行最慢,并漏交 README。
Qwen 3.8 Max单轮记录61.2%分镜完整,但更像一组设计良好的关键帧与场景切换,连续动画活动量最低。
Doubao Seed Evolving单轮记录27.2%动作量不是最低、硬规格也全部完成;短板主要是造型与美术抽象,整体观感最生硬。

逐帧变化只是运动密度代理,不等于审美评分。更准确的本轮表述是:GPT 的导演、剪辑和故事完成度最好;Kimi 的连续动画活动量最高;Qwen 最偏关键帧/场景切换;豆包的主要短板是造型与美术质量,不是没有动起来。

WHAT THIS SAMPLE SUPPORTS

可以得到什么,不能得到什么

本轮材料支持

  1. 1. 两题主要测多模态 Agent 的程序化生产能力,不是原生 3D/视频生成能力;环境与题面强烈塑造了解法。
  2. 2. “会自检”与“自检有效”必须分开;Qwen、Fable 的自述与独立拓扑检查出现冲突。
  3. 3. 能力至少分为整体叙事/效率、持续动画、几何工程、显式规划/符号化、局部修补等轴。
  4. 4. Qwen 正式版暂不能宣称较 Preview 提升:旧题 3D 48/60 对 55/60,宣传片 SSIM 0.7781 对 0.7886,均为 Preview 略高。

下一轮应补

  1. 1. 每模型至少 3 次,区分偶然代码策略与稳定行为。
  2. 2. 增加人工盲评,避免自动指标替代相似度与审美判断。
  3. 3. 3D 将人物相似度、几何合法性、打印成本拆开。
  4. 4. 视频将故事完整度、持续运动、角色一致性、转场节奏拆开。
一次轨迹只能写成“本轮观察”。模型自述是待验证材料,不是事实;从行为反推内部架构则是更低证据等级的假设。