返回模型榜单

CURRENT EVIDENCE SNAPSHOT

Web4 模型分析与测试口径

本页只使用同一冻结发布包的 19 个模型、每模型 10 轮成绩。总榜、性价比榜、Round 矩阵与逐模型分析均绑定同一个 releaseId,不混入线上旧阵容或其他批次。

releaseId web4-graph-v2-leaderboard-20260815-v3

价格日期 2026-08-04 · USD/CNY 6.7917

冻结阵容

19 × 10

19 个 model_id、190 个成绩;不含 Hunyuan 与 MiniMax。

总榜第一

GPT-5.6 Sol

均分 69.95,中位数 82.71。

零分槽位

20

0 分包括无入口、runner/score 产物失败与可评分但未得分,逐卡区分。

性价比第一

Grok 4.5

指数 11.02;只代表当前 19 模型的相对排序。

SINGLE SOURCE OF TRUTH

发布包与数据锁

唯一数值基准

`site/src/data/web4-benchmark-current.json`。排名、分数、效率、成本、总榜图片与性价比图片均从这个 19 模型快照生成。

冻结数字

豆包锁定为均分 28.70、179 次调用、¥13.178;总榜、性价比与模型卡共用同一行数据。

排除与人工档位

Hunyuan、MiniMax 因异常刷分风险不进入本发布包;LongCat 按发布规则由 E 调整为 D,页面不伪装成自动阈值结果。

SCORING CONTRACT

100 分工程评分口径

19 个入榜模型,每个模型 10 轮;按均分排序,中位数作为稳定性参照。 按 10 轮平均分排序;S–E 档位通常每 10 分一档,LongCat 2.0 经人工复核调整为 D 档。

加载数据身份

节点、边与端点是否与冻结输入完全一致

12pt

关系渲染

关系线是否真实、完整且可见

14pt

空间可读性

冷启动布局、画布占用和节点分布

11pt

搜索状态转换

搜索、定位与清除是否真正改变状态

9pt

节点详情与邻居

点击节点后的字段与邻接关系是否有证据

11pt

类型筛选

筛选、状态变化与恢复

7pt

缩放、平移与重置

视口操作和重置后的完整恢复

7pt

离线运行

外部请求、运行错误与资源失败

5pt

最短路径正确性

固定用例是否返回真实路径

10pt

统计准确性

顶部、类型与关系统计是否正确

6pt

视觉稳定性

布局是否收敛、最终画面是否稳定

8pt

CURRENT SNAPSHOT

总览、档位与跨批边界

档位模型均分中位数范围0 分轮
SGPT-5.6 Sol69.9582.711.3898.820
SClaude Fable 562.3971.473.7698.880
AGrok 4.658.5763.7017.5099.840
AQwen 3.8 Max58.0851.6136.3685.410
AKimi K354.5562.387.2095.890
AClaude Opus 553.9150.290.0097.902
AGLM-5.352.3256.980.0098.881
BDeepSeek V4 Pro45.0738.0310.8589.070
BDeepSeek V4 Pro 正式版42.6246.0612.5284.090
BGrok 4.541.8741.5014.3599.270
BDeepSeek V4 Flash 正式版41.2530.0312.1280.420
CQwen 3.7 Max37.9726.620.0090.881
CGPT-5.6 Luna36.6246.790.0093.774
CGLM 5.236.4417.5011.2791.080
DStep 3.7 Flash29.1120.800.0089.461
DDoubao Seed Evolving28.7031.420.0080.672
DMiMo 2.5 Pro22.8122.290.0072.402
DLongCat 2.018.4510.250.0052.071
EERNIE 5.12.230.000.008.896
档位解读

当前分布为 S 2 个、A 5 个、B 4 个、C 3 个、D 4 个、E 1 个。档位帮助阅读本快照,不代表通用能力等级;LongCat 的 D 档是已披露的人工调整。

跨批结论

本版不展示旧 Opus 4.8、Qwen Preview、Hy3、MiniMax,也不把其他阵容的历史分数拼成趋势。跨批只可作为背景,当前排名结论只由本 releaseId 支持。

VALUE INDEX

性价比结论与成本口径

性价比指数 = 平均分 ÷ 综合消耗排名;综合消耗排名 = 成本排名×40% + 耗时排名×25% + 调用数排名×20% + 总 token 排名×15%。 成本权重 40%、时间 25%、调用 20%、token 15%;先在当前 19 模型内做升序名次,再用均分除以加权消耗名次。它是相对指数,不是“每元得分”。

VALUE #1

Grok 4.5

11.02

均分 41.87 · 3.28 分钟 · 64 调用 · 1.35M token · 估算 ¥11.893

VALUE #2

Grok 4.6

10.75

均分 58.57 · 5.38 分钟 · 87 调用 · 1.89M token · 估算 ¥15.657

VALUE #3

GPT-5.6 Luna

7.71

均分 36.62 · 5.72 分钟 · 130 调用 · 3.45M token · 估算 ¥5.003

Sol、Fable、Opus、Grok、Luna 的成本为官方定价下按本批 token 结构反算;其余为日志与官方单价核算口径。指数会随参评阵容、价格和权重变化,不能脱离版本号引用。

19 MODEL EVIDENCE CARDS

逐模型详细分析

每张卡把可观察事实与适用推断分开:分数、slot、checker、gate、cap 与产物是证据;“适合什么”是只针对这 10 轮任务的有限判断。

S

1. GPT-5.6 Sol

本批总分第一、上限最高,但两轮低尾说明它仍不是“每轮都稳”的交付机。

均值 69.95中位 82.71区间 1.3898.82性价比 6.69

10 轮分布与稳定性

1.38 / 61.25 / 97.53 / 83.29 / 98.82 / 89.42 / 96.24 / 71.66 / 17.83 / 82.12。低于 10 分 1 轮,0 分槽位;runner 失败

交付效率

平均墙钟 6.26 分钟/任务;10 任务 175 次调用;5.95M token;按官方价格与本批 token 反算,估算 ¥86.500

scorer / 产物观察

  • scorer 在 10/10 轮确认加载图数据身份完全一致;离线运行、最短路径与统计准确性均有 9/10 轮满分。
  • 有 6 轮超过 80 分,其中 r3、r5、r7 均超过 96 分,证明在成功收口时能覆盖数据、算法、交互与视觉的完整交付链。
  • 节点详情与邻居检查有 5 轮为 0;类型筛选、空间可读性、缩放重置各有 2 轮为 0。
  • r1 与 r9 分别只有 1.38 和 17.83;scorer 记录 2 次图谱空白、2 次关系未渲染,以及 1 次浏览器主线程无响应 cap。

适用推断

适合需要冲击高完成度、可接受逐轮验收与失败重跑的复杂前端工程任务。

风险提示

不能只看 69.95 的均分;低尾会把一次性、无人值守交付的风险显著放大。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

S

2. Claude Fable 5

头部得分能力强,但筛选、详情与画布落地的跨轮稳定性仍明显波动。

均值 62.39中位 71.47区间 3.7698.88性价比 4.47

10 轮分布与稳定性

17.68 / 17.50 / 87.36 / 98.88 / 70.82 / 3.76 / 97.95 / 67.54 / 72.11 / 90.29。低于 10 分 1 轮,0 分槽位;runner 失败

交付效率

平均墙钟 8.58 分钟/任务;10 任务 207 次调用;8.36M token;按官方价格与本批 token 反算,估算 ¥188.164

scorer / 产物观察

  • 加载数据身份与统计准确性各有 9/10 轮满分,搜索状态 8/10 轮满分,最短路径 8/10 轮满分。
  • r3、r4、r7、r10 均超过 87 分,成功轮通常能把数据和主要交互一并交付。
  • 类型筛选有 6 轮为 0,节点详情有 5 轮为 0;scorer 还记录 3 次图谱空白、3 次关系未渲染和 2 次视觉不稳定。
  • r1、r2、r6 均低于 18 分,均值 62.39 明显高于这些低尾,部署前仍需逐项回归。

适用推断

适合重视数据正确性和搜索/路径主流程,同时有自动化回归兜底的工程团队。

风险提示

高分轮不能代表筛选与节点详情必然可用;这两个交互是本批最频繁的失分源。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

A

3. Grok 4.6

Grok 4.6 进入 A 档前三,成功轮上限很高,但低分轮仍然明显,不能把均分当作无人工复核的稳定交付保证。

均值 58.57中位 63.70区间 17.5099.84性价比 10.75

10 轮分布与稳定性

18.48 / 99.84 / 99.28 / 17.50 / 98.01 / 19.99 / 87.72 / 74.03 / 53.36 / 17.50。低于 10 分 0 轮,0 分槽位;runner 失败

交付效率

平均墙钟 5.38 分钟/任务;10 任务 87 次调用;1.89M token;按官方价格与本批 token 反算,估算 ¥15.657

scorer / 产物观察

  • r2、r3、r5、r7、r8 均超过 74 分,其中 r2、r3、r5 超过 98 分,成功收口时覆盖度很强。
  • 10 轮全部有 score 产物,平均耗时 5.38 分钟、87 次调用,资源消耗低于多数 A 档模型。
  • r1、r4、r6、r10 低于 20 分,均分 58.57 与中位数 63.70 之间仍有明显低尾风险。
  • 低分轮说明节点交互、画布和最终收口仍会跨轮失守;正式发布前应保留逐轮截图验收。

适用推断

适合追求较高完成度、同时能接受自动化 scorer 与人工抽检的复杂前端工程任务。

风险提示

高分上限不能替代稳定性验证;无人值守一次性交付仍需为低尾轮次准备重跑策略。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

A

4. Qwen 3.8 Max

正式版在本批表现最均衡:没有 0 分轮,核心数据与算法检查全轮通过,但视觉稳定性仍是主要短板。

均值 58.08中位 51.61区间 36.3685.41性价比 4.65

10 轮分布与稳定性

71.73 / 36.36 / 38.42 / 45.13 / 36.52 / 42.75 / 85.41 / 58.08 / 80.99 / 85.40。低于 10 分 0 轮,0 分槽位;runner 失败

交付效率

平均墙钟 13.27 分钟/任务;10 任务 180 次调用;6.91M token;按调用日志与官方单价核算,实付口径 ¥38.218

scorer / 产物观察

  • 数据身份、离线运行、最短路径、统计准确性均为 10/10 轮满分,节点详情 9/10 轮满分。
  • 10 轮均在 36.36–85.41 之间,4 轮 task_success,低尾显著少于同档高波动模型。
  • visual_instability cap 出现 8 次,incomplete_node_render 出现 4 次;类型筛选和缩放平移各有 3 轮未通过 gate。
  • 均值 58.08、耗时 13.27 分钟,说明完整性较好,但视觉收敛与交付速度并不占优。

适用推断

适合把数据、路径、统计和节点详情正确性放在首位,并愿意单独打磨布局动画的任务。

风险提示

“核心检查全过”不等于最终视觉稳定;应保留截图回归和动画收敛检查。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

A

5. Kimi K3

能做出接近满分的完整交付,但 7.20–95.89 的跨度暴露出很强的轮次波动。

均值 54.55中位 62.38区间 7.2095.89性价比 3.67

10 轮分布与稳定性

54.06 / 89.90 / 31.85 / 95.89 / 78.58 / 14.35 / 7.20 / 85.38 / 70.69 / 17.63。低于 10 分 1 轮,0 分槽位;runner 失败

交付效率

平均墙钟 15.17 分钟/任务;10 任务 248 次调用;7.05M token;按调用日志与官方单价核算,实付口径 ¥42.737

scorer / 产物观察

  • 数据身份、离线运行、统计准确性均为 10/10 轮满分,最短路径 9/10 轮满分。
  • r2、r4、r8 分别达到 89.90、95.89、85.38,成功轮的综合覆盖非常强。
  • 节点详情、类型筛选各有 4 轮为 0,搜索、空间可读性、缩放重置各有 3 轮为 0。
  • scorer 记录 3 次图谱空白、3 次关系未渲染与 4 次视觉不稳定;r6、r7、r10 均低于 18 分。

适用推断

适合可多轮择优、重视核心数据与算法正确性的复杂原型或工程实现。

风险提示

中位数 62.38 高于均值 54.55,但最低仅 7.20;一次性交付前必须验收完整交互。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

A

6. Claude Opus 5

成功轮上限很高,但两轮无入口得 0 分,且本批资源消耗最高,形成明显的稳定性与成本双重风险。

均值 53.91中位 50.29区间 0.0097.90性价比 2.84

10 轮分布与稳定性

69.71 / 0.00 / 47.76 / 0.00 / 97.90 / 51.68 / 48.89 / 78.58 / 46.67 / 97.89。低于 10 分 2 轮,0 分槽位 r2、r4;runner 失败

交付效率

平均墙钟 16.80 分钟/任务;10 任务 478 次调用;37.32M token;按官方价格与本批 token 反算,估算 ¥273.123

scorer / 产物观察

  • 在 8 个有可评分入口的轮次中,数据身份、离线运行、最短路径和统计准确性全部满分。
  • r5、r10 接近 98 分,r1、r8 也达到 69.71、78.58,说明成功产物具备高完成度。
  • r2、r4 因 no_html_entrypoint 得 0 分;节点详情检查在 6 轮为 0。
  • 10 任务共 478 次调用、约 3732 万 token、估算 ¥273.123,均为本批最高一档。

适用推断

适合质量上限优先、允许人工把关与重跑、且预算充足的高价值任务。

风险提示

不能用两轮接近满分掩盖无入口失败;高调用与 token 也会放大重跑成本。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

A

7. GLM-5.3

GLM-5.3 以 52.32 分进入 A 档,核心正确性有高分轮支撑,但 Coding Plan 接入下的交互稳定性仍然波动。

均值 52.32中位 56.98区间 0.0098.88性价比 3.52

10 轮分布与稳定性

98.88 / 67.70 / 0.00 / 61.78 / 36.36 / 29.58 / 94.09 / 11.22 / 52.18 / 71.39。低于 10 分 1 轮,0 分槽位 r3;runner 失败

交付效率

平均墙钟 12.69 分钟/任务;10 任务 287 次调用;12.19M token;按官方价格与本批 token 反算,估算 ¥38.191

scorer / 产物观察

  • r1、r2、r4、r7、r9、r10 均超过 52 分,最高 98.88,成功轮能完成较完整的图谱工程交付。
  • 10 轮均完成 runner,平均耗时 12.69 分钟;数据与算法正确性在高分轮中有明确产物证据。
  • r3 得 0 分,r6 为 29.58、r8 为 11.22;中位数 56.98 不能掩盖交互与画布低尾。
  • 类型筛选、节点详情和视觉收敛仍需逐轮回归;Coding Plan 没有可直接核验的按量 API 成本。

适用推断

适合已有 GLM Coding Plan、能保留 scorer 验收并允许人工复核交互细节的工程任务。

风险提示

本榜成本为 GLM-5.2 token 价格代理估算,不是 Coding Plan 的实付账单,性价比结论需按套餐周期复核。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

B

8. DeepSeek V4 Pro

成本低且没有 0 分轮,但类型筛选几乎系统性失守,适合“核心正确、交互补做”的用法。

均值 45.07中位 38.03区间 10.8589.07性价比 4.40

10 轮分布与稳定性

66.56 / 45.12 / 16.45 / 89.07 / 27.40 / 30.28 / 10.85 / 81.27 / 52.74 / 30.94。低于 10 分 0 轮,0 分槽位;runner 失败

交付效率

平均墙钟 7.65 分钟/任务;10 任务 262 次调用;16.59M token;按调用日志与官方单价核算,实付口径 ¥3.749

scorer / 产物观察

  • 数据身份与离线运行 10/10 轮满分,统计和最短路径各 9/10 轮满分。
  • 最低 10.85、最高 89.07,10 轮均产生可评分结果;实付成本仅 ¥3.749。
  • 类型筛选有 9 轮为 0,节点详情有 4 轮为 0;视觉不稳定 cap 出现 5 次。
  • 图谱空白与关系未渲染各出现 2 次,缩放与重置 gate 也分别多次失败。

适用推断

适合预算敏感、数据与算法正确性优先、后续有人补齐交互的工程任务。

风险提示

若验收标准包含可用筛选、节点详情和稳定画布,必须安排二次实现或严格回归。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

B

9. DeepSeek V4 Pro 正式版

DeepSeek V4 Pro 正式版位于 B 档中段,10 轮全部完成且没有 0 分,但高低轮差距仍然较大。

均值 42.62中位 46.06区间 12.5284.09性价比 7.41

10 轮分布与稳定性

48.35 / 12.52 / 14.35 / 79.77 / 51.29 / 84.09 / 15.59 / 57.39 / 43.77 / 19.10。低于 10 分 0 轮,0 分槽位;runner 失败

交付效率

平均墙钟 7.93 分钟/任务;10 任务 178 次调用;5.45M token;按官方价格与本批 token 反算,估算 ¥2.371

scorer / 产物观察

  • r4、r5、r6、r8 达到 51.29–84.09,说明成功收口时可以完成数据、交互和视觉链路。
  • 178 次调用、平均 7.93 分钟,按 DeepSeek 正式价审计约 ¥2.371,资源消耗处于低位。
  • r2、r3、r7、r10 低于 20 分;中位数 46.06 仅略高于均分,稳定性仍需关注。
  • 低分轮主要暴露最终交互收口和视觉细节的不确定性,不能只依据无 0 分判断稳定。

适用推断

适合成本敏感、允许 scorer 验收和必要重跑的图谱工程试跑。

风险提示

该正式版与旧榜同属 DeepSeek Pro 系列,发布时必须使用完整版本名,避免混淆两次快照。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

B

10. Grok 4.5

本批综合性价比第一:速度、调用与 token 都很省,但布局和画布失败让质量上限不稳定。

均值 41.87中位 41.50区间 14.3599.27性价比 11.02

10 轮分布与稳定性

29.78 / 52.01 / 52.11 / 52.95 / 14.35 / 99.27 / 17.52 / 17.68 / 51.93 / 31.07。低于 10 分 0 轮,0 分槽位;runner 失败

交付效率

平均墙钟 3.28 分钟/任务;10 任务 64 次调用;1.35M token;按官方价格与本批 token 反算,估算 ¥11.893

scorer / 产物观察

  • 数据身份、离线运行、最短路径和统计准确性全部 10/10 轮满分,视觉稳定检查 9/10 轮满分。
  • 平均仅 3.28 分钟、64 次调用、约 135 万 token;r6 达到 99.27,证明低消耗下也能产出完整高分轮。
  • layout_hairball_collapse 出现 6 次、layout_edge_stacking 4 次;另有 3 次图谱空白和 3 次关系未渲染。
  • 节点详情、类型筛选各有 4 轮为 0,空间可读性与缩放重置各有 3 轮为 0。

适用推断

适合快速迭代、成本敏感、能接受对布局与交互进行专项验收的任务。

风险提示

性价比指数是按本批排序计算,不代表任意价格或任意任务下都占优。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

B

11. DeepSeek V4 Flash 正式版

API 成本最低且有多轮高分,但数据身份与视觉稳定性不像 Pro 版那样持续可靠。

均值 41.25中位 30.03区间 12.1280.42性价比 5.69

10 轮分布与稳定性

12.12 / 80.42 / 28.75 / 20.63 / 60.34 / 17.76 / 31.30 / 17.63 / 69.18 / 74.33。低于 10 分 0 轮,0 分槽位;runner 失败

交付效率

平均墙钟 6.94 分钟/任务;10 任务 245 次调用;9.98M token;按调用日志与官方单价核算,实付口径 ¥1.056

scorer / 产物观察

  • 最短路径 9/10 轮满分,统计 8/10、搜索 8/10 轮满分;r2、r5、r9、r10 均超过 60 分。
  • 10 任务实付 ¥1.056,为本批最低成本,平均耗时 6.94 分钟。
  • visual_instability cap 出现 7 次,节点详情有 5 轮为 0;数据身份也有 2 轮完全失败。
  • 图谱空白和关系未渲染各 2 次,类型筛选与缩放平移多轮未通过。

适用推断

适合低预算批量探索、允许挑选结果并做数据一致性复核的任务。

风险提示

极低价格不能替代身份校验;出现 loaded_graph_identity_mismatch 时产物不应直接进入发布链。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

C

12. Qwen 3.7 Max

能产生 90.88 的高分轮,但视觉不稳定与筛选失败频繁,且末轮无入口归零。

均值 37.97中位 26.62区间 0.0090.88性价比 3.55

10 轮分布与稳定性

19.83 / 56.38 / 27.71 / 44.61 / 90.88 / 73.89 / 15.35 / 25.52 / 25.48 / 0.00。低于 10 分 1 轮,0 分槽位 r10;runner 失败

交付效率

平均墙钟 6.85 分钟/任务;10 任务 215 次调用;10.75M token;按调用日志与官方单价核算,实付口径 ¥20.700

scorer / 产物观察

  • 在 9 个可评分轮次中,数据身份、离线运行、统计准确性全部满分;关系渲染 8 轮满分。
  • r5、r6 达到 90.88、73.89,说明其能力上限仍可覆盖较完整的图谱实现。
  • r10 因 no_html_entrypoint 得 0 分;visual_instability cap 出现 8 次,类型筛选有 6 轮为 0。
  • 缩放、重置和视觉稳定 gate 各有 5 轮未通过,均值被高分轮明显抬高。

适用推断

适合已有回归脚本、愿意多轮择优并重点修正视觉与筛选的任务。

风险提示

中位数仅 26.62;不能把少数高分轮外推为稳定工程交付。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

C

13. GPT-5.6 Luna

非零轮速度快、价格低,但连续 4 轮无 HTML 入口,稳定性不足以支持无人值守交付。

均值 36.62中位 46.79区间 0.0093.77性价比 7.71

10 轮分布与稳定性

64.10 / 59.42 / 44.33 / 55.31 / 0.00 / 0.00 / 0.00 / 0.00 / 49.25 / 93.77。低于 10 分 4 轮,0 分槽位 r5、r6、r7、r8;runner 失败

交付效率

平均墙钟 5.72 分钟/任务;10 任务 130 次调用;3.45M token;按官方价格与本批 token 反算,估算 ¥5.003

scorer / 产物观察

  • 6 个可评分轮次中有 5 轮超过 44 分,r10 达到 93.77;平均耗时 5.72 分钟、估算成本 ¥5.003。
  • 非零轮显示它能完成主要数据与交互链路,且资源消耗显著低于 Sol。
  • r5–r8 连续 4 轮触发 no_html_entrypoint 并得 0 分,10 轮 task_success 为 0。
  • 在可评分轮中,节点详情仍有 4 轮为 0,搜索状态也有 2 轮为 0。

适用推断

适合低成本试跑、有人检查入口产物并允许重试的探索性任务。

风险提示

性价比排名第二建立在低消耗之上,不会消除 40% 轮次无入口的交付风险。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

C

14. GLM 5.2

核心数据和算法很稳,但交互与画布频繁失守,使均值远高于中位数。

均值 36.44中位 17.50区间 11.2791.08性价比 2.90

10 轮分布与稳定性

15.51 / 91.08 / 17.50 / 34.60 / 82.25 / 63.98 / 14.23 / 11.27 / 17.50 / 16.45。低于 10 分 0 轮,0 分槽位;runner 失败

交付效率

平均墙钟 11.24 分钟/任务;10 任务 230 次调用;9.46M token;按调用日志与官方单价核算,实付口径 ¥33.126

scorer / 产物观察

  • 数据身份、离线运行、最短路径、统计准确性均为 10/10 轮满分。
  • r2、r5、r6 分别达到 91.08、82.25、63.98,证明核心正确性可以转化为高分成品。
  • 类型筛选有 8 轮为 0、节点详情 6 轮为 0;图谱空白与关系未渲染各出现 4 次。
  • 中位数 17.50,空间可读性和缩放重置各有 4 轮为 0,典型低尾来自交互与画布。

适用推断

适合数据处理和算法正确性优先、UI 交互可由后续工程阶段接手的任务。

风险提示

不能用 36.44 均分概括典型体验;本批更具代表性的中位轮只有 17.50。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

D

15. Step 3.7 Flash

偶有高分,但数据身份、离线性和核心交互都出现重复失败,整体更适合受控试验。

均值 29.11中位 20.80区间 0.0089.46性价比 2.93

10 轮分布与稳定性

50.47 / 23.29 / 0.00 / 7.21 / 6.09 / 4.11 / 38.87 / 18.31 / 53.32 / 89.46。低于 10 分 4 轮,0 分槽位 r3;runner 失败

交付效率

平均墙钟 5.42 分钟/任务;10 任务 289 次调用;13.98M token;按调用日志与官方单价核算,实付口径 ¥6.875

scorer / 产物观察

  • r9、r10 分别达到 53.32、89.46,视觉稳定检查有 7 轮满分。
  • 平均耗时 5.42 分钟、实付 ¥6.875,资源消耗处于中低位。
  • r3 得 0 分;类型筛选和缩放平移各有 8 轮未通过,节点详情 7 轮未通过。
  • 数据身份有 3 轮完全失败,并记录 2 次 external_network_dependency,违反离线交付要求。

适用推断

适合快速原型和受控环境试验,不适合作为无需复核的离线成品生成器。

风险提示

数据身份或离线性 gate 失败属于硬风险,即使视觉看起来完成也不能直接发布。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

D

16. Doubao Seed Evolving

速度和调用量尚可,但两轮归零与视觉波动拉低了可预测性。

均值 28.70中位 31.42区间 0.0080.67性价比 4.19

10 轮分布与稳定性

32.54 / 4.55 / 46.76 / 80.67 / 19.25 / 36.94 / 30.30 / 0.00 / 35.94 / 0.00。低于 10 分 3 轮,0 分槽位 r8、r10;runner 失败

交付效率

平均墙钟 5.44 分钟/任务;10 任务 179 次调用;4.54M token;按调用日志与官方单价核算,实付口径 ¥13.178

scorer / 产物观察

  • 冻结口径下均分 28.70、179 次调用、实付 ¥13.178;最高一轮达到 80.67。
  • 在 8 个有 score 产物的轮次中,离线运行全部满分;数据身份、最短路径和统计准确性各有 7 轮满分。
  • r8 缺少 score.json 按 0 分计,r10 无 HTML 入口得 0 分;visual_instability cap 出现 5 次。
  • 缩放平移 gate 有 5 轮未通过,节点详情和类型筛选各有 3 轮为 0。

适用推断

适合对成本和速度有要求、且能保留 scorer 与入口完整性检查的迭代任务。

风险提示

发布时必须保持 28.70、179 次调用与 ¥13.178 三项冻结数字一致,不得混用其他记录。

失败槽位与证据边界

缺少 score.json:r8,按发布口径记 0 分。

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

D

17. MiMo 2.5 Pro

资源消耗不高,但两轮缺少 score 产物,筛选、画布与视觉稳定性也反复失分。

均值 22.81中位 22.29区间 0.0072.40性价比 3.43

10 轮分布与稳定性

35.74 / 9.01 / 14.35 / 30.22 / 72.40 / 0.00 / 32.18 / 2.73 / 0.00 / 31.50。低于 10 分 4 轮,0 分槽位 r6、r9;runner 失败

交付效率

平均墙钟 4.62 分钟/任务;10 任务 206 次调用;10.31M token;按调用日志与官方单价核算,实付口径 ¥6.011

scorer / 产物观察

  • 在 8 个有 score 产物的轮次里,数据身份有 7 轮满分;r5 达到 72.40。
  • 平均耗时 4.62 分钟、实付 ¥6.011,成本和速度都处于较低区间。
  • r6、r9 缺少 score.json,按失败槽位 0 分计;类型筛选有 7 轮为 0。
  • 图谱空白、关系未渲染各 3 次,视觉不稳定 cap 5 次,节点详情也有 4 轮为 0。

适用推断

适合低成本原型与人工择优,不适合依赖完整评分产物的无人值守流水线。

风险提示

缺失 score 产物本身就是可审计性缺口;不能把缺失轮当成普通低分轮淡化。

失败槽位与证据边界

缺少 score.json:r6、r9,按发布口径记 0 分。

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

D

18. LongCat 2.0

部分轮次能完成路径和统计,但数据身份不一致与画布失败过于频繁;本发布包按人工规则列入 D 档。

均值 18.45中位 10.25区间 0.0052.07性价比 2.17

10 轮分布与稳定性

10.13 / 10.37 / 9.01 / 9.28 / 19.99 / 0.00 / 52.07 / 7.64 / 16.91 / 49.14。低于 10 分 4 轮,0 分槽位 r6;runner 失败

交付效率

平均墙钟 7.60 分钟/任务;10 任务 226 次调用;12.57M token;按调用日志与官方单价核算,实付口径 ¥3.255

scorer / 产物观察

  • 离线运行 7 轮满分,最短路径 7 轮满分;r7、r10 分别达到 52.07、49.14。
  • 实付 ¥3.255,API 成本较低。
  • 数据身份有 5 轮完全失败,图谱空白与关系未渲染各出现 4 次;缩放平移 9 轮未通过。
  • r6 得 0 分,中位数仅 10.25;incomplete_node_render 与 visual_instability 各出现 4–5 次。

适用推断

仅适合低成本探索和人工检查充分的非关键任务。

风险提示

D 档是本发布包的人工调整,不是由平均分阈值自动推导;数据身份失败时不得复用产物。

失败槽位与证据边界

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

E

19. ERNIE 5.1

本批运行与交付链路均未达到可用门槛,5 个 runner 失败槽位和 6 个 0 分轮是主要事实。

均值 2.23中位 0.00区间 0.008.89性价比 0.19

10 轮分布与稳定性

0.00 / 0.00 / 0.00 / 4.55 / 0.00 / 6.09 / 2.73 / 8.89 / 0.00 / 0.00。低于 10 分 10 轮,0 分槽位 r1、r2、r3、r5、r9、r10;runner 失败 r1、r2、r3、r5、r10

交付效率

平均墙钟 11.40 分钟/任务;10 任务 107 次调用;7.00M token;按调用日志与官方单价核算,实付口径 ¥45.560

scorer / 产物观察

  • r4、r6、r7、r8 产生了可评分结果,最高为 8.89;这些轮次至少留下了部分产物证据。
  • 107 次调用不高,但低调用并未转化为有效交付。
  • r1、r2、r3、r5、r10 runner state=failed 且缺少 score 产物;r9 也为 0 分,共 6 个 0 分轮。
  • 4 个可评分轮次的关系渲染、空间可读性、搜索、详情、筛选、缩放与统计均为 0;另有 3 次外部网络依赖。

适用推断

不建议用于当前离线 Web4 图谱任务的正式交付。

风险提示

这里反映的是本批接入与产物结果,不能据此断言模型在其他工具链或任务上也必然失败。

失败槽位与证据边界

缺少 score.json:r1、r2、r3、r5、r10,按发布口径记 0 分。

以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。

LIMITATIONS

证据等级与局限

证据等级
  • 1. 产物与 scorer:最高,直接描述页面、数据、交互与评分结果。
  • 2. 运行日志与 slot:描述过程、耗时、调用、token、失败状态。
  • 3. 模型自述:仅能说明它声称做过什么,不能替代产物验证。
  • 4. 推断:必须标为推断,不能升级成底层架构事实。
样本边界
  • 同一 Web4 图谱工程任务、每模型 10 轮,不能覆盖所有编程任务。
  • runner、模型接入、工具链和 scorer 版本都会影响结果。
  • 均值与中位数不能替代逐轮失败审计,尤其是无入口和缺 score 产物。
  • 价格、汇率与厂商计费政策变化后应重新核算。

本页明确不从一次轨迹、模型意图或自述推断模型是否采用特定内部模块;多模态页中的 Qwen“硬眉毛”案例也遵守同一边界。

返回总榜与 Round 矩阵

查看相同 releaseId 的总榜、性价比榜与 190 个成绩。

多模态两题运行倾向

查看 3D 六模型与 MG 四模型的单轮证据分析。