1. GPT-5.6 Sol
本批总分第一、上限最高,但两轮低尾说明它仍不是“每轮都稳”的交付机。
10 轮分布与稳定性
1.38 / 61.25 / 97.53 / 83.29 / 98.82 / 89.42 / 96.24 / 71.66 / 17.83 / 82.12。低于 10 分 1 轮,0 分槽位 无;runner 失败 无。
交付效率
平均墙钟 6.26 分钟/任务;10 任务 175 次调用;5.95M token;按官方价格与本批 token 反算,估算 ¥86.500。
scorer / 产物观察
- + scorer 在 10/10 轮确认加载图数据身份完全一致;离线运行、最短路径与统计准确性均有 9/10 轮满分。
- + 有 6 轮超过 80 分,其中 r3、r5、r7 均超过 96 分,证明在成功收口时能覆盖数据、算法、交互与视觉的完整交付链。
- - 节点详情与邻居检查有 5 轮为 0;类型筛选、空间可读性、缩放重置各有 2 轮为 0。
- - r1 与 r9 分别只有 1.38 和 17.83;scorer 记录 2 次图谱空白、2 次关系未渲染,以及 1 次浏览器主线程无响应 cap。
适用推断
适合需要冲击高完成度、可接受逐轮验收与失败重跑的复杂前端工程任务。
风险提示
不能只看 69.95 的均分;低尾会把一次性、无人值守交付的风险显著放大。
失败槽位与证据边界
以上“通过/失败”来自 scorer、slot 状态或具体产物;“适用”属于基于本批表现的有限推断。单次轨迹、自述或界面现象不被升级为模型底层架构事实。