Round 2 · 2026.08Evidence before score

先弄清楚,
我们测了什么。

6 个模型配置,216 次真实执行。先把题目、成功标准、重复次数、失败与未测项说清楚,最后才给场景适配分。

144 Core36 Safe Agent36 Strict6 configs
216
logical executions不是 216 个同类样本
回答质量8 题 × 3 repeats计能力
真实工作流6 tasks × n=1初步证据
协议诊断6 cases × n=1不计分

比较的是 model + effort + route + adapter + tool policy,而不是抽象模型家族。

结论边界:这是当前 AxonHub 配置在 Riv 题集上的端到端证据,不是永久排行榜,也不是通用模型智力测验。
01 · 先看测量说明

这不是一张“谁最聪明”的榜。
它回答六个更具体的问题。

比较单位是完整的模型配置:provider、model、effort / thinking、 AxonHub route、adapter 与工具策略共同决定结果。下面每一项都写清“测到什么”和“没有测到什么”。

01
Closed-book Core

会不会答?

8 题 × 3 次 × 6 配置 = 144 次

不给工具、不给联网,用固定题目测约束理解、推理、证据边界与中文表达。每题等权,三次独立调用后再人工复核。

测到
回答质量、题型差异、重复波动
没测到
不代表联网研究、多轮 Agent 或通用智力
进入 Fit
02
Safe Agent

会不会把工作做完?

6 任务 × 1 次 × 6 配置 = 36 次

把研究、改代码、浏览器故障、表格交付、个人上下文和中断恢复交给完整系统,按真实产物与终态评分。

测到
端到端交付、工具使用、恢复与停手
没测到
每题 n=1,只能算初步证据;测到的是整套配置
进入 Fit
03
Completion & Safety

能不能稳定、安全地完成?

有效响应、完成数、失败类型、范围违规

分别记录 accepted、protocol、transport、max-steps 和 scope violation。失败已在任务 outcome 中归零,不再用一个可靠性 utility 重复扣分。

测到
端到端完成率、失败原因、授权与范围控制
没测到
当前样本不足以给正式置信区间
资格 Gate
04
Latency

要等多久?

Core text TTFA / E2E · p50 与 p90 · 秒

TTFA 近似第一次看见文本答案的等待,E2E 是 Core text run 完整结束时间。Safe Agent 目前只有 E2E p90 汇总,单独展示而不计 Fit。

测到
Core 文本首答、完整耗时与尾延迟
没测到
不是 Agent 交付速度;失败会显得更快,必须和终态一起读
按场景进入 Fit
05
Equivalent Cost

完成这组工作要花多少?

24 Core + 6 Safe Agent · USD

按测试日公开 API token 单价换算同一任务篮子的等价费用,并拆开 Core 与 Agent。

测到
当前任务集的公开价格量级
没测到
不是 AxonHub 现金账单;失败少输出也会显得便宜
按场景进入 Fit
06
Diagnostics

协议和端点是否正常?

36 Strict + TPS proxy + 6 个多模态 smoke

Strict 检查单工具串行协议,TPS 只看 SSE 事件窗口,多模态 smoke 只验证基础端点能否调用。

测到
adapter 兼容、流式事件、端点连通
没测到
不等于 Agent 智力、decoder TPS 或多模态质量
不计分
Core / C01–C08固定题目在问什么
C01JSON 边界C02约束推理C03注入安全C04自然中文C05上下文冲突C06证据推断C07纠错优先级C08金融边界
Safe Agent / A03–A19真实任务在做什么
A03当前资料研究A05代码仓库修复A13浏览器故障A16电子表格A18个人上下文A19中断与授权
02 · 测试条件与覆盖

216 次执行,是三种不同证据。

144 次回答质量、36 次真实 Agent、36 次协议诊断必须分开读。后两者虽然都调用了工具, 但只有 Safe Agent 进入场景评分。

Benchmark cohortRound 2 · 2026.086 model configurations
144Core
能力证据
36Safe Agent
初步证据
36Strict
协议诊断
A

测试对象

不是只换一个 model name,而是固定一套 route、adapter、system / tool policy 后比较完整配置。

因此 transport 与 protocol 失败代表 Riv 实际会遇到的端到端结果。
B

调用规则

Core 每题 3 次独立调用;Safe Agent 每题 1 次、无重试,可并行安全只读工具,写操作仍受范围约束。

Core 有描述性波动,Agent 只有方向性证据。
C

判分与失败

回答按 rubric 与人工 adjudication;Agent 按交付物、终态和 critical rule。失败 outcome 归零一次。

越权写入、虚构完成等 critical 行为直接阻断推荐。
D

当前边界

没有长期稳定性、真实账单、多模态质量或跨 provider 公平性结论,也没有 Agent repeats。

所有 Agent 推荐均标记“初步证据”。
measured Core / Safe Agent / latencypartial Luna cost lower boundproxy event-window TPSsmoke only audio / imagenot tested Grok / Claude Round 2
03 · 回答质量

不只看均值,也看稳定性和题型。

每个配置 8 道 Core 题、3 次独立重复;圆点是三次 repeat,总标记是 adjudicated 均值。

144 / 144一次调用 · 无重试
SD 是描述性波动,不是 CI

Core 三次重复

65–90%
657075808590
Raw → adjudicated21 runs 修正 · +36 自动分 · 移除 1 个 false Critical
每格 = 三次均值

Core 题型热力图

0–100%
配置C01C02C03C04C05C06C07C08
C01JSON 边界C02约束推理C03注入安全C04自然中文C05上下文冲突C06证据推断C07纠错优先级C08金融边界
04 · 实际工作能力

Agent 的差距,藏在任务格子里。

Safe-parallel 允许最多 8 个安全只读调用并行;混合读写、多写和越权组仍然 fail closed。

36 cases每题每配置 n=1
配置A03当前资料研究A05代码仓库修复A13浏览器故障A16电子表格A18个人上下文A19中断与授权总分
A16
只有 Mini 交付 workbook

Mini 得 6/10;其余配置发生 transport、protocol 或 max-steps。n=1,不能外推成永久能力。

!
MiMo 得分不低,但范围失守

A05 留下越界 `.orig/.rej` 文件,所以 recommendation gate 被阻断。

Strict Agent:单工具串行协议诊断综合分权重为 0,不等于 Agent 总能力24 / 36 protocol errors +
Mini50.0%
Luna45.8%
Sol45.0%
MiMo16.7%
GPT-5.516.7%
DeepSeek0.0%
05 · 速度与成本

等待感、尾延迟、吞吐和账面成本,分开看。

TTFA / E2E 来自 Core text runs;Safe Agent 目前只有 E2E p90 汇总。失败会同时让运行更短、token 更少,所以速度与成本必须结合 terminal status 解读。

Core 首个可见答案 · TTFA

p50 → p90 · log 秒
1.5s5s15s50s

Core 文本完整结束 · E2E

p50 → p90 · log 秒
1.5s5s15s70s
只展示 · 不进入 Fit

Safe Agent E2E p90

秒 · 紧邻 terminal-ok 数

这是当前 6 个 Agent cases 的汇总尾延迟,不是只统计 accepted runs 的稳定估计;缺少 p50 与 repeats,因此不映射为等待 utility。

协议事件 proxy

Event-window TPS

p50 / p90

可能含隐藏 reasoning token 或分块缓冲,不是真实 decoder TPS。

24 Core + 6 Agent cases

公开 API 等价成本

log scale · actual cash unknown
Core 24 Safe Agent

Luna 因断线缺少一条 gateway usage,只能给下界。这里不是 AxonHub 实际现金账单。

06 · 结果对照

一个配置,可以同时领先又落后。

表格保留百分比、完成数、秒和美元;色深只帮助扫读,不用一个 0–100 utility 掩盖原始含义。

格内保留原始单位

六项结果对照

色深仅提示方向
配置CoreAgent完成TTFAE2E成本
右上角更均衡

质量 × Agent 能力

气泡大小代表 Safe Agent 分数;斜纹表示成本仅为下界,虚线红圈表示推荐 gate 被阻断。

07 · 最后才看评分

Fit 是场景适配分,不是智力总分。

先过范围与安全 Gate,再把 Core、Safe Agent、等待体验和成本按当前任务加权。只显示整数,Agent 仍标记为初步证据。

Core 与 Safe Agent 各占 45%,Core 文本等待 proxy 与成本各占 5%。完成失败已在 Agent outcome 中计算,不重复加入可靠性。

用于高频研究、文件与代码工作;先过 critical safety gate,再比较 Fit。
01失败只扣一次

Agent outcome 已含终态;不再额外加入“可靠性分”重复惩罚。

02Gate 不能补偿

scope violation 等 critical 行为即使总分很高也不会成为推荐。

03固定业务锚点

Core 文本等待 proxy 和美元按 good / bad 对数锚点映射,不随候选增删漂移。

04诊断不混入

Strict、TPS proxy、smoke 与 coverage 全部不进入 Fit。

Core 45 · Agent 45 · 文本等待 proxy 5 · 成本 5Fit 0–100 · 同整数同档,区间重叠不强排

当前锚点:Core TTFA 220s · Core E2E 560s · 成本 $0.005–$1。左端映射为 100,右端映射为 0,中间按对数插值。Safe Agent E2E p90 因缺少 p50 与 success-conditioned 样本不计 Fit;当前区间只表达缺失成本,不是采样置信区间。

08 · 配置档案与二选一

每个配置都有自己的前沿。

先看一句话定位,再把两个候选放进同一个原始单位比较。

直接比较

把取舍翻译成人话

对比

Mini 相比 Sol: Core 6.07pp,Agent 5.83pp, TTFA 3.19 秒,公开等价成本是对方的 0.17×。

Core78.72%84.79%
Safe Agent82.50%76.67%
TTFA5.67s8.85s
E2E9.51s10.45s
TPS proxy130.16136.95
30-case cost$0.198$1.170
09 · 诊断、初赛与未测项

思考越强,不代表得分越高。

当前公开数据包含 47 个第一轮文本配置。这里统一显示自动分 / 72;每配置每题只有一次,与 Round 2 adjudicated 结果分开。

自动分 / 72

GPT-5.6 Sol

max 才拉开质量;中间档位仍有反转

none51.34
low54.84
medium50.09
high54.34
xhigh53.09
max60.25sweet spot
协议通过4 / 4

MiMo 音频

ASR、TTS、Voice Design、Voice Clone;只证明基础端点可用。

协议通过2 / 2

GPT 图像

GPT Image 1.5 与 2 完成基础 prompt;不是图像质量赛。

上游阻塞

Grok 文本

账户池不可用,未计模型质量 0 分;Round 2 按要求跳过。

认证缺失

Claude CLI

本机未登录,未得到回答;Round 2 按要求跳过。

10 · 方法、边界与下一步

现在能解释;要完全复现,还缺原始运行包。

144Core · 计能力
36Safe Agent · 计能力
36Strict · 只诊断
21runs 经人工修正
2026-08-01价格快照
Fit 怎么算?

先对每个任务的交付 outcome 计分,未完成任务为 0;critical violation 单独触发不可补偿的推荐 Gate,保留任务质量分只用于诊断。Core、Safe Agent 先各自聚合,只有在选定场景后才与等待、成本 utility 加权。可靠性不再重复计分,Strict、TPS proxy、smoke 和 coverage 权重均为 0。

为什么只有整数和区间?

Core 只有 3 次 repeat,Agent 每题每配置只有一次;A16 的一次成败就足以改变次序。小数点后两位远超当前证据精度。Luna 缺一条 usage,所以受成本影响的 Fit 保留区间;区间重叠时显示可能名次范围。

成本与速度口径

TTFA 是到首个可见 answer-text event 的近似等待时间,E2E 是完整结束;两者展示 p50/p90。场景 utility 使用页面公开的固定对数锚点。成本按官方公开 API token 价格换算,不是 AxonHub 实际账单;失败会少用 token,因此原始结果仍需和终态一起读。

目前还不能复现什么?

本页公开的是聚合证据,还没有随站点发布 prompts、fixtures、grader rubric、逐次响应、tool traces、运行 manifest、adapter 版本与 adjudication 账本。因此现在可以核对口径和结果,但不能从零重放全部实验;这应成为下一版本的数据发布目标。

哪些是未测、阻塞或只做 smoke?

Claude 未认证、Grok 上游账户池不可用,均标记未测而非 0 分。MiMo 音频与 GPT 图像只验证基础协议端点,不给质量分;第一轮 effort 每配置每题仅一次,也不与 Round 2 adjudicated 成绩混排。