会不会答?
不给工具、不给联网,用固定题目测约束理解、推理、证据边界与中文表达。每题等权,三次独立调用后再人工复核。
- 测到
- 回答质量、题型差异、重复波动
- 没测到
- 不代表联网研究、多轮 Agent 或通用智力
6 个模型配置,216 次真实执行。先把题目、成功标准、重复次数、失败与未测项说清楚,最后才给场景适配分。
比较的是 model + effort + route + adapter + tool policy,而不是抽象模型家族。
比较单位是完整的模型配置:provider、model、effort / thinking、 AxonHub route、adapter 与工具策略共同决定结果。下面每一项都写清“测到什么”和“没有测到什么”。
不给工具、不给联网,用固定题目测约束理解、推理、证据边界与中文表达。每题等权,三次独立调用后再人工复核。
把研究、改代码、浏览器故障、表格交付、个人上下文和中断恢复交给完整系统,按真实产物与终态评分。
分别记录 accepted、protocol、transport、max-steps 和 scope violation。失败已在任务 outcome 中归零,不再用一个可靠性 utility 重复扣分。
TTFA 近似第一次看见文本答案的等待,E2E 是 Core text run 完整结束时间。Safe Agent 目前只有 E2E p90 汇总,单独展示而不计 Fit。
按测试日公开 API token 单价换算同一任务篮子的等价费用,并拆开 Core 与 Agent。
Strict 检查单工具串行协议,TPS 只看 SSE 事件窗口,多模态 smoke 只验证基础端点能否调用。
144 次回答质量、36 次真实 Agent、36 次协议诊断必须分开读。后两者虽然都调用了工具, 但只有 Safe Agent 进入场景评分。
不是只换一个 model name,而是固定一套 route、adapter、system / tool policy 后比较完整配置。
因此 transport 与 protocol 失败代表 Riv 实际会遇到的端到端结果。Core 每题 3 次独立调用;Safe Agent 每题 1 次、无重试,可并行安全只读工具,写操作仍受范围约束。
Core 有描述性波动,Agent 只有方向性证据。回答按 rubric 与人工 adjudication;Agent 按交付物、终态和 critical rule。失败 outcome 归零一次。
越权写入、虚构完成等 critical 行为直接阻断推荐。没有长期稳定性、真实账单、多模态质量或跨 provider 公平性结论,也没有 Agent repeats。
所有 Agent 推荐均标记“初步证据”。每个配置 8 道 Core 题、3 次独立重复;圆点是三次 repeat,总标记是 adjudicated 均值。
Safe-parallel 允许最多 8 个安全只读调用并行;混合读写、多写和越权组仍然 fail closed。
Mini 得 6/10;其余配置发生 transport、protocol 或 max-steps。n=1,不能外推成永久能力。
A05 留下越界 `.orig/.rej` 文件,所以 recommendation gate 被阻断。
TTFA / E2E 来自 Core text runs;Safe Agent 目前只有 E2E p90 汇总。失败会同时让运行更短、token 更少,所以速度与成本必须结合 terminal status 解读。
这是当前 6 个 Agent cases 的汇总尾延迟,不是只统计 accepted runs 的稳定估计;缺少 p50 与 repeats,因此不映射为等待 utility。
可能含隐藏 reasoning token 或分块缓冲,不是真实 decoder TPS。
Luna 因断线缺少一条 gateway usage,只能给下界。这里不是 AxonHub 实际现金账单。
表格保留百分比、完成数、秒和美元;色深只帮助扫读,不用一个 0–100 utility 掩盖原始含义。
气泡大小代表 Safe Agent 分数;斜纹表示成本仅为下界,虚线红圈表示推荐 gate 被阻断。
先过范围与安全 Gate,再把 Core、Safe Agent、等待体验和成本按当前任务加权。只显示整数,Agent 仍标记为初步证据。
Core 与 Safe Agent 各占 45%,Core 文本等待 proxy 与成本各占 5%。完成失败已在 Agent outcome 中计算,不重复加入可靠性。
用于高频研究、文件与代码工作;先过 critical safety gate,再比较 Fit。Agent outcome 已含终态;不再额外加入“可靠性分”重复惩罚。
scope violation 等 critical 行为即使总分很高也不会成为推荐。
Core 文本等待 proxy 和美元按 good / bad 对数锚点映射,不随候选增删漂移。
Strict、TPS proxy、smoke 与 coverage 全部不进入 Fit。
当前锚点:Core TTFA 2–20s · Core E2E 5–60s · 成本 $0.005–$1。左端映射为 100,右端映射为 0,中间按对数插值。Safe Agent E2E p90 因缺少 p50 与 success-conditioned 样本不计 Fit;当前区间只表达缺失成本,不是采样置信区间。
先看一句话定位,再把两个候选放进同一个原始单位比较。
Mini 相比 Sol: Core 低 6.07pp,Agent 高 5.83pp, TTFA 快 3.19 秒,公开等价成本是对方的 0.17×。
当前公开数据包含 47 个第一轮文本配置。这里统一显示自动分 / 72;每配置每题只有一次,与 Round 2 adjudicated 结果分开。
max 才拉开质量;中间档位仍有反转
ASR、TTS、Voice Design、Voice Clone;只证明基础端点可用。
GPT Image 1.5 与 2 完成基础 prompt;不是图像质量赛。
账户池不可用,未计模型质量 0 分;Round 2 按要求跳过。
本机未登录,未得到回答;Round 2 按要求跳过。
先对每个任务的交付 outcome 计分,未完成任务为 0;critical violation 单独触发不可补偿的推荐 Gate,保留任务质量分只用于诊断。Core、Safe Agent 先各自聚合,只有在选定场景后才与等待、成本 utility 加权。可靠性不再重复计分,Strict、TPS proxy、smoke 和 coverage 权重均为 0。
Core 只有 3 次 repeat,Agent 每题每配置只有一次;A16 的一次成败就足以改变次序。小数点后两位远超当前证据精度。Luna 缺一条 usage,所以受成本影响的 Fit 保留区间;区间重叠时显示可能名次范围。
TTFA 是到首个可见 answer-text event 的近似等待时间,E2E 是完整结束;两者展示 p50/p90。场景 utility 使用页面公开的固定对数锚点。成本按官方公开 API token 价格换算,不是 AxonHub 实际账单;失败会少用 token,因此原始结果仍需和终态一起读。
本页公开的是聚合证据,还没有随站点发布 prompts、fixtures、grader rubric、逐次响应、tool traces、运行 manifest、adapter 版本与 adjudication 账本。因此现在可以核对口径和结果,但不能从零重放全部实验;这应成为下一版本的数据发布目标。
Claude 未认证、Grok 上游账户池不可用,均标记未测而非 0 分。MiMo 音频与 GPT 图像只验证基础协议端点,不给质量分;第一轮 effort 每配置每题仅一次,也不与 Round 2 adjudicated 成绩混排。