物界前沿评测·全球AI评测雷达
PHYSIX FRONTIER AI REVIEW · BENCHMARK RADAR
2026.08.05 · 周三
第 007 期
别人做评测,我们做评测的雷达——每天5分钟,看懂AI模型的真实水平
Elo 1509
Claude Fable 5 守擂 Arena
文本竞技场第一
空降第5
Qwen3.8-Max 上榜首周
Elo 1496 · 仅3327场对战
61 分
Opus 5 登顶 AA 智能指数
开源第一 Kimi K3 57 分
7.22T
DeepSeek-V4-Flash 周用量登顶
中国模型包揽 OpenRouter 前五
榜单雷达 3 组硬数据 | 权威评测 3 篇 · 结论+原文链接 | 社区实测 4 条 · 真实用户反馈 | 评测日历
本期三条主线:Anthropic 霸榜——Arena 文本前十占七席、AA 智能指数前二包揽;中国模型正面突围——Qwen3.8-Max 上榜首周空降 Arena 第五,OpenRouter 用量前五全部是中国大模型,DeepSeek V4-Flash 单日吞下 8 万亿 token;代码基准全面饱和——SWE-bench 拉不开差距,评测焦点从「能不能过」转向「多少 token 过、写得地不地道」。
数据快照:2026-08-04 · 榜单更新 Aug 1 · 来源 arena.ai(原 LMArena)
雷达解读|前十席 Anthropic 占七席,竞技场进入 Claude 时间。Qwen3.8-Max 是前十唯一新面孔,但对战样本只有 3327 场,置信区间 ±10 还宽——样本堆上去之后能不能守住前五,是本周最大看点。另一个反常信号:Opus 5 两个档位排在自家上代 Opus 4.6/4.7 thinking 之下,新旗舰还没在人类偏好上完成接班。
9 项基准加权(Agent/编程/通用/科学推理各占 25%)· 来源 artificialanalysis.ai
开源梯队:Kimi K3 (max) 57 分领跑,GLM-5.2 (max) 51 分、DeepSeek V4 Flash 0731 50 分紧随。速度榜 Celeris-1 以 2101 token/秒登顶,是第二名的两倍多。
真实生产流量,市场用脚投票 · 统计窗口 7/27–8/2 · 来源 openrouter.ai / 每日经济新闻
前五全是中国大模型,连续第 14 周压过美国。OpenAI GPT-5.6 Luna 降价 80% 后首次上榜,位列第八、周用量 1.95T、环比 +456%——价格杠杆立刻见效。用量榜是市场信号不是质量榜,看趋势,别把单周排名当采购结论。
评测 1Varto 通关 PutnamBench:640 道竞赛数学全证明
Varto 把它的 Isabelle 验证平台对准 PutnamBench(Putnam 大学生数学竞赛的形式化题库),解出全部 640 道 Isabelle 形式化题目——这是首个 Isabelle 提交,也是首个通关整个基准类别的方案。底层用 GPT-5.5,多数证明在 medium/high 推理档完成。成本账:平均每题 token 花费 8 美元、耗时 16 分钟,比当时 Lean 榜首方案便宜约 8 倍、快约 23 倍。
实测结论|形式化数学从「能证几道」进入「整类通关」阶段。
✅ 优势:640/640 全证明、Isabelle 类别第一、单题成本与时长双降
❌ 注意:依赖 Isabelle 内建 tactic 与形式化档案库,换到裸 Lean 优势未必复现
推荐度:★★★★★ 适合:数学证明 / 形式化验证 / 定理证明研究
来源:Varto 官方博客(2026-07-23)· 原文链接 ↗
评测 2代码基准饱和了:Laravel Boost 宣布转向「性价比 + 地道性」
Laravel Boost 团队的 17 项评测里,前沿模型(GPT-5.6、Claude Fable 5、Mythos 5、Gemini 3.x)如今全部接近 100% 通过——一年前还在 60% 徘徊的 SWE-bench Verified 也已饱和,头部模型彼此只差一两分。「能不能过」失去了区分度。Boost 给出新北极星:一是每 token 产出多少正确代码(同任务不同模型成本能差一两个数量级);二是代码地不地道(用 LLM-as-judge 按 19 条 Laravel 惯例打分,不再只看测试绿不绿)。
实测结论|编程评测进入下半场,选模型别只看过率。
✅ 信号:前沿模型框架正确性已是基本盘
❌ 提醒:「过测试」≠「能合进代码库」,长程业务逻辑仍是短板,Terminal-Bench 这类真实任务榜单还远没打满
推荐度:★★★★★ 适合:编程选型 / 成本敏感团队 / 工程负责人
来源:Laravel Boost Benchmarks(2026-08)· 原文链接 ↗
评测 3Celeris-1:扩散语言模型登顶速度榜 2158 token/秒
Celeris-1 在 Artificial Analysis 可比非推理模型里跑出 2157.9 token/秒的输出速度登顶,首 token 延迟 0.64 秒。它不走自回归路线,而是把扩散架构搬到文本:先生成粗糙答案再多轮并行精修,是继 Inception Mercury 之后第二个商用的扩散语言模型 API。智力面要冷静看:MMLU-Pro 75.9%(延迟 158ms,GPT-5 是 81.9%/2046ms),但 AA 智能指数只有 12 分、同类 80 个模型里排第 40——它更强的是速度,不是聪明。定价 $0.20/百万输入、$0.70/百万输出。
实测结论|延迟敏感场景的新选项,别指望它扛复杂推理。
✅ 适合:分类、抽取、打分、查询改写、实时翻译、Agent 工具调用这类短平快任务
❌ 短板:综合智能远落后前沿,重推理任务不适用
推荐度:★★★★★ 适合:实时语音 / 高并发低推理任务
来源:RuntimeWire / Artificial Analysis(2026-08-04)· 原文链接 ↗
跑分之外,真实用户在生产环境里摸出来的手感。只挑有信息量的。
OpenCode 官方 DeepSeek V4 Flash 单日吞下 8 万亿 token
开源编程工具 OpenCode 披露,DeepSeek V4 Flash 正式版单日在其平台消耗 8 万亿 token,其中 5 万亿来自免费额度、3 万亿来自付费套餐 OpenCode Go。作对比:接了 400 多个模型的 OpenRouter 全平台日均也就约 6.6 万亿。一个模型、一个入口,单日用量超过整个路由平台的日均——「能力提升、价格不变」把被压着的需求一下放了出来。
荣耀高管 「DeepSeek 斩杀线」:单位 token 成本与性能最优
荣耀关海涛谈 DeepSeek-V4-Flash 正式版跑分:单任务成本比 GPT-5.6 Luna 低约 60%。他把这叫「DeepSeek 斩杀线」——同价位里性能最优、同性能里价格最低,对国内、海外、中间层三方都是压力。这条线和 OpenRouter 上中国模型登顶互为印证。
YouTube/社区 GPT-5.6 Luna 降价 80% 后首进 OpenRouter 榜
OpenAI 把 GPT-5.6 Luna 输出价从 6 美元/百万 token 砍到 1.2 美元、输入从 1 美元降到 0.2 美元,上线不到三周就调价。效果立竿见影:Luna 首次登上 OpenRouter 周榜第八、用量环比 +456%。但开发者社区反应复杂——有人在 OpenCode 评论区直言「我们想要的是 DeepSeek 的价格」。
Reddit r/singularity 「Kimi K3、GLM 5.2 是真材实料还是跑分虚高」仍在吵
中国开源模型冲榜引发社区激辩:一派拿 Arena、AA 的硬排名说「已经追平甚至反超」,另一派质疑对战样本量和跑分口径。Qwen3.8-Max 空降 Arena 第五但只有 3327 场对战,正好是这场争论的缩影——榜单在变,信任还在建立。这正是本栏目持续跟踪的问题。
来源:r/singularity 社区讨论
本周|Qwen3.8-Max 开源权重放出——千问首个开源旗舰,重点看社区自部署复现与 Arena 对战样本积累(当前仅 3327 场,Elo 待验证)
8/5|Claude Opus 4.1 退役——迁移窗口期,适合把 Opus 5 与 GPT-5.6 Sol 拉进同一组任务做迁移对比测试
持续跟踪|DeepSeek V4-Flash 用量曲线与 OpenRouter 中国模型份额——成本锚是否进一步下移
持续跟踪|Celeris-1 生产环境实测——2158 token/秒的速度优势能否转化为真实的端到端延迟收益