物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.06 · 周日
第 039 期
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 8 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1成绩单一夜三改:OpenAI 被曝反复调整 GPT-6 Astra 基准数字,竞对成绩也跟着变
它能帮你干什么活:IT之家 9 月 6 日消息,据 Fortune 报道,OpenAI 自 9 月 3 日下午首次发布 GPT-6 Astra 的公告以来,已多次修改公告里的评测基准数据:一部分更新后的数字显示 Astra 表现提升,而最大对手 Anthropic 旗下模型的部分成绩被改低。同一家厂商、同一份成绩单、几天里几个版本——公告页没有修改记录,读者根本不知道自己看到的是第几版。
安全领域专家·老周说|「公告页没有修改记录」才是核心问题:一次能改的是参数,反复能改的是结论。033 期我说过「你指定的模型」≠「回答你的模型」,用户自己是最后一道审计——现在连审计用的底稿都会换版本。厂商公布基准必须附带版本号和可复现环境,否则默认按宣传物料处理,不按评测结论处理。
小编小禾说|这就像教练赛后偷偷改学员成绩单——还是在自己发的喜报上改。我给自己加了条新规矩:收藏一篇AI发布稿之前先整个页面截个图,过两天回来对答案,看它脸变了几次。
重点 2官方成绩单之外,第一批「企业实测」出炉:Astra 核对 41 份财务文件几分钟揪出 4 处预埋错
它能帮你干什么活:量子位 9 月 4 日报道(OpenAI 发布材料案例):法律平台 Legora 用 GPT-6 Astra 一次核对 41 份财务文件,几分钟找出预埋的 4 个错误,包括收入附注里 50 万英镑的差额;该任务比上一代快近 40%,但全任务平均提升约 3%。一边是厂商公告里的基准分数被曝反复修改,一边是真实业务场景交出的实测卷——这份「惊艳与平淡同框」的成绩单,比任何跑分表都更接近真相。
编程领域专家·老徐说|「单任务快 40%、平均只提 3%」这组对比罕见地诚实:真实业务里 AI 换代不是全科提分,是个别题惊艳。选型别盯发布会总分,拿自己那 20% 高价值任务去试。但记住这是厂商发布材料里挑出来的案例,幸存者偏差天然存在——035 期我说只信可复现日志,这条自己也不能例外,独立客户复测数据出来前,ROI 测算先打七折。
小编小禾说|我关心的不是它赢了上代多少,是「平均只快 3%」这句:意思是平时用它,多半感觉不到换代。钱包先捂好,等第三方拿自己日常活儿复测再说。
重点 3「三冠军」分家:通用推理、编程、速度各认各的头名,全能冠军这周不存在
它能帮你干什么活:Artificial Analysis 9 月 5 日随 v4.2 口径同步公布三张分类榜:通用推理榜 GPT-6 Astra 居首;编程榜 Claude Fable 5.1 守住头名;输出速度榜 Gemini 3.8 Flash 每秒 305 词元排全站第三、比前两名便宜一档。同一周,Arena 编程盲测头名又换成了对战样本最薄的 Astra max——总榜、分类榜、盲测榜三套尺子量出三个第一,「谁最强」彻底取决于你要它干什么活。
产品领域专家·阿哲说|分榜比总榜诚实:推理、写码、快是三种预算三种活,厂商轮流坐庄恰恰说明「全能冠军」本来就是营销 construct。对用户的意思是——把「选一个模型」拆成「按任务配三个默认」,高频便宜的活先给速度榜头部,重要产出再升级。延续我的老话:入口即模型,现在得加半句:入口该跟着任务走,别绑死一家。
小编小禾说|三张榜三个第一,翻译过来就是:没有哪个 AI 门门功课都优秀。我的用法变简单了——写周报用快的,改简历用推理强的,谁便宜先用谁养习惯,重要活儿照旧留给我用了半年的那家。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1Arena 智能体(干活)盲测榜 · 快照 09-05(当日更新,真人派活投票)
大白话|这张榜不是聊天是「派活」:真人把编程、运维之类的任务丢给智能体,按「事情到底办成没有」打分,「净改善分」= 把活干漂亮的比率减干砸的比率。本期头名易主:Claude Fable 5.1 (Max) 以 15.9 登顶,但只打了 6796 场,第 6 名 Opus 4.8 (High) 有 38148 场样本托底——新科头名的成色还得等对战数追上来。第 7 的 Kimi K3 是前十里唯一开源模型,9.8 万场样本比多数前列玩家都厚。Anthropic 在前十占 6 席。样本偏薄的名次会晃,看梯队别看单名次。
快报 2Arena 编程盲测榜 · 快照 09-05(当日更新,Astra 登顶但样本最薄)
大白话|真人出题让模型写代码、盲投谁写得好。GPT-6 Astra max 以 1797 分空降头名——注意它是全榜样本最薄的第一名:1199 场对战、置信区间正负 24 分,把第 2 到第 5 名(对战数两千到一万一场)全罩在误差条里;第 3 名 Opus 5 max 有两万场量级样本。真正稳的第二梯队挤在 1670-1690:阿里两款 Qwen3.8、Kimi K3 max 贴身缠斗。结论先别下,等 Astra 的票数涨上来再回看这座「脆冠」。
快报 3Arena 文本盲测榜 · 快照 09-02(聊天综合场,Anthropic 包场前十)
大白话|最老牌的人类盲测:随便聊,投票谁答得好。前十名里 Anthropic 一家占七席(实际数过:1、2、3、4、6、7、9 名),Meta 的 muse-spark-1.2 以 3240 场样本卡进第 5,谷歌 gemini-3.8-flash-high 第 8。前四名分差总共 5 分、置信区间 4-11 分——这个头部梯队基本是 statistically 平手,日常体验差距远没有名次看起来大。快照停在 9 月 2 日,本期未刷新。
8 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
机器人格斗场上线:AI 现场写控制器,代码互殴决胜负
9 月 6 日登上 Hacker News 的 Show HN 项目 llms-robot-arena:给编程智能体一份游戏规则和一台虚拟机器人,让它现场写控制代码,然后让不同模型写的机器人上台对打、按胜负排名。评测第一次不看你「输出的代码像不像好代码」,直接看你写的东西「打没打赢」。
一句话点评|「以结果论英雄」的评分口径又开一个新场景:这类对抗赛比跑分更接近工程现实,但规则和场地都是作者定的,先当玩具观察,别当选型依据。
给人类程序员出的「保底考题」上线:AI 代写时代你还剩多少基本功
codeset 上线一个叫 Vibecoding Test 的梗测试(9 月 6 日登上 Hacker News 热榜):专门测「习惯让 AI 代写代码之后,人类自己上手还剩多少基本功」——题目全是「不让用补全,手写」级别的操作。上线一天刷屏,程序员群体自嘲式晒分。
一句话点评|娱乐皮、体检芯:分不清哪些代码是自己写的团队,这测试比自己开会问有用。
智能体开始有「行车记录仪」:Vera 上线仅追加记忆日志
9 月 6 日登上 Hacker News 的 Vera:给 AI 智能体配的 append-only(只增不改)记忆库——SQLite 触发器硬性拒绝任何更新和删除,历史原样保留,「解读」交给智能体自己回头读。智能体干了什么、什么时候改的口径,第一次有了撕不掉的流水账。
一句话点评|把「可审计」做进存储层是个对路的思路;日志只能证明它记了什么,不能证明它没撒谎——排查事故够用,当信任凭证还早。
本地路由器 Routed 开源:AI 技能秒级调度,一个 token 不花
9 月 6 日 Hacker News 上的 Routed:给智能体技能(skill)做本地路由的轻量工具,混合调度延迟 20 毫秒以内、全程零 token 消耗——技能调用不再默认要过一遍大模型,先用规则和本地小模型分流。
一句话点评|「先路由后生成」是省 token 的正确方向,但调度准确率社区还没人报数,抄作业前先数数自己的技能清单值不值得上路由。
AI 编程助手的「项目记忆」开始卷标准:OKF 把记忆做成 Git 原生档案
9 月 6 日登上 Hacker News 的 OKF Agent Memory:按 Open Knowledge Format v0.2 规范,把 AI 编程智能体的项目记忆存成 Git 原生的纯文本档案——谁改的、改了什么、什么时候,全部走版本控制,换工具不用重新「喂」记忆。
一句话点评|延续 021 期「AI 记忆一旦记错比没有更难排查」的判断:记忆进 Git 至少让「谁记错了」可回溯,格式标准能不能立起来看还有谁跟进。
EvoMind 公开:给桌面智能体套上「运行时安全闸门」的本地架构
9 月 6 日经 Hacker News 公开的 EvoMind:一套本地优先的认知架构,把推理、规划、记忆和桌面智能体的动作全部过一遍运行时安全门(runtime safety gates)才放行——能力层和许可层分开设计,动作执行前逐条校验。
一句话点评|「环境说了算」的思路从大厂博客(024 期老徐聊过的 NVIDIA 安全栈)落到个人可跑的开源架构,值得盯;但闸门本身漏不漏,得等真实红队测试。
企业尝鲜名单再加一行:智谱把 Coding 套餐挂上天猫,明码标价 118 到 1078 元
钛媒体 9 月 6 日消息:智谱把基于 GLM 的编码套餐做成标准商品摆进天猫旗舰店,个人版月付 118、538、1078 元、团队版 598 元/席位——大模型编程能力第一次以「货架商品」形式对普通消费者报价。套餐档位对应的能力差异,官方页面没有给出任何实测基准。
一句话点评|买编程 AI 像买家电一样挂上货架是好事,但档位差价 9 倍、差异全凭说明——下单前先拿自己项目试最低档,扛不住再升级。
AI 味检测之争再发酵:「好 slop」论登上热榜,产量崇拜开始退烧
工程师博主 9 月 6 日发文 Good AI Slop 冲上 Hacker News 热榜:人人都说智能体产码又快又多,作者反问你到底想收下一座未经审视的「代码山」,还是想收下一座你审过的——AI 产量神话的祛魅文最近一周连上三方社区热榜。
一句话点评|「产量上去、验证跟上」是老徐从 024 期念叨到今天的立场,这篇把话挑明了:接受 AI 产出可以,照单全收不行。
● OpenAI 被曝连改 Astra 基准数据、Anthropic 成绩被改低(Fortune / IT之家)
● B 站首届 AI 创造公开赛收官:143 万奖金、《猫娘计划》一等奖独享百万(IT之家)
● Debian 投票「负责任用 AI」过案,F-Droid 或跟进立规(IT之家)
● OpenAI 证实「wiki 事件」并承诺披露框架(TechCrunch)
● AWS-bench 开源两天聚热:AI 智能体云上实操考卷(昨日刊续热)
① Arena 编程榜 Astra 的 1199 场样本继续累积:「脆冠」名次在票数翻倍后还保不保得住
② ARC-AGI-3 双成绩 + 公告改分风波发酵:看有没有第三方机构公开复测,厂商自测口径会不会被迫统一
③ AA v4.2 私有库改版的复核数据:开源阵营(Kimi K3、DeepSeek)在新口径下的错题分布
物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.06 · 周日
第 039 期 · 预览版
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 8 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1AI 考试的「泄题防线」升级了:四成考题转进私有库,榜单还能信几分?
它能帮你干什么活:第三方评测机构 Artificial Analysis 9 月 5 日把智能指数升级到 v4.2 口径:一半考题人人可见,私有留出测试集的权重从约两成直接翻倍到四成,移除了已经「人人会做」的 GPQA Diamond 题库,换上周多智能体项目实测(AA-Briefcase)和 4592 页文档推理(GDP.pdf)这类新题型。新口径第一份成绩单:Claude Fable 5.1 以 57 分居首、GPT-6 Astra max 55 分第二,开源榜首是 Kimi K3 的 50 分。考题为什么藏起来?因为 AI 厂商开始「背题」——公开题库被训练数据覆盖后,高分说明不了泛化能力。
产品领域专家·阿哲说|说|这是评测产品的一次「防作弊重构」:把分数从「谁刷公开题更狠」拉回「没见过的题你行不行」。私有库权重翻倍意味着外界无法复核前三名差距(57 比 55 只差 2 分),榜单从「公共考场」往「机构背书」滑——信它的程度取决于你信不信这家机构。选型时别只盯总分,看它敢不敢把错题明细放出来。
小编小禾说|说|大白话:以前考试大家都能看真题,现在四成题藏起来了,说是怕 AI 背题——道理我懂,但分数更没法自己验算了。我的土办法不变:榜单当「入围名单」,当堂测试还是拿自己的活儿喂一遍。
重点 2同一个模型,两种考法差出 37 分:ARC-AGI-3 成绩争议把「谁来监考」摆上台面
它能帮你干什么活:基准分析机构 Vellum 拆解 OpenAI 公布的 GPT-6 Astra「ARC-AGI-3 得分 99.9%」发现:那是用 OpenAI 自家的 Responses API 测试框架跑的,还调了两项默认参数;换标准测试框架,同一个模型只有 62.7%,而人类平均是 48%。一条成绩两种版本,差 37 分。ARC-AGI 系列本是「测真聪明还是背答案」的金标准考题,现在连它的成绩单都取决于用谁的尺子量。
编程领域专家·老徐说|说|我 8 月说过:出题范围和测试环境都是主办方定的,考卷天然偏向自家生态——这次更直接,厂商自测自带「考场优势」。测量框架开始左右结论,说明行业还没解决「第三方监考」问题。看基准成绩先问三件事:谁跑的、什么框架、参数调没调。三件有一件答不上,数字先打对折。
小编小禾说|说|99.9% 和 62.7% 都是「真的」,只是尺子不一样——这事跟买体重秤一个道理,秤不准,减重全白搭。以后看到「碾压人类」的宣传,先找找有没有第三方用同一把尺复过秤。
重点 3「能找漏洞、不许写攻击」:三家大厂不约而同给最强网安能力上了分级锁
它能帮你干什么活:本周模型盘点披露:Anthropic 称 Claude Fable 5.1 的网络安全误报率比上代降 60%,可以帮你发现漏洞、但拒绝写利用程序,此类请求重定向到 Opus;谷歌同周发布 Gemini 3.8 Flash Cyber 专网安场景;OpenAI 的 Astra 网安完整版只向审核通过的防御方开放。三家把「最强的攻击侧能力」统一收进了白名单闸门。
安全领域专家·老周说|说|方向对,但要看清两个层面:一是分级开放的「审核」标准由厂商自己定,防御团队申请门槛和响应速度还没经过一次真实应急响应检验;二是误报率降 60% 是厂商口径,第三方网安基准(如 CyberSecEval 系列)复测数据出来之前,企业采购别把这句话写进合同。护栏建在能力出口是对的,出口钥匙在谁手里才是关键。
小编小禾说|说|翻译成人话:AI 现在「只当保安,不当盗贼」。对企业是好消息;对个人小白的提醒是——别指望它会帮你「测试」你家 WiFi 密码,它装不认识你。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1Arena 智能体(干活)盲测榜 · 快照 09-02(真人派活投票,本期主榜)
大白话|这张榜不是聊天是「派活」:真人把编程、运维之类的任务丢给智能体,按「事情到底办成没有」投票。「净改善分」= 把活干漂亮的比率减干砸的比率,越高越靠谱。前三名全是 Anthropic,OpenAI 最好成绩第四;前十里唯一的开源模型是第 5 的 Kimi K3。注意这张榜对战样本还薄,名次会晃,看梯队别看单名次。
快报 2Arena 图像理解盲测榜 · 快照 08-28(看图说话专场)
大白话|真人匿名同时问两个模型同一张图,投票谁答得好。前十名里 Anthropic 占四席但头名优势只有 2 分(1301 比 1300),阿里 qwen3.8-max 咬在第二梯队头上;Meta 的 muse-spark 前五里唯一、主打便宜。看图能力头部已经挤成一团,选型看价格和上下文长度更实际。
快报 3Artificial Analysis 智能指数 · v4.2 新口径首张成绩单(09-05 发布)
大白话|就是重点 1 说的那次改版:四成考题转入私有库后的第一张榜。头名只领先 2 分,且私有题库占比翻倍意味着这个差距外界没法复核——当「机构评测结论」看,别当「公开考试成绩」看。上期(09-05 刊)用的 Arena 文本/编程榜与 LiveBench 本期末换源,数据各自快照日期已在标题标注。
8 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
给人类程序员出的「保底考题」上线:AI 代写时代你还剩多少基本功
codeset 上线一个叫 Vibecoding Test 的梗测试(9 月 6 日登上 Hacker News 热榜):专门测「习惯让 AI 代写代码之后,人类自己上手还剩多少基本功」——题目全是「不让用补全,手写」级别的操作。上线一天刷屏,程序员群体自嘲式晒分。
一句话点评|娱乐皮、体检芯:分不清哪些代码是自己写的团队,这测试比自己开会问有用。
小米开源通用表格大模型 TabLDM:一个模型免调参通吃表格分类和回归
IT之家 9 月 5 日消息:小米发布 Xiaomi-TabLDM,单一预训练模型免调参适配表格数据的分类与回归任务,OpenML-CTR23 回归登顶、TALENT 二分类第一、TabArena 回归第二,且训练时间比榜首省 82%。表格模型长期是「每家一张卷」,能一个模型过多个基准的开源选手不多见。
一句话点评|做业务报表预测、风控评分这类活的团队值得拉下来跑自己的数据——开源+省训练时间是真金白银。
GPT-6 Astra 解开 5 道人类没解完的数学猜想:68 道题里唯一非零分
Epoch AI 与曼彻斯特大学 9 月 4 日论文披露 FrontierMath Erdős 基准结果:68 道人类未解数学猜想,GPT-6 Astra 标准测试解出 2 道、放宽预算共 5 道,其余四个顶级模型零分,全部尝试花费超 22 万美元。此前该系列基准的天花板一直是「模型全零分」。
一句话点评|「唯一非零分」是里程碑也是营销素材——22 万美元换 5 道题,性价比争议留给学术界,先记住这是「没见过的题」。
2014 年的老显卡跑满 256K 长上下文:Qwen3.8-Flash-Next 社区实测
9 月 4 日技术社区汇总:在 Tesla T4(2014 年发布的老 GPU)配 DDR4 内存的机器上,阿里 Qwen3.8-Flash-Next 可跑满 256K 上下文。旧硬件跑大模型的门槛再降一档——长上下文过去默认要新卡大显存,这个演示把「能不能跑」和「跑得爽不爽」拆开了。
一句话点评|个人开发者本地跑长文档的最便宜方案又近了一步,但速度体验社区没报数,别指望生产级。
企业实测:法律平台 Legora 用 GPT-6 Astra 几分钟核对 41 份财务文件,揪出全部 4 处预埋错误
量子位 9 月 4 日报道(OpenAI 发布材料案例):法律平台 Legora 一次核对 41 份财务文件,几分钟找出预埋的 4 个错误,含收入附注里 50 万英镑的差额;该任务比上一代快近 40%,但全任务平均提升约 3%。
一句话点评|厂商案例集,数字要打折看——但「快 40%、平均只提 3%」这组对比很诚实:单点任务惊艳,日常全能还是老样子。
智东西横评 GPT-6 Astra 成绩单:GPQA 96.0%、数据库迁移 63.9% 创新高,编程榜被 Meta 反超
9 月 4 日报道:Astra 在 FrontierMath Tier 4 得 97.6%、GPQA Diamond 96.0%、内部数据库迁移任务 63.9%(超过 Fable 5.1 的 57.8%);但 DeepSWE 编程基准 74.1% 被 Meta Muse Spark 1.3 的 75.4% 反超。新旗舰不是全科目第一,偏科图谱比总分更接近真相。
一句话点评|选型看分项:要数据工程活 Astra 强,要写代码 Muse Spark 略胜——一张总分榜藏不住这事。
「三冠军」分家:本周 AI 办公榜通用推理 Astra 居首、编程 Fable 5.1 居首、速度 Gemini 3.8 Flash 全站第三
Artificial Analysis 9 月 5 日随 v4.2 口径同步公布三张分类榜:通用推理 Claude Fable 5.1 让位 GPT-6 Astra;编程榜 Claude Fable 5.1 守住头名;输出速度榜 Gemini 3.8 Flash 每秒 305 词元排全站第三。没有全能冠军的一周,按用途选模型成了更实际的策略。
一句话点评|三张分榜比一张总榜有用:推理、写码、快是三种预算三种活,对号入座。
腾讯混元 Hy4-Preview 首秀 Arena 编程榜:第 10 名,但只打了 1600 场
Arena 编程榜快照显示:腾讯 hy4-preview 以 1623 分位列第 10,对战样本仅 1600 场、置信区间正负 16 分。新模型冲榜的常规剧本——先占坑攒样本,名次等对战数上来再定论。
一句话点评|小样本第 10 和厚样本第 10 不是一回事,观察名单+1,结论先不下。
● GPT-6 Astra 发布,OpenAI 总裁布罗克曼放话「欢迎来到 AGI 时代」(IT之家)
● OpenAI 证实「wiki 事件」并承诺披露框架(TechCrunch)
● AWS-bench 开源两天聚热:AI 智能体云上实操考卷(昨日刊续热)
● Flathub 宣布下架违规 AI 编码应用,开源商店首次立规(OMG Ubuntu)
① Arena 智能体榜对战样本继续累积:Claude Opus 5 头名成色在样本翻倍后是否还稳
② ARC-AGI-3「双成绩」发酵:看有没有第三方机构公开复测流程,厂商自测口径会不会被迫统一
③ AA v4.2 私有库改版的复核数据:开源阵营(Kimi K3、DeepSeek)在新口径下的错题分布
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-09-06
数界工坊 · 全球AI评测雷达