物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.02 · 周三
第 035 期
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1Anthropic 凌晨甩出 Fable 5.1:8 项考试屠榜,干活的价格最高砍 45%
它能帮你干什么活:9 月 1 日(当地时间)深夜,Anthropic 同时发布 Claude Fable 5.1 和 Claude Mythos 5.1,官方口径是「全球最先进的编程与知识工作模型」。两款模型共用同一个基础模型,区别在权限包:Mythos 5.1 面向通过验证的网络安全防守方,Fable 5.1 面向普通用户和企业。按官方晒出的成绩单,8 项公开基准它排第一;对天天拿 AI 干长活的人最实在的是价格——智能体任务里反复读缓存的部分,读取费直接下调 75%,整体算下来智能体工作最高便宜 45%。官方还说,这次针对客户抱怨最多的三件事动了刀:太贵、数据保留太严、安全限制太紧。另外加了「反蒸馏」机制,防止对手拿它的回答去训练自家模型。
编程领域专家·老徐说|版本号只点 0.1,通常说明不是换代是「调校」:同样的模型底子,把价格、限速、拒答率这些工程参数重拧一遍。敢对「安全限制太紧」动手,说明真被客户投诉到肉疼了——过去半年不少人抱怨顶级模型「太谨慎」,干到一半被拒答。缓存读取砍 75% 是我最看重的数字:长任务里模型反复读同一份上下文,这项直接决定账单。老规矩,8 项屠榜是厂商自报,跑分归跑分,接真实项目前先等第三方复测,我自己会先拿旧项目跑一周再下结论。
小编小禾说|订阅价会不会跟着降,才是我关心的「屠榜」。延续我 026 期那句:新榜单、新发布的名次先别急着当真,看它稳一两轮再决定换不换工具。这周先拿不重要的活试试 Fable 5.1,重要的活还是留给用了半年的老伙计。
重点 2阿里 Qwen3.8-Max 今早更新 0902 版:前端编程盲测榜涨 22 分,冲上全球第一
它能帮你干什么活:9 月 2 日,阿里千问宣布 Qwen3.8-Max 升级到 0902 版本,围绕编程和专业办公做了专项后训练。硬数据在榜单上:聚焦前端编程(一句话生成网页那种活)的第三方盲测榜 CodeArena,它的分数提升 22 分、到 1691 分,跃居全球第一,超过了此前霸榜的 Claude 系模型。这个榜的玩法是真人出题、匿名对比两个模型的回答、投票定胜负,分数逻辑和竞技场 Elo 类似。对照一下 Arena 代码盲测榜(8 月 30 日快照):Qwen3.8 Max 原来排第 3(1669 分),前面是 Claude Opus 5 的 Max 和 High 两档。今天的更新如果守得住,就是国产模型第一次在「写网页」这个最卷的项目上坐到头名。
编程领域专家·老徐说|盲测投票榜比厂商自报跑分硬一档,因为出题和打分都不是它自己人,所以这条值得认真对待。但两个提醒:一是 1691 分是「前端网页」单项冠军,不是编程全能冠军,SWE-bench 那种改真实 bug 的考卷另说;二是今天刚发,票数会快速累积,名次先记账不入场——延续我在 031 期对 Gemini 新名次的话:样本没攒够之前,先等第三方实测,接项目前拿自己真实任务跑一周看断在哪步。
小编小禾说|国产模型冲到世界第一是好事,但我掏钱的时候只看两件事:稳不稳、贵不贵。延续我的老流程:先等第三方拿真实项目复跑,分数对得上,我再考虑把手里的工具换一换。
重点 3手机 AI 记忆能力第一次有了「全国统一考卷」:OPPO 联合多所高校发布 MobileMem
它能帮你干什么活:9 月 2 日,OPPO 首席产品官刘作虎发文宣布,OPPO 联合 OpenKG(中文开放知识图谱社区)以及浙江大学、同济大学、东南大学等高校团队,推出了首个面向端侧 AI 记忆能力的评测基准 MobileMem。翻译成人话:你的手机 AI 能不能记住你上周说过的偏好、跨 app 接力干活、隔了三天还记得你交代的事,以前全凭各家宣传页一张嘴,现在有一张统一考卷来量了。刘作虎的说法是,过去两年 AI 手机在解决「能不能聊」,接下来拼的是「记不记得住、会不会主动办事」,记忆就是下一个比拼项。
产品领域专家·阿哲说|我这两年一直在记「打分权从厂商手里拿回来」的名单:8 月 17 日 AI 制药公开榜、8 月 21 日语音办成事榜、8 月 26 日视频生成基准、9 月 1 日游戏基准 DogLM,这是第五个品类,也是第一次轮到「手机端侧记忆」被拉出来公开考试。厂商联合高校出题这个姿势比自家测自家强,但要盯两件事:题库和判分规则是否全公开、友商模型跑不跑得到及格线——考卷要是不让对手考,含金量就要打折。对普通用户,以后买 AI 手机可以多问一句:MobileMem 几分?
小编小禾说|我早觉得手机上的 AI 健忘:昨天说的口味今天不认,让它记个东西过两天就断片。有考卷是好事,我先蹲首批成绩——分高的机型出来之前,宣传页上「超强记忆」四个字我一个标点都不信。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1Arena 人类盲测三榜(快照 8 月 27~31 日 · 9 月 1 日抓取,与上期同源暂未刷新,新数据见下面两组)
大白话|聊天盲测前五名里 Anthropic 占四席;Meta 的 Muse Spark 1.2 (xHigh) 排第 4,但只打了 3247 场,比其他上榜模型少了五六倍,成绩波动区间明显偏宽,名次先别当真。代码榜前五里两个开源模型(Kimi K3 第 2、阿里 Qwen 3.8 Max 第 3);视觉榜第 3 也是 Qwen 3.8 Max——它今天刚更新的 0902 版成绩,这张快照里还看不到。
快报 2编程实战考卷(SWE-bench / Terminal-Bench · 9 月 1 日 openJiuwen 技术报告自报,尚无第三方复现)
大白话|同一款模型换一套驱动框架,两张考卷都能多拿 3 分以上,「AI 能不能干活」的评价正从「只看模型」转向「模型 + 框架」一起看。分数出自厂商自己的技术报告,先打折记账。
快报 3Artificial Analysis 智能指数(9 月 2 日抓取 · 上期未用过)
大白话|榜首 66 分、第 8 名 61 分,顶级和次顶级只差 5 分,价格差近 4 倍。国产开源 Kimi K3 和智谱 GLM-5.3 挤进头部梯队,单任务成本还压在 1 美元以下,「便宜大碗」在成绩单上第一次有了集体存在感。今天发布的 Fable 5.1 已在榜首挂着 66 分。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
新基准 TEAS 开张:AI 的花钱、准头、速度、耗电,四件事放一张表里考
9 月 2 日出现在 Hacker News 的 teasbench.com:一个新基准,专盯「不断进化的 AI 和它跑在什么系统上」,把成本、准确率、性能、能耗四个维度放在一起同表对比,而不是各考各的。
一句话点评|花钱和耗电第一次跟准确率同框记分,方向对路,新考卷先记账不入场。
本地 AI 现状报告:在自己电脑上调模型的人,到底混得怎么样
算力公司 Base Compute 发布 State of Local AI Report,专门摸底「在自己设备上跑模型」这个人群:用什么硬件、跑什么模型、什么场景留不住人非得上本地。本地派关心的就一条:断网能用、数据不出门。
一句话点评|延续我们 032 期的立场:本地部署能玩,但别拿轻薄本挑战 70B,报告数据口径得再看细。
自然·人类行为新论文:AI 当写作助手,人类文字的风格方差最多收窄一半
南加州大学团队把 88 万篇真实文本、三项实验、七个数据集摆在一起算了一笔账:当大语言模型普遍介入写作,人类文本的复杂度方差最高可收窄 50%——不是大家写得变简单了,是写法正在向同一个「平均值」挤。
一句话点评|这是「AI 味道检测」的另一面:不是检测器误判,是人类文风真的在趋同。样本大、发在正刊上,比厂商公关稿可信,结论仍别过度解读。
新工具:给 AI 智能体「路上拔网线」,实测 127 毫秒
一篇工程师实测文章:AI 编程智能体跑任务时手里常握着你的云密钥和外网通道,作者做了一套能在任务中途掐断其网络访问的拦截机制,实测从决定到断网只花 127 毫秒,比人反应过来快得多。
一句话点评|「环境说了算」再添一个能落地的样本,护栏不一定拖慢速度。
一个新方法,专门给「考 AI 的考卷」做体检
9 月 2 日凌晨,AI2(Allen Institute for AI)团队在 HuggingFace 发布 BenchMIRT:不再只给模型打分,而是反过来审计评测题库本身,检查每道题到底在考什么、有没有被模型「背题」。
一句话点评|考卷先体检,分数才有底气,方向对路。
一个免费 API,把 900 多款 AI 的价目表装进一张实时表
Show HN 项目 Indextkn:976 个模型、17 家厂商的标价实时可查,号称刚刚更新。AI 涨价降价越来越频繁,普通用户想比价终于不用挨家翻官网。
一句话点评|工具免费可查,数据全不全得抽样对一对。
一个 bash 脚本,把 AI 编程助手关进「隔离房」
开源项目 Dev-sandbox:一条脚本让 AI 编程智能体跑在 Podman 隔离容器里,可选更强的 microVM 隔离,专治「AI 握着你主力机的钥匙干活」。
一句话点评|别急着让 AI 碰主力机,先给它一间能随时拆掉的房。
Wasmer 发新 SDK:给 AI 智能体配本地「安全屋」
浏览器公司 Wasmer 推出本地沙箱 SDK,AI 智能体执行的代码被关在独立环境里,不碰宿主机文件系统。
一句话点评|隔离赛道又挤进一个正规军,对普通用户是好事。
让 AI 玩「狼人杀」:SquidGPT 淘汰赛开桌
开发者搭了个实验,让多款 AI 模型参加淘汰制博弈游戏,看它们在结盟、欺骗、投票时的表现差异。
一句话点评|博弈类评测比问答更接近智能体的真实水性,围观可以,别当成绩单。
算一笔账:AI 智能体「思考一瓦」 vs 人脑 20 瓦
8 月 31 日的工程博客把 AI 推理能耗和人脑功耗摆在一起算账,结论是人脑 20 瓦的能效依然让最新硬件侧目。
一句话点评|算力焦虑的另一种算法,看个新鲜,估算归估算。
● 谷歌新旗舰 Gemini 3.8 Flash(代号 Skimaki)据报最快本周三上线,编程能力对标 OpenAI 与 Anthropic(华尔街日报 / IT之家)
● 多个 AI 编程智能体同时开工互相踩脚?开源协议 Foremerge 想让它们先对暗号再动手(GitHub / HN)
● 工程师分享心得,跟 AI 智能体干活时先声明「我是专家」,它的产出质量不一样(shimin.io / HN)
● 设计博客警告「失控 AI 交易员」,智能体的冒险倾向是出厂属性,不是后天学的(HAIPA / HN)
① 谷歌 Gemini 3.8 Flash(代号 Skimaki)据报最快今天上线:盯真实成绩——内部 Jetski 工具对比、外部盲测分数哪个先流出来,别只看代号和海报。
② Qwen3.8-Max 0902 版的 CodeArena 1691 分和 Fable 5.1 的「8 项屠榜」都是刚出炉的名次,盯第三方复跑和票数累积后的位次变化,新名次先记账。
③ MobileMem 刚发布:盯首批参考成绩放不放榜、友商模型跑不跑、题库判分规则是否公开——考卷不让对手考,含金量就要打折。
物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.02 · 周三
第 035 期 · 预览版
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1OpenAI 承认:新款 AI 太会「黑客入侵」,自家安全评级直接拉到最高档
它能帮你干什么活:9 月 1 日(周二),OpenAI 宣布即将上线的新模型 Astra 是第一个跨过其内部「Critical」(最高危险级)网络安全门槛的产品。按这个评级,它已经不需要人一步步教,就能自己找漏洞、自己写攻击方案。OpenAI 同时表态:这个能力不会向普通用户开放,只对少数被信任的防守方(安全公司、政府机构)定向放开了口子。还记得 8 月 20 日那期我们跟过的「未发布模型在 Hugging Face 越界」风波吗?据 The Verge 报道,那件事之后 OpenAI 推迟的是另一款未发布模型的开发,Astra 反而在这次事故后更受重视。
安全领域专家·老周说|能力迟早会有,什么时候放、放给谁、有没有审计,才是这条新闻的正文。模型能自主完成攻击动作时,护栏必须从「提示词层」下移到「环境层」:锁死它能碰的系统、留全行为日志。另外提醒一句,「Critical」是 OpenAI 自己定的评级标准,评级可信不可信,照老规矩,等第三方验证。延续我说过的那条:能力边界不清才是结构性风险,这次至少它先承认了边界在哪。
小编小禾说|听着吓人,但普通人既用不到也不该用得到。我关心的是反过来这面:会找漏洞的 AI 也能帮着堵漏洞。对普通用户来说,老话不变,重要账号权限能不开就不开,别急着授权。
重点 2同一款 AI 大脑,换套「手脚」去考试,编程成绩多拿 3 分
它能帮你干什么活:9 月 1 日,华为开源 AI 智能体平台 openJiuwen 发技术报告,在两道 AI 编程「实战考卷」上刷出新纪录。第一道叫 SWE-bench Verified,从 GitHub 真实 bug 里挑 500 道题改代码,它拿 82.6%;第二道叫 Terminal-Bench 2.1,模拟真实终端环境干复杂活,它拿 87.19%。关键是它做了组「同模型对照」:跟榜单最强系统用同一款模型,成绩高 3.4 分;换上 Claude Code 用的同一款模型,还是反超。SWE-bench 这两道榜的「解决」判定是程序自动验的,改错测试文件蒙不过去。翻译一下:模型决定 AI 的地基智力,套在它外面的执行框架决定它实际能走多远。以后挑 AI 编程工具,光问「用的什么模型」不够了,得问「它怎么驱动模型干活」。
编程领域专家·老徐说|「工具是放大器不是发动机」,我在 022 期打过套壳打假,这篇是正面样本:论文公开、代码开源、产品可装,姿势比只发海报强。但 82.6% 是自报分数,第三方还没复跑,延续我的老规矩,先打折记账。另外 82.6% 离「靠谱」还远,一百道题它仍有十七道干不利索;长链路任务的断点各不相同,接自己项目前,先拿真实任务跑一周看断在哪步。
小编小禾说|同一个模型换套壳就能多考几分,那我平时选工具真不该只认牌子。不过分数归分数,我先等第三方拿自己项目复跑的结果,再说换不换。
重点 3扫地机器人要有「全国统一考卷」了,11 个测试项目一次讲清
它能帮你干什么活:9 月 1 日,央视新闻报道,我国日前牵头制定了国际标准《家用和类似用途机器人性能评估方法》,给全球家用机器人行业定了统一的性能评估框架,涵盖避障、坡度运行、能耗等 11 项核心测试。此前各家的参数全是自家实验室口径,「覆盖 98% 地面」这种话没人知道是怎么测出来的。有了这份统一考卷,各家宣传页上的数字第一次有了互相可比的可能。
穿戴领域专家·阿凯说|测评硬件这些年,最怕的就是「各自出题各自记分」。标准统一是第一步,还要盯第二步:谁来测、怎么测、报告是否公开。对普通用户,以后买扫地机器人至少能问一句「这 11 项成绩有吗」。小品牌合规成本上去了,价格说不定先涨一轮。
小编小禾说|扫地机器人天天撞拖鞋的我,看到「避障」两个字最有感情。以后宣传页那句「智能避障」要是没有测试成绩撑腰,我是不信了,这对普通人太实用了。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1Arena 人类盲测三榜(快照 8 月 27~31 日 · 9 月 1 日抓取,与上期同源暂未刷新,新数据见下面两组)
大白话|聊天盲测前五名里 Anthropic 占四席;Meta 的 Muse Spark 1.2 (xHigh) 排第 4,但只打了 3247 场,比其他上榜模型少了五六倍,成绩波动区间明显偏宽,名次先别当真。代码榜前五里两个开源模型(Kimi K3 第 2、阿里 Qwen 3.8 Max 第 3);视觉榜第 3 也是 Qwen 3.8 Max。
快报 2编程实战考卷(SWE-bench / Terminal-Bench · 9 月 1 日 openJiuwen 技术报告自报,尚无第三方复现)
大白话|同一款模型换一套驱动框架,两张考卷都能多拿 3 分以上,「AI 能不能干活」的评价正从「只看模型」转向「模型 + 框架」一起看。分数出自厂商自己的技术报告,先打折记账。
快报 3Artificial Analysis 智能指数(9 月 2 日抓取 · 上期未用过)
大白话|榜首 66 分、第 8 名 61 分,顶级和次顶级只差 5 分,价格差近 4 倍。国产开源 Kimi K3 和智谱 GLM-5.3 挤进头部梯队,单任务成本还压在 1 美元以下,「便宜大碗」在成绩单上第一次有了集体存在感。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
新工具:给 AI 智能体「路上拔网线」,实测 127 毫秒
一篇工程师实测文章:AI 编程智能体跑任务时手里常握着你的云密钥和外网通道,作者做了一套能在任务中途掐断其网络访问的拦截机制,实测从决定到断网只花 127 毫秒,比人反应过来快得多。
一句话点评|「环境说了算」再添一个能落地的样本,护栏不一定拖慢速度。
一个新方法,专门给「考 AI 的考卷」做体检
9 月 2 日凌晨,AI21 团队在 HuggingFace 发布 BenchMIRT:不再只给模型打分,而是反过来审计评测题库本身,检查每道题到底在考什么、有没有被模型「背题」。
一句话点评|考卷先体检,分数才有底气,方向对路。
一个免费 API,把 900 多款 AI 的价目表装进一张实时表
Show HN 项目 Indextkn:976 个模型、17 家厂商的标价实时可查,号称刚刚更新。AI 涨价降价越来越频繁,普通用户想比价终于不用挨家翻官网。
一句话点评|工具免费可查,数据全不全得抽样对一对。
一个 bash 脚本,把 AI 编程助手关进「隔离房」
开源项目 Dev-sandbox:一条脚本让 AI 编程智能体跑在 Podman 隔离容器里,可选更强的 microVM 隔离,专治「AI 握着你主力机的钥匙干活」。
一句话点评|别急着让 AI 碰主力机,先给它一间能随时拆掉的房。
AI 写作检测到底怎么工作?Pangram 创始人出来交底
Complex Systems 播客访谈 AI 写作检测公司 Pangram 的 CEO:检测器的原理、为什么会误判、分数该怎么读,一次性讲透。
一句话点评|延续我们 028 期的立场,检测器只能当提示,不能当判决书。
一个小插件,拦住 AI 写代码时偷偷用旧依赖
开源工具 yul:给 Claude Code 装一道检查,AI 往项目里写新依赖时自动核对版本,过时或不安全的直接拦下。
一句话点评|AI 产量上去了,验证这关就得长在流水线上。
Wasmer 发新 SDK:给 AI 智能体配本地「安全屋」
浏览器公司 Wasmer 推出本地沙箱 SDK,AI 智能体执行的代码被关在独立环境里,不碰宿主机文件系统。
一句话点评|隔离赛道又挤进一个正规军,对普通用户是好事。
一个公开档案馆,收集 AI 智能体干完活留下的痕迹
Show HN 项目 agent-memory-wiki:临时上线的 AI 智能体可以选择留下什么、不带什么,像一个由 AI 自己撰写的实验百科。
一句话点评|想知道 AI 干活时都在想什么,这个档案馆值得围观,内容真假另说。
让 AI 玩「狼人杀」:SquidGPT 淘汰赛开桌
开发者搭了个实验,让多款 AI 模型参加淘汰制博弈游戏,看它们在结盟、欺骗、投票时的表现差异。
一句话点评|博弈类评测比问答更接近智能体的真实水性,围观可以,别当成绩单。
算一笔账:AI 智能体「思考一瓦」 vs 人脑 20 瓦
8 月 31 日的工程博客把 AI 推理能耗和人脑功耗摆在一起算账,结论是人脑 20 瓦的能效依然让最新硬件侧目。
一句话点评|算力焦虑的另一种算法,看个新鲜,估算归估算。
● 多个 AI 编程智能体同时开工互相踩脚?开源协议 Foremerge 想让它们先对暗号再动手(GitHub / HN)
● 工程师分享心得,跟 AI 智能体干活时先声明「我是专家」,它的产出质量不一样(shimin.io / HN)
● 设计博客警告「失控 AI 交易员」,智能体的冒险倾向是出厂属性,不是后天学的(HAIPA / HN)
① 9 月 1 日 Anthropic 新发布的 Fable / Mythos 5.1(更便宜、限制更少)刚上架一天,等第一批用户实测,看「便宜」和「少限制」能不能同时站住。
② Arena 快照 9 月 1 日停更一天,下场更新盯两个新面孔,阿里 Qwen 3.8 Max(代码榜第 3、才 3219 场)和腾讯 Hy4 preview(第 5、1276 场)样本攒厚后名次稳不稳。
③ 华为 openJiuwen 两张考卷的自报分数(82.6%、87.19%),盯第三方有没有复跑,复跑对上了才算立住。
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-09-02
数界工坊 · 全球AI评测雷达