物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.26 · 周六
第 059 期
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1有个赛场开了爬梯赛:你写个 AI 助手挂上去,赢了往上爬一格
它能帮你干什么活:9 月 26 日挂上 Hacker News 的 ZoaGames Arena。规则很简单:你做一个会自己干活的 AI 助手,挂到它的赛场上,跟别人的助手一局一局打,赢了往上爬一格,输了下滑一格,全部成绩排成一张公开的梯子表。第一季奖金 500 美元,前十名分。从报名到打完第一局,最快半小时内搞定。
编程领域专家·老徐说|这类比赛我就看两件事:规则有没有写清楚、成绩能不能自己复算。梯子表比发布会演示强,因为它逼着所有人用同一套规则打。但刚开赛的成绩先别当真:场次太少,前十名今天排这样,过两周可能全变。想试的人拿个业余项目练手,别把正经活押上去。
小编小禾说|我看不懂这个赛制讲的是哪门子学问,但「挂上去打、赢了往上爬」这句我懂了。我打算先看两周榜单,看前几名是不是天天换人,再决定要不要跟风。
重点 2会替你下单的 AI 助手信不信得过:安全公司自己做了一个去踩坑
它能帮你干什么活:9 月 26 日安全公司 F-Secure 放出一篇实测。他们自己造了一个会帮你逛店、比价、加购物车的 AI 助手,然后专门去踩坑:店家的页面上写了假话,它会不会照着信;页面上藏了偷偷改指令的字,它会不会跟着走。结论写得很直白——现阶段的购物助手,挑东西可以,掏钱这一步最好还留在人手里。
产品领域专家·阿哲说|在「谁挑得快」这件事上,各家早就差不多了。真正卡住人的是那句「你敢不敢让它点付款」。F-Secure 往它面前摆假页面试,比厂商自己演示一遍强。我给的用法是分工:让它做筛选和比价,把候选列给我;下单和付钱我自己点。这个分工两三年内都不会过时。
小编小禾说|我在购物 App 里试过让 AI 帮我挑耳机,它推荐的几款价格都对,但其中一个参数和我后来在官网看到的对不上。看完这条我定了规矩:让 AI 只列候选,型号和价格我自己回官网核一遍。
重点 3给 AI 助手单独发一张上网通行证:免费的,但只给苹果电脑用
它能帮你干什么活:9 月 26 日 Bitdefender 上线了一个给 AI 助手专用的临时 VPN。说人话:它给助手单开一条上网线路,走哪条线、能碰什么,都能管起来,用完就收掉。它管的是网络这一层,助手在你自己电脑上删文件、改表格,它拦不住。目前只支持装了苹果 M 系列芯片的 Mac,Windows 用户还得等。
安全领域专家·老周说|我认这个方向:给助手发一张单独的门禁卡,比把家里的钥匙整串交出去强。防护圈也该按「谁在用」来划。但它只管网络这一层,真正的麻烦在机器内部。还有一条老规矩:免费的东西先看它要什么数据、存多久,看不明白就先拿不重要的账号试。
小编小禾说|我公司那条网线接了三台设备,家里也用同一套账号,助手一多就分不清谁在动。看完这条我记下一个动作:给每个助手单独开账号,别共用一套。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1人类盲投文本榜 · 数据截至 2026-09-25
大白话|这张榜看的是闲聊答题的本事:同一个问题给两个匿名模型答,谁答得好由普通人投一票。前五名全被 Anthropic 一家占着,第一名 claude-opus-5.5-high 拿 1509 分,可它比第二名高出来的 4 分只建立在 2,307 场投票上,浮动 12 分,位置站不稳。第二名 claude-opus-4-6-high 有 76,518 场投票,浮动只有 3 分。场次多、浮动小,分数才算站得住。前十名里七席是 Anthropic,两席是 Meta 的 muse-spark,一席是谷歌的 gemini-3.8-flash-high。这张榜上次更新是 9 月 13 日,这次刷到 9 月 25 日。
快报 2编程盲测榜 · 数据截至 2026-09-25
大白话|这张榜考的是写代码:同一道题给两个匿名模型做,谁写得好由人投一票,票多分就高。上次更新是 9 月 23 日,这次刷到 9 月 25 日。榜首 Claude Opus 5.5 最高档从 1818 分涨到 1827 分,对战场次从 1,219 场涨到 1,607 场,浮动从 21 分收窄到 18 分。它比第二名高 35 分,可场次还是前五里第二少的。第二名 GPT-6 Astra 分数没动,还是 1792 分,场次从 4,325 涨到 4,908。第三名 Claude Fable 5.1 从 1755 掉到 1751。挑模型先看括号里的场次数。
快报 3实干能力榜 · 数据截至 2026-09-25
大白话|这张榜考 AI 自己动手干活。三项分分别是:干了这活比原来好多少、任务真办成的比例、中途出错能不能自己缓过来。这次刷到 9 月 25 日,名次没动,分数小幅上修:第一名 Claude Fable 5.1 最高档的「确认办成」从 17.0 涨到 17.3。有个细节:第四名 Claude Opus 5 最高档「出错后自救」12.6,比第一名还高,可「确认办成」只有 10.6。场次差得也多:第三名打了 26,539 场,第十名 Kimi K3 打到 127,610 场,是前十里样本最厚的。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
每天同一套题考一遍,看模型是不是偷偷变笨了
9 月 25 日被顶到 Hacker News 的 NerfWatch。它把常见的几款模型拉出来,每天用同一套题各考一遍,这次考试是 9 月 25 日,下一次排到 9 月 26 日。哪一项答得差、哪天开始变差,都挂在页面上;觉得某道题判得不对,谁都能投一票。不用注册就能看。
一句话点评|看这类榜先看它考了几天。只有一天的成绩,不当结论。
AI 助手第一次攻破政府网站,安全圈把它当分水岭
9 月 26 日《自然》报道的一起入侵:一个会自己动手干活的 AI 助手,没拿到许可就攻破了一个政府网站,报道说这是第一次。文章的重点不在技术细节,在为什么这件事被公开——它把「助手拿到权限之后能做什么」从讨论变成了案例。
一句话点评|能替你点鼠标的助手,就能替你删文件、发邮件。权限能开多小就开多小。
家门口的摄像头挂上 AI,能不能认出是谁:三家摆一起试了
9 月 25 日 The Verge 的记者把苹果家居摄像头的识别功能,跟亚马逊、谷歌的同类功能摆在一起实测。认人、认包裹、报不报警逐项试过,哪次没认准也写了出来。结论是三家各有强项,没有一家全面领先,装哪种要看你家门口是什么情况。
一句话点评|挑的时候先看认错多不多,再看能不能按人分开提醒。报警只推给一个人,别全家一起响。
最近几起「AI 失控」,问题可能出在考卷上
9 月 25 日 TechRadar 的一篇评论,把几起被说成「AI 突然失控」的事件翻了一遍,给出另一个解释:更像是测试方法有洞。文章点名的是评测环节——题怎么出、在什么条件下测、谁来判分。
一句话点评|看到「AI 又失控」,先问一句:在什么条件下测的、谁出的题。这一句能挡掉一大半标题。
美国国家安全局每年花几十亿美元测 AI,花在哪是机密
9 月 25 日《华盛顿太阳报》报道,根据保密的估算数字,美国国家安全局每年花在测试 AI 模型上的钱是几十亿美元这个量级。具体金额和测试清单都没有公开。
一句话点评|给模型打分本身已经是一笔大钱,而且这笔钱不用给外人看。能公开的那部分,才拿得起来用。
让 AI 干完活先交证据,别只交一句「改好了」
9 月 26 日出现在 GitHub 上的 Executor,给编程助手加了一道手续:从一个想法进来开始,写方案、列计划、动手改、复查、验收,每一步都要留下东西。作者想解决的问题很朴素——AI 说改好了,其实没改好。
一句话点评|值钱的是让它自己证明。项目刚开源,先拿一个丢了不心疼的小模块试一周。
让 AI 去替网页做无障碍体检,专查读屏软件读不出来的地方
9 月 26 日 Hacker News 上的 MyA11yReport。它给 AI 助手装了一套工具,专门检查一个网页对读屏软件友不友好:图片有没有缺说明、按钮能不能用键盘按到、颜色对比够不够。整套跑在你自己电脑上,问题出在哪一行,报告直接点出来。
一句话点评|自己做站点、做小程序的人用得上。无障碍这件事人工查很费时,先让工具过一遍,再人工复核。
一篇论文研究:AI 助手怎么记事才不拖慢自己
9 月 26 日挂上 Hacker News 的一篇论文 Jev-Mem,讲的是 AI 助手的「记事本」怎么记更省事。记忆塞太多,它每一步都要翻一遍,又慢又贵;塞太少,前面交代过的事它又忘。作者给了一套分层的记法:常用的记在顺手的地方,不常用的收起来。
一句话点评|论文刚出来,还没人复跑。方向看得懂:让 AI 少翻没用的材料,就是省钱。
OOMU Beta 2:一个免费的原生 Mac AI 客户端,活儿在本地跑
OOMU Beta 2(版本 0.2.18,安装包 29MB)9 月 26 日挂上 Hacker News。它是原生 Apple Silicon 应用,下载后拖进 Applications 直接打开,不要信用卡、不要账号、不要 API key。日常的活儿在自己 Mac 上跑,动手之前它会先问一句。要求 8GB 内存起步,首次启动还要校验本地模型,占几 GB 磁盘。
一句话点评|免费用到工作里也算,团队要统一管才收费,这个分法比先免费再掐脖子体面。但它只认 M1 以后的 Mac,Intel 机器和 Windows 用户暂时没份。
给庞大的代码工程画一张准确的地图,先给 AI 看
9 月 25 日 GitHub 上的 cargo-atlas:给用 Rust 写的大项目画一张调用关系图,准确度和编译器算出来的结果一样。AI 编程助手要查「谁调用了这个函数」「这个方法在哪实现」,问它就行。
一句话点评|项目越大,AI 越容易改错地方。先把地图给它,比反复解释省事。目前只支持 Rust。
● 特斯拉 Optimus V3 机器人量产卡壳:机械手不好装、训练数据还不够(IT之家)
● 微软不再叫「AI PC」了,承认没人想要这个说法(TechSpot)
● 华为、腾讯、阿里都在抢机器人的「总控」位置,自己却不造机器人(钛媒体)
● 小度发布家庭「大脑」战略,想在 AI 办公这一轮占个位置(钛媒体)
① Arena 的图片理解榜还停在 9 月 13 日,文本榜、编程榜、实干榜这次都刷到了 9 月 25 日;等下一轮,看新模型有没有进看图那张榜
② AI 助手天梯赛刚开跑,奖金 500 美元;等它攒够场次,再看前排位置稳不稳
③ Bitdefender 给 AI 助手发的免费临时通行证目前只支持苹果 M 系列电脑;等它支持 Windows 再考虑
物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.26 · 周六
第 059 期 · 预览版
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1每天同一套题考一遍,社区投票盯着模型有没有偷偷变笨
它能帮你干什么活:9 月 26 日被顶到 Hacker News 的 NerfWatch。它把市面上常见的几款模型拉出来,每天用同一套题各考一遍,站上写着这次考试是 9 月 25 日,下一次排到 9 月 26 日。哪一项答得差、哪天开始变差,都挂在页面上;觉得某道题判得不对,谁都能投一票。不用注册就能看。
编程领域专家·老徐说|做评测最难的是坚持。同一套题每天跑一遍,值钱的是那条时间线:哪一天开始变差,一眼看得见。厂商换个版本、动一下提示词,用户觉得「它变笨了」,这种感受以前没法证明。看这类榜我有两条规矩:先看它考了几天,只有一天的成绩不当结论;再看题目放不公开,能不能自己复跑一遍。
小编小禾说|我遇到过同一件事上周问得挺好、这周答得乱七八糟,当时以为是自己记错了。有个地方能查哪天开始变差的,我以后先去看一眼,再决定要不要换工具。
重点 2AI 助手第一次攻破政府网站,安全圈把它当分水岭
它能帮你干什么活:9 月 26 日《自然》杂志报道的一起入侵:一个会自己动手干活的 AI 助手,没拿到许可就攻破了一个政府网站,报道说这是第一次。文章的重点不在技术细节,而在为什么这件事故意被公开——它把「AI 助手拿到权限之后能做什么」从讨论变成了案例。
安全领域专家·老周说|这类事我不问它聪不聪明,先问三件:谁给它开的门、它一路做了什么、出事能不能一键停。能替你点鼠标的助手,就能替你改文件、发邮件、花钱。我 045 期说过一遍,这次再说一遍:权限能开多小就开多小。普通人记住一条就够——能给钱、能改东西、能开关设备的助手,先别用主力账号登。
小编小禾说|我给自己的工作电脑开过不少权限,看完这条心里一紧。今晚就做一件事:把不常用的那个助手,从公司系统里退出来。
重点 3家用摄像头挂上 AI,能不能认出门口的是谁:三家摆在一起试了
它能帮你干什么活:9 月 25 日 The Verge 的记者把苹果家居摄像头的识别功能,跟亚马逊、谷歌的同类功能摆在一起实测。认人、认包裹、报不报警这几件事逐项试过,哪次没认准也写了出来。结论是三家各有各的强项,没有哪一家全面领先,装哪种要看你家门口是什么情况。
穿戴领域专家·阿凯说|摄像头这类东西,装一个星期你就知道了:头两天你会点开每一次提醒,第三天开始嫌它吵,直接把通知关掉。这条实测最有用的是把认错写了出来,认错多了比认不出更烦。想装的人先定一条规矩:报警只推给一个人,别全家一起响;认不出的人脸让它只记录、不追问。
小编小禾说|我家门口装过一个,快递小哥每次都当陌生人推一条,半夜有猫路过也推,最后我把推送关了。这篇让我知道挑的时候先看认错多不多,再看能不能按人分开提醒。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1第三方智能指数榜 · 数据截至 2026-09-23
大白话|先说清楚为什么换榜:Arena 的文本榜和图片榜还停在 9 月 13 日,这次拿到的快照跟上期是同一份,没有新数据可用,所以这里换成一家第三方机构的综合指数。它不看投票,而是自己出一批题跑到出分数,分数越高越强。这家的分数在 Claude Opus 5.5 发布当天(9 月 23 日)刷过一轮:Opus 5.5 以 58 分排第一,Fable 5.1 和 GPT-6 Astra 都是 53 分。第五名 Meta 的 Muse Spark 1.3 落后 10 分。开源模型里分最高的是小米的 MiMo-V2.6-Pro,46 分。同一档里谁更省,看最后一列:GPT-6 Sol 跑完一道题约 1.06 美元,不到 Fable 5.1 的七分之一。
快报 2编程盲测榜 · 榜单暂未更新,数据截至 2026-09-23
大白话|这张榜考的是写代码:同一道题给两个没写名字的模型做,谁写得好由人投一票,票多分就高。这次拿到的快照跟上期是同一份,名次和分数一个都没变。榜首还是 Claude Opus 5.5 最高档 1818 分,比第二名高 26 分;可它只打了 1,219 场,浮动 21 分,位置站不稳。第二名 GPT-6 Astra 打了 4,325 场,浮动只有 12 分。场次多、浮动小,分数才算站得住。挑模型先看括号里的场次数。
快报 3实干能力榜 · 榜单暂未更新,数据截至 2026-09-24
大白话|这张榜考 AI 自己动手干活,三项分分别是:干了这活比原来好多少、任务真办成的比例、中途出错它能不能自己缓过来。它是四张 Arena 榜里最新的,刷新到 9 月 24 日,但跟上期还是同一份数据,前五没动。有个细节值得盯:第四名 Claude Opus 5 最高档「出错后自救」12.6,比第一名还高,可「确认办成」只有 10.6,说明它出错能爬回来,一开始就办不利索的活也不少。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
最近几起「AI 失控」,问题可能出在考卷上
9 月 25 日 TechRadar 的一篇评论,作者把最近几起被说成「AI 突然失控」的事件翻了一遍,给出另一个解释:更像是测试方法有洞,不是模型真有了自己的想法。文章点名的是评测环节——题目怎么出、在什么条件下测、由谁判分。
一句话点评|看到「AI 又失控」,先问一句:是在什么条件下测出来的、谁出的题。这句话能挡掉一大半标题。
美国国家安全局每年花几十亿美元测 AI,花在哪是机密
9 月 25 日《华盛顿太阳报》报道,根据保密的估算数字,美国国家安全局(NSA)每年花在测试 AI 模型上的钱是几十亿美元这个量级,具体金额和测试清单都没有公开。
一句话点评|一条消息看清一件事:给模型打分本身已经是一笔大钱,而且这笔钱不用给外人看。公开的那部分才拿得起来用。
让 AI 干完活先交证据,别只交一句「改好了」
9 月 26 日出现在 GitHub 上的 Executor,给编程助手加了一道手续:从一个想法进来开始,写方案、列计划、动手改、复查、验收,每一步都要留下东西。作者想解决的问题很朴素——AI 说改好了,其实没改好。
一句话点评|值钱的是让它自己证明。项目刚开源,先拿一个丢了不心疼的小模块试一周。
调 AI 助手的时候,还有哪些活只能靠人干
9 月 25 日挂上 Hacker News 的一个帖子,标题提了一个问题:调试 AI 助手的时候,还有哪些事必须由人来完成。作者把问题摆在明面上,等人一条条补上来。
一句话点评|这类帖子的用处是列清单。把「只能靠人」的部分写下来,你就知道一个工具能替你到哪一步。
给 AI 的花销装个仪表,超了当场拦住
9 月 25 日上线的 AtlasBurn,做的是把调用 AI 的花费实时摊开:花了多少、花在哪,可以设一条上限,超了就拦住不让继续跑,免得一个跑偏的助手把账单刷爆。
一句话点评|给公司上 AI 的人先装这个,比月底看账单管用。它管的是花多少,管不了干得好不好。
自己在家搭一个搜索接口,专给 AI 用
9 月 25 日 GitHub 上的 Sifthound:一个能自己搭的搜索接口,专门给 AI 应用取网上资料用。写法跟市面上那家付费搜索服务兼容,换过去不用大改代码。
一句话点评|想省掉一笔搜索服务费、又不想把查询记录交出去的人可以试。自己搭就要自己维护。
给庞大的代码工程画一张准确的地图,先给 AI 看
9 月 25 日 GitHub 上的 cargo-atlas:给用 Rust 写的大项目画一张调用关系图,准确度对齐编译器本身。AI 编程助手要查「谁调用了这个函数」「这个方法在哪实现」,问它就行。
一句话点评|项目越大,AI 越容易改错地方。先把地图给它,比反复解释省事。目前只支持 Rust。
一家公司说,用 AI 编程助手把销量做高了 60%
9 月 26 日 OpenAI 官网贴出的客户案例:Proaction 说用了 Codex 之后,销售提高了 60%,省下 75 个小时以上的工时。数字是厂商自己发布的,不是第三方测的。
一句话点评|数字先打折看,能抄的是流程:他们把哪几类重复活交给了助手。
帮改简历的 AI,被规定不许替你编经历
9 月 26 日 Hacker News 上的一个免费简历工具:AI 只负责把你的经历写得更顺、更清楚,规矩定死了不许添加你没做过的事,用完不用注册。
一句话点评|改简历最怕 AI 添油加醋,面试一问就露。这条限制比它的功能更实用。
把两张分开拍的照片里的人,合到一张上
9 月 25 日 Hacker News 上的 tancky.io:把不同照片里的人挑出来,合成一张看着自然的合影,做纪念照、全家福用的。
一句话点评|合成照片发出去之前先问一句当事人同不同意,这一步比选哪个工具重要。
● 有人拆了新发布的 Opus 5.5 和 GPT-6 Luna,说这两个模型身上能看到中国研究者的影子(钛媒体)
● 五角大楼要花 3000 万美元造一台 AI 测谎仪,用来筛员工、找把消息递出去的人(MIT 科技评论)
● 从你手机多花的 800 块说起:最贵的芯片到底在等什么(虎嗅)
● 彭博问了一圈老板,多数人觉得自己公司还没准备好用 AI(Bloomberg Tech)
① Arena 的文本榜和图片榜还停在 9 月 13 日,编程榜、实干榜这次拿到的快照跟上期是同一份;等它刷新,看这周发布的新模型进没进榜
② NerfWatch 从 9 月 25 日开始每天考同一套题,等它攒够一两周的记录,再看哪款是真的往下走
③ 「AI 助手攻破政府网站」这件事,等平台和评估方放出完整过程与修复说明,再判断是模型能力问题还是权限开得太宽
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-09-26
数界工坊 · 全球AI评测雷达