头条 · 快讯 · 热榜 · Alpha · 评测 · 论坛 · English

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.25 · 周五

第 058 期

重点更新 3 条 · 双专家点评 | 榜单快报 4 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1几个大模型放一起,用同一批活比谁写的代码能跑

它能帮你干什么活:9 月 25 日被顶到 Hacker News 的一篇实测。作者把 Claude Opus 5.5、Claude Fable 5.1、GPT-6 Sol 这几款拉出来,用同一批编程任务挨个跑。他不看厂商海报上的分数,只看同一件事各家交出来的东西能不能直接用,哪一步卡住也写了出来。

编程领域专家·老徐说|第三方拿同一批活对着跑,比厂商自己发的成绩单可信。我盯的还是两样:报错之后它能不能自己改回来,改完的代码我敢不敢合进主干。文章里「卡在哪一步」写得细,这段比结论值钱。真选型别只看这一篇,先拿自己项目里一个丢了不心疼的小模块滚一周。

小编小禾说|我用 AI 写过几个小工具,最烦的是它交的东西看着对、一跑就报错。以后挑工具我多问一句:同一件事换两个人问,它答得一样吗。

来源:Hacker News / Flavio Copes(2026-09-25)

重点 2有人搭了个沙盘,专门测 AI 能不能绕过签名授权

它能帮你干什么活:9 月 25 日 Hacker News 上的一个开源沙盘。它要回答的问题很具体:给 AI 助手一套带签名的授权规则,它会不会绕过去。测试在自己电脑上跑,结果能复现,出题和判分也一并公开。

安全领域专家·老周说|签名授权说白了就是一张带防伪章的通行证,谁拿哪张、能开哪扇门,规则里都写着。这套做法我认:把规则摆在明面上,看它钻不钻得过去,比空谈风险实在。它测的是规则本身漏不漏,不是某一家的产品好不好。真要用,先在自己的隔离环境里跑一遍,别拿生产环境试。

小编小禾说|我给几个助手开过公司系统的权限,看完心里一紧。以后开权限前先问一句:它能碰的东西,是必须碰的吗。

来源:GitHub / Hacker News(2026-09-25)

重点 3新眼镜多花的钱,大多买在「听得清」和「拍得稳」上

它能帮你干什么活:9 月 25 日 Engadget 把 Meta 新款智能眼镜和上一代摆在一起,一项一项比。新款动了通话收声、摄像头画质和电池,价钱也跟着涨。文章给的结论很直白:算一次小步升级,加价却不小。

穿戴领域专家·阿凯说|戴一整天你就知道了:眼镜这东西参数再漂亮,压鼻梁、镜腿发热、续航撑不过半天,最后还是进抽屉。上一代我戴满两周,拍张照得瞪着目标停一秒才按。这代要是真把收声和续航改好,通勤路上接电话确实实用。想买的先做一件事:去店里戴满半小时,再决定要不要多掏这笔加价钱。

小编小禾说|我一直想要副能拍照的眼镜,最怕买回来吃灰。这篇对比帮我定下验收办法:先看电池够不够撑一天,再看拍照要不要人定住不动。

来源:Engadget(2026-09-25)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1编程盲测榜 · 数据截至 2026-09-23

#模型厂商分数(括号里是对战场次和浮动)
1claude-opus-5.5-maxAnthropic1818(1,219 场,上下 21 分)
2gpt-6-astra-maxOpenAI1792(4,325 场,上下 12 分)
3claude-fable-5.1-maxAnthropic1755(4,916 场,上下 11 分)
4claude-opus-5-maxAnthropic1692(14,351 场,上下 7 分)
5gpt-6-sol-maxOpenAI1686(1,521 场,上下 17 分)

大白话|这张榜考的是写代码:同一道题给两个匿名模型做,谁写得好由人投,投得多分就高。这次榜首换人了,Claude Opus 5.5 最高档以 1818 分顶上来,比第二名高 26 分;可它只打了 1,219 场,榜上标的浮动是 21 分,位置还站不稳。第二名 GPT-6 Astra 打了 4,325 场,浮动只有 12 分,谁的分更实一眼看得出。往下第三名是 Anthropic 上一代旗舰 Fable 5.1,第五名是 OpenAI 的 GPT-6 Sol。上次这张榜更新是 9 月 11 日,今天跑到 9 月 23 日,新模型终于进来了。挑模型先看括号里的场次数。

快报 2实干能力榜 · 数据截至 2026-09-24

#模型厂商办成事提升 / 确认办成 / 出错后自救
1Claude Fable 5.1(Max)Anthropic13.4 / 17.0 / 11.6
2GPT 6 Astra(Max)OpenAI11.1 / 13.7 / 6.7
3Claude Opus 5(High)Anthropic9.8 / 7.5 / 11.9
4Claude Opus 5(Max)Anthropic9.5 / 10.6 / 12.6
5Claude Fable 5(High)Anthropic8.4 / 3.5 / 8.5

大白话|这张榜考 AI 自己动手干活,三项分分别是:干了这活比原来好多少、任务真办成的比例、中途出错它能不能自己缓过来。这次刷新到 9 月 24 日,是四张榜里最新的,名次没动,前五还是这五款,但分数都往下修了——第一名 Fable 5.1 的「确认办成」从上次的 19.8 掉到 17.0。有个细节:第四名 Claude Opus 5 最高档「出错后自救」12.6,比第一名还高,可「确认办成」只有 10.6,说明它出错能爬回来,但一开始就办不利索的活也不少。

快报 3人类盲投文本榜 · 榜单暂未更新,数据截至 2026-09-13

#模型厂商分数(括号里是对战场次和浮动)
1claude-fable-5-highAnthropic1506(30,057 场,上下 5 分)
2claude-opus-4-6-highAnthropic1505(71,993 场,上下 4 分)
3claude-opus-4-7-highAnthropic1502(60,002 场,上下 4 分)
4muse-spark-1.2(xHigh)Meta1500(3,227 场,上下 11 分)
5claude-fable-5.1-maxAnthropic1498(5,783 场,上下 8 分)

大白话|这张榜看的是闲聊答题的本事:同一个问题给两个匿名模型答,谁答得好由普通人投一票。前五里四个位置是 Anthropic,Meta 的 muse-spark-1.2 排第四,可它只有 3,227 场投票、浮动 11 分,和第三名只差 2 分,位置还晃。前两名差了 1 分,浮动都在 5 分以内,实际就是并列。这张榜还停在 9 月 13 日,两周没动,这周上的新模型一个都没进来。

快报 4图片理解盲测榜 · 榜单暂未更新,数据截至 2026-09-13

#模型厂商分数(括号里是对战场次和浮动)
1claude-fable-5-highAnthropic1310(11,304 场,上下 8 分)
2qwen3.8-max阿里1302(8,665 场,上下 8 分)
3claude-opus-4-7-highAnthropic1301(21,092 场,上下 7 分)
4claude-opus-4-7Anthropic1300(21,450 场,上下 7 分)
5claude-opus-4-6-highAnthropic1299(20,835 场,上下 7 分)

大白话|这张榜考的是看图干活,比如认图里的东西、读图上的表格。前五名挤在 11 分之内,第三到第五只差 1 分,可浮动都有 7 分,这几家谁排前面真分不出来。阿里的 qwen3.8-max 排第二,是前五里唯一一家非 Anthropic 的,也是唯一一家中国厂商。数据上次更新是 9 月 13 日,同样两周没动。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

AI 写的代码,交给另一个 AI 当测试员

9 月 25 日上线的 Canary 把「验收」做成了一件产品:AI 助手写完代码,它负责把程序跑起来,专挑这次改动可能踩坏的地方动手试,试出问题再交回给人。

一句话点评|思路可以抄,边界也说清了:它只负责挑毛病,改不改、上不上线还是人说了算。

来源:Hacker News / Canary(2026-09-25)

一副扑克机器人整包 1.5MB,在你自己电脑上跑

9 月 24 日 GitHub 上的 QuantPlay:一套用 AI 思路写的扑克程序,整个引擎约 1.5MB,下载一次就能在本机跑,不注册、不连服务器。

一句话点评|想看看 AI 写的小程序能到什么水平,装一个打两局最快。别拿它的表现去推大模型的水平。

来源:GitHub / Hacker News(2026-09-24)

市面上的语音记录笔卖 159 美元,有人花 25 美元自己攒了一台

9 月 25 日 Hacker News 上的 ZephClick:作者嫌这类小硬件太贵,自己搭了台 25 美元的替代品,整理和翻译在自己设备上跑,也能接自己的账号。

一句话点评|愿意动手的人能省一笔钱;不想折腾的人也能看清这类小硬件里有多少是外壳和牌子的钱。

来源:Hacker News / ZephClick(2026-09-25)

算数这件事,有人做了个只在你自己电脑上跑的计算器

9 月 24 日 Hacker News 上的 Axiom:一个本地优先的 AI 计算器,题目只在你自己的设备上算,一步一步把过程写出来,不往云端传。

一句话点评|拿它算账、核对数字,比在聊天框里问一句稳,关键是过程能看见。它算数不等于它懂你的业务,重要数字照样自己再核一遍。

来源:Hacker News / Axiom(2026-09-24)

把论文变成能上手点一下的工具

IEEE Spectrum 在 9 月 24 日介绍了 Paper2agent:把一篇研究论文里写的方法,自动打包成一个能直接调用的工具,别人不用重写一遍代码就能试。

一句话点评|做研究的人省事。普通人也能看懂一点:论文里的本事,正在变成点一下就能试的按钮。

来源:IEEE Spectrum(2026-09-25)

安全团队招了个 AI 实习生,专门去撞自家代码

9 月 25 日 GitHub 安全实验室放出新工具:让 AI 自动给自家代码喂各种乱七八糟的输入,看能不能撞出问题,撞出的每一处都留记录。

一句话点评|冲着「让 AI 先替人找漏洞」去的,适合手上有一堆代码要护的团队。上线前先拿不重要的模块试。

来源:GitHub 博客(2026-09-25)

聊天框不是万能的:什么时候该换个界面让 AI 干活

9 月 25 日 GitHub 官方博客的一篇文章,讲用 AI 写代码的几个常见场景:让它改一小块代码,聊天框合适;让它一次动很多文件时,聊天框反而看不清改了什么。

一句话点评|天天用 AI 干活的人值得读一遍,能少走「一句话下去、页面全乱」的弯路。

来源:GitHub 博客(2026-09-25)

AI 补课和真人补课,学生考 GRE 的成绩差不多

9 月 23 日挂上 arXiv(论文预印本网站,还没走完同行评审)的一篇研究 StudentBench。作者让一批准备考 GRE(美国研究生入学考试)的学生分别用 AI 辅导和真人辅导,最后考试分数的差距很小。题目和评分口径都写在论文里。

一句话点评|「AI 能当便宜的家教」是大方向,但这只是一门考试、一批学生。想拿它给自己补课,先看它讲错的时候你辨不辨得出来。

来源:arXiv / Hacker News(2026-09-23)

给 AI 编程助手配个「查代码的柜子」,整套跑在自己电脑上

9 月 25 日出现在 GitHub 上的 Laya(项目名 SCS):它先把一个代码仓库读完、编成索引,AI 编程助手要查某个函数在哪被用到、谁调了谁,直接问它就行。整套跑在本机,代码不用传出去。

一句话点评|「代码不出门」这点对在公司干活的人有用。项目刚起步,先拿一个不重要的仓库试。

来源:GitHub / Hacker News(2026-09-25)

让人和 AI 都能用一句话查数据库,先把开销压下来

9 月 25 日上 Hacker News 的一篇工程记录:团队做了个叫 Quail 的引擎,专门处理「用一句人话问数据」这类查询,目标是又快又省。作者把卡在哪、怎么绕开都写了出来,代码和思路都摊在明面上。

一句话点评|它讲的是怎么把成本压下来,不是又发明了什么新东西。想给公司上「用嘴查数据」的人,可以先看这篇。

来源:Hacker News / FSDatalab(2026-09-25)

大家都在看 · HOT

●  华为鲲鹏给会自己办事的 AI 助手搭了台「超级计算机」,节点数冲到 4096 个(新智元)

●  Meta 的 Muse 上线 12 天,下载量超过 ChatGPT;团队自曝「灵魂文件」来自另一个开源项目(新智元)

●  安全公司 Darktrace 的 CEO 说,会自动办事的 AI 助手正变成公司里的「新型内鬼」(Bloomberg Tech)

●  Revolut 在英国试点刷脸结账,图的是少一步付款动作(Engadget)

明日关注 · TOMORROW

①  Arena 的文本榜和看图榜还停在 9 月 13 日,等它刷新,看 Claude Opus 5.5、GPT-6 Astra 这批新模型进不进榜

②  Ray-Ban Meta Gen 3 刚开卖,等戴满一周的人回话:镜腿重不重、通话能撑几小时

③  那份「AI 补课和真人补课谁教得好」的考卷是自己出题自己记分,等题目和评分能下载、别人复跑对得上,再拿它当依据

—— 以下为早上预览版 ——

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.25 · 周五

第 058 期 · 预览版

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1新眼镜多花的钱,大多买在「听得清」和「拍得稳」上

它能帮你干什么活:9 月 25 日 Engadget 把 Meta 新款智能眼镜和上一代摆在一起,一项一项比。新款动了通话收声、摄像头画质和电池,价钱也跟着涨了。文章给的结论很直白:这是一次小步升级,而加价不小。

穿戴领域专家·阿凯说|戴一整天你就知道了:眼镜这东西参数再漂亮,压鼻梁、镜腿发热、续航撑不过半天,最后还是进抽屉。上一代我戴满两周,拍张照得瞪着目标停一秒才按。这代要是真把收声和续航改好,通勤路上接电话确实实用。想买的先做一件事:去店里戴满半小时,再决定要不要多掏这笔加价钱。

小编小禾说|我一直想要副能拍照的眼镜,最怕买回来吃灰。这篇对比帮我定下验收办法:先看电池够不够撑一天,再看拍照要不要人定住不动。

来源:Engadget(2026-09-25)

重点 2十个 AI 就 15 个现实难题交作业,判卷的是它们的同类

它能帮你干什么活:9 月 24 日上 Hacker News 的一个实验,把 15 个现实难题丢给十个 AI 助手,每个先各自出方案,再把别人写的那份拿来互相打分。题目、各家答案、谁给谁多少分,全贴在网页上。原页写的日期是 9 月 23 日。

产品领域专家·阿哲说|我老说一句话:打分权从厂商手里拿回来,考卷才值钱。这次连判卷的都不是人,是同期考试的同类,谁也没法提前打招呼。要注意的是题只有 15 道、模型十个,名次会晃,先当方法看,别当权威。

小编小禾说|以后我再看到「某家 AI 拿下第一」的说法,会先问一句:谁判的卷,题目能不能看到。看不到的,我就不当结论用。

来源:Hacker News / Fix the World(2026-09-24)

重点 3有人给 AI 出了道自省题:你犯过的错,能自己接住吗

它能帮你干什么活:9 月 24 日 GitHub 上开源的 tapoo,只考一件事:AI 干砸一次之后,能不能自己发现、自己改回来。作者的说法很直接——各家发布模型时只亮最好成绩,出错之后的表现没人写。

编程领域专家·老徐说|这个思路我认。我们干活最怕的不是它错一次,是它错了还接着往下干,交上来的东西得从头核一遍。挑工具时我会多问一句:出错它报不报,能不能退回上一步。项目刚开源、题量小,先拿丢了不心疼的小模块试一周。

小编小禾说|上周我让 AI 帮我改表格里的公式,它改错了还在那儿一本正经地往下算。现在我让它改完先停下,给我看一遍再动。

来源:GitHub / Hacker News(2026-09-24)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1综合智能榜 · 数据截至 2026-09-25(Artificial Analysis,实时刷新)

#模型厂商综合分
1Claude Opus 5.5(最高档)Anthropic58
2Claude Opus 5.5(次高档)Anthropic56
3Claude Opus 5.5(中档)Anthropic54
4Claude Fable 5.1(最高档)Anthropic53
5GPT-6 Astra(最高档)OpenAI53

大白话|这张榜把知识、做题、写代码、动手办事几项合成一个总分,分越高越全面。前五名里四席是 Anthropic,唯一挤进来的是 OpenAI 的 GPT-6 Astra。同一个模型按「它想多久」分档排,慢慢想的那档分更高。开源阵营最能打的是小米 MiMo-V2.6-Pro,46 分;往后是智谱 GLM-5.3 的 45 分、月之暗面 Kimi K3 的 44 分。这张榜是实时刷新的,今天看和明天看数值可能不一样。

快报 2快慢与花费榜 · 数据截至 2026-09-25(Artificial Analysis,实时刷新)

比什么第一梯队成绩
出字最快Celeris-1每秒约 1505 个字
紧跟其后Mercury 2.5 / Mercury 2每秒约 770 字 / 761 字
干一件活最便宜GPT-6 Luna(低档)约 0.0045 美元
第二、第三便宜Granite 4.2 3B / Ministral 3 3B约 0.01 美元

大白话|同一天、同一家的数据,换个角度就完全不同:综合分排第一的那几款,这张榜上一个都没进。出字最快的那两款是专为「秒回」做的;最便宜的前三名全是小模型,本事有限、胜在便宜。挑工具按自己的活对号入座:偶尔用一次看单价,天天用看速度和月账单。

快报 3人类盲投文本榜 · 榜单暂未更新,数据截至 2026-09-13

#模型厂商分数(括号里是多少场投票)
1claude-fable-5-highAnthropic1506(30,057 场)
2claude-opus-4-6-highAnthropic1505(71,993 场)
3claude-opus-4-7-highAnthropic1502(60,002 场)
4muse-spark-1.2(xHigh)Meta1500(3,227 场)
5claude-fable-5.1-maxAnthropic1498(5,783 场)

大白话|这张榜的分来自普通人一对一投票:同一个问题给两个匿名模型答,谁答得好由人投,投得多分就高。前五名里四席是 Anthropic;Meta 的 muse-spark-1.2 排第四,可它只有 3,227 场投票,和第三名只差 2 分,位置还站不稳。快照仍停在 9 月 13 日,两周没动,这周上线的新模型一个都没进来。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

Meta 出了个长得像电子宠物蛋的 AI 小玩意

9 月 24 日 TechCrunch 报道,Meta 新发布的 Muse Charm 外形像上世纪流行过的电子宠物蛋,卖点是让 AI 变得好玩、好接近,而不是又一个冷冰冰的聊天框。文章把问题直接摆在台面上:它能让普通人愿意开始用 AI,还是又一次叫好不叫座。

一句话点评|看热闹可以,掏钱先别急:消费级 AI 硬件这几年翻车的不少,先看它上市后能不能留下来。

来源:TechCrunch(2026-09-24)

AI 写的代码,交给另一个 AI 当测试员

9 月 25 日上线的 Canary 把「验收」做成了一件产品:AI 助手写完代码,它负责把程序跑起来,专挑这次改动可能踩坏的地方动手试,试出问题再交回给人。

一句话点评|思路可以抄,边界也说清了:它只负责挑毛病,改不改、上不上线还是人说了算。

来源:Hacker News / Canary(2026-09-25)

一副扑克机器人整包 1.5MB,在你自己电脑上跑

9 月 24 日 GitHub 上的 QuantPlay:一套用 AI 思路写的扑克程序,整个引擎约 1.5MB,下载一次就能在本机跑,不注册、不连服务器。

一句话点评|想看看 AI 写的小程序能到什么水平,装一个打两局最快。别拿它的表现去推大模型的水平。

来源:GitHub / Hacker News(2026-09-24)

市面上的语音记录笔卖 159 美元,有人花 25 美元自己攒了一台

9 月 25 日 Hacker News 上的 ZephClick:作者嫌这类小硬件太贵,自己搭了台 25 美元的替代品,整理和翻译在自己设备上跑,也能接自己的账号。

一句话点评|愿意动手的人能省一笔钱;不想折腾的人也能看清这类小硬件里有多少是外壳和牌子的钱。

来源:Hacker News / ZephClick(2026-09-25)

算数这件事,有人做了个只在你自己电脑上跑的计算器

9 月 24 日 Hacker News 上的 Axiom:一个本地优先的 AI 计算器,题目只在你自己的设备上算,一步一步把过程写出来,不往云端传。

一句话点评|拿它算账、核对数字,比在聊天框里问一句稳,关键是过程能看见。它算数不等于它懂你的业务,重要数字照样自己再核一遍。

来源:Hacker News / Axiom(2026-09-24)

把论文变成能上手点一下的工具

IEEE Spectrum 在 9 月 24 日介绍了 Paper2agent:把一篇研究论文里写的方法,自动打包成一个能直接调用的工具,别人不用重写一遍代码就能试。

一句话点评|做研究的人省事。普通人也能看懂一点:论文里的本事,正在变成点一下就能试的按钮。

来源:IEEE Spectrum(2026-09-25)

给水电医疗这些关键设施做体检,AI 先扫一遍露出在外的门

9 月 24 日 Wiz 和谷歌 DeepMind 一起发布的行动:用 AI 帮着扫描关键设施的对外入口,把「没锁好的门」列出来,再交给人处置。

一句话点评|方向对,也提醒一件事:扫出来的只是线索,谁去补锁、先补哪扇门,还得人来定。

来源:Wiz 博客 / DeepMind(2026-09-24)

安全团队招了个 AI 实习生,专门去撞自家代码

9 月 25 日 GitHub 安全实验室放出新工具:让 AI 自动给自家代码喂各种乱七八糟的输入,看能不能撞出问题,撞出的每一处都留记录。

一句话点评|冲着「让 AI 先替人找漏洞」去的,适合手上有一堆代码要护的团队。上线前先拿不重要的模块试。

来源:GitHub 博客(2026-09-25)

聊天框不是万能的:什么时候该换个界面让 AI 干活

9 月 25 日 GitHub 官方博客的一篇文章,讲用 AI 写代码的几个常见场景:让它改一小块代码,聊天框合适;让它一次动很多文件时,聊天框反而看不清改了什么。

一句话点评|天天用 AI 干活的人值得读一遍,能少走「一句话下去、页面全乱」的弯路。

来源:GitHub 博客(2026-09-25)

按住一个键说话,松手文字就出现在光标处

9 月 24 日 Hacker News 上有人分享了自己做的小工具 Szept:按住 fn 键对着电脑说话,松手后文字直接落在光标所在的位置,任何软件里都能用;说错了按 Esc 丢掉。它主打轻量,录音和转写都在本机完成。

一句话点评|常往输入框里写字的人可以留意这类「说完就走」的小工具,比打开一个大会软件顺手。

来源:Hacker News(2026-09-24)

大家都在看 · HOT

●  安全公司 Darktrace 的 CEO 说,会自动办事的 AI 助手正变成公司里的「新型内鬼」(Bloomberg Tech)

●  一家公司把新员工的 AI 权限全关了,先让人自己上手再逐步放开(Hacker News / Valon)

●  麦当劳的 AI 得来速点单员 Archy 上线,能用英语和西班牙语接单(Bloomberg Tech)

●  Revolut 在英国试点刷脸结账,图的是少一步付款动作(Engadget)

明日关注 · TOMORROW

①  Arena 那几个盲投榜还停在 9 月 13 到 15 日的快照,等它刷新,看 Claude Opus 5.5、GPT-6 Astra 这批新模型进不进榜

②  Ray-Ban Meta Gen 3 才开卖,等戴满一周的人回话:镜腿重不重、通话能撑几小时

③  tapoo 那份「出错后自愈」考卷是自己出题自己记分,等别人拿同一批题复跑,看名次对不对得上

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-09-25

数界工坊 · 全球AI评测雷达