头条 · 快讯 · 热榜 · Alpha · 评测 · 论坛 · English

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.10.02 · 周五

第 065 期

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1不告诉 AI 错在哪,它基本找不出来

它能帮你干什么活:有人做了一张新考卷,叫 SWE-sweep。它把一整个真实的代码仓库交给 AI,只说一句「这里头有错,你自己找」,哪个文件、哪一行、什么毛病,一句提示都不给。结果大多数 AI 交了白卷:只有明确告诉它「错在哪」,它才能顺手修好。

编程领域专家·老徐说|这正戳中我平时最头疼的地方。真项目里的毛病,没人会先给你标好位置,能自己找出来才算本事。它现在找不到,说明你让它干活,还得自己先把范围圈小。想试就先拿一个丢了不心疼的小仓库滚一周,别直接上你在维护的那套。

小编小禾说|我不写代码,但这条我听懂了。它说的是:AI 像个只会照着答案改的学生,题目得你先出好。以后让它查东西,我会先把「大概哪儿不对」讲清楚,不然它多半答不上来。

来源:Hacker News(2026-10-01)

重点 2给 AI 助手打分:0 到 100,还能看它一版一版的变化

它能帮你干什么活:有人做了个免费工具,叫 Braxis。它先读你项目里的说明文件,自动生成一份给 AI 看的「工作手册」,再拿这份手册给 AI 助手打分:最低 0 分,最高 100 分。更实用的是它留了历史,同一个助手换过几版,分是涨了还是掉了,翻一翻就能看到。

安全领域专家·老周说|我平时最怕的就是「换个模型,活就干砸了」这种说不清的账。现在换版本前后各打一次分,掉没掉一眼看得到,不用凭感觉。不过别拿这个分去比谁家模型更强,先把它当自己项目的体检表,盯同一套活有没有退步。

小编小禾说|我不写代码,但「0 到 100 分、还留历史」这个思路我听懂了。以后同一个活,我隔一阵再让 AI 做一遍,好有个对照,不至于它悄悄变差了都不知道。

来源:Hacker News(2026-10-01)

重点 3谷歌 Gemini 4 Argon 杀回前三,跑同样的活只要对手五分之一的钱

它能帮你干什么活:谷歌新出的 Gemini 4 Argon,在一份靠真人盲投的模型榜上杀回前三,分数已经追平 OpenAI 的 GPT-6 Astra。更实在的一点是花钱:跑同样的活,它按字数算的费用大约只有对手的五分之一。

产品领域专家·阿哲说|同一档的本事,价差五倍,这事会先改变「谁被经常用」。挑工具别只看谁第一,先看用起来贵不贵。便宜的那家愿意让你试,你就真拿自己平时那点活跑一遍,别停在发布会上的数字。

小编小禾说|「用一次的钱只要五分之一」这句我记住了。等我常用来写东西的那个工具出新版,我先拿一件不急的小事试,好用再换,不跟着榜单第一瞎换。

来源:新智元(2026-10-02)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1人类盲投文本榜 · 榜单暂未更新(数据截至 2026-09-30)

#模型厂商盲投得分(场次)
1gemini-4-argon-highGoogle1525(4,942 场)
2claude-opus-4-6-highAnthropic1505(77,193 场)
3claude-fable-5-highAnthropic1505(37,900 场)
4claude-opus-5.5-highAnthropic1504(3,932 场)
5claude-opus-4-7-highAnthropic1502(64,607 场)

大白话|这张榜是人类一对一投票投出来的:两个人拿同一个问题的两份答案,谁也不知道哪份是哪家做的,凭感觉选。本期没更新,数据截至 2026-09-30。头名是谷歌的 Gemini 4 Argon,但它只攒了不到 5,000 票,位置还在晃;第二名有 7 万多票,靠得住得多。名次先别拿来挑工具。

快报 2编程榜 · 榜单已更新(数据截至 2026-10-01)

#模型厂商盲投得分(场次)
1claude-opus-5.5-maxAnthropic1815(2,062 场)
2gpt-6-astra-maxOpenAI1788(6,123 场)
3claude-sonnet-5.5-xhighAnthropic1786(1,531 场)
4gpt-6.1-sol-maxOpenAI1758(1,620 场)
5claude-fable-5.1-maxAnthropic1749(6,318 场)

大白话|这组专门考写代码,靠真人两两盲投,这一版刚更新,数据截至 2026-10-01。榜首是 Anthropic 的 Opus 5.5,紧跟 OpenAI 的 GPT-6 Astra;新面孔 Sonnet 5.5 直接冲到第三。挑写代码的 AI,先看括号里的场次够不够多——头名才两千场出头,第二名有六千多场,更稳。

快报 3实干能力榜 · 榜单暂未更新(数据截至 2026-09-30)

#模型厂商净改进分
1Claude Fable 5.1 (Max)Anthropic14.55
2Claude Opus 5.5 (High)Anthropic13.78
3GPT 6 Astra (Max)OpenAI12.18
4GPT 6 Sol (Max)OpenAI10.65
5Claude Opus 5 (High)Anthropic8.76

大白话|这组考的是让 AI 真上手干活(替你点鼠标、改文件)之后,事到底办成没有。分数叫净改进分,意思是比原来好了多少,分越高越好。本期没更新,数据截至 2026-09-30。头名还是 Anthropic 的 Fable 5.1。名次先记账,等它稳住一两轮再当真。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

看猫的照片,AI 就学会做没见过的题

何恺明团队发了份新研究:先让 AI 看大量猫的照片,再看一张专考「没见过的新题」的卷子。这种卷子不许背题,只考能不能找到规律、举一反三。他们的做法,让 AI 在这类题上抓住了没教过的规律。

一句话点评|会背题不算本事,会做没做过的新题才算。

来源:量子位(2026-10-01)

日本三个人做的 AI,在找漏洞比赛里拿了第一

一家只有三个人的日本公司 Layer8,做了个专找网站漏洞的 AI,叫 Trident。它参加了漏洞悬赏平台 HackerOne 的 2026 年第三季度排名,拿了第一(这种平台,是网站花钱请人来帮自己找漏洞的地方)。

一句话点评|会找漏洞的 AI 也能被反过来用,权限边界得先划清。

来源:Hacker News(2026-10-01)

同一句「很可能」,AI 和你心里想的概率不一样

一篇新研究把带概率词的句子同时交给人和几家 AI,看双方把这些词当成多大的概率来理解。结论是两边对不上:你觉得「很可能」是七八成,它可能按另一种数来算。研究者的说法是,这跟模型练的时候看了什么料有关。

一句话点评|跟 AI 打交道,别用「很可能」「八成」这种模糊词,直接给个数更靠谱。

来源:Arxiv LG(2026-10-01)

给企业里的 AI 助手造训练数据,ServiceNow 放出一套现成做法

ServiceNow 的团队放出一套叫 AutoSynthData 的做法,专门用来自动造训练数据,喂给在企业里干活的 AI 助手。它的思路是先把业务场景里的假数据造出来,再拿这批数据教助手怎么应付真实流程,省掉人工一条条编的功夫。

一句话点评|教 AI 干活的料能自动造出来,落地那一步的成本就降下来了。

来源:HuggingFace(2026-10-01)

一份会每周重排的榜:167 个给 AI 搭干活流程的框架都在上面

有人建了一个榜单,收罗了 167 个帮 AI 干活的框架(框架,就是给 AI 搭好的一套干活流程)。它的做法是打一次分不算完,每周重新排一次,谁进步谁退步一眼看得到。

一句话点评|每周重排的榜比一次性排名诚实,别只看今天的名次。

来源:Hacker News(2026-10-02)

让 AI 改代码,怎么保证它的错碰不到线上那套

一位开发者写了篇实操文,讲他怎么给「AI 帮改代码」这件事加上一道道关卡:先在单独的副本里改,自动跑一遍检查,人来点头,最后才轮到线上。他算过账,现在搭这套流程便宜得多,所以不必再图省事让 AI 直接动手。

一句话点评|给 AI 开权限之前,先给它一块出错了也不心疼的地方。

来源:Hacker News(2026-10-01)

Cloudflare 开源了一批「做判断用」的小模型

Cloudflare 放出一组小模型,专干判断类的活,比如把一个请求分到哪条流程、一封邮件算不算可疑。模型开源,还配了个平台,能喂自己的数据把它练得更合你意。它想解决的是:很多判断不用请大模型,养个又小又便宜的够用。

一句话点评|不是所有判断都得请大模型出场,小模型够用还省钱。

来源:Cloudflare Blog(2026-10-01)

英伟达出了套工具,专门把乱来的 AI 关禁闭

英伟达发布一套开源安全工具,用来管住不听话的 AI 助手。招牌本事是「隔离」:发现某个 AI 在乱来,能在千分之几秒里把它单独关起来,不让它碰别的。硬件加软件一起上。

一句话点评|给 AI 装个能一键关禁闭的开关,比事后追责实在。

来源:Tom's Hardware(2026-10-02)

十年过去了,今天的 AI 还是不会「像人那样想事」

MIT 科技评论一篇长文回看:十年前 AlphaGo 赢了围棋冠军,大家以为机器要会思考了。十年后作者说,今天的 AI 依然没摸到那套东西——它答得越来越顺,但不是靠讲道理一步步推出来的。文章提醒,别把「答得对」当成「真会想」。

一句话点评|别被它顺口的答案骗了,要紧的事还是自己核一遍。

来源:MIT TechReview(2026-10-02)

训练 AI 时把数字精度压到 4 位,这篇论文想让速度再快一截

一篇新论文盯上的是训练里的数字精度:常见的训练用 16 位来表示一个数,它想压到 4 位(FP4,位数越少,占的显存和耗的电就越少)。做法是对不同格式的数据分开处理、再合到一起,目标是低精度也能训得又快又稳。

一句话点评|省显存和电,一直是训练 AI 最实在的一笔账。

来源:Arxiv LG(2026-10-01)

大家都在看 · HOT

●  给 AI 助手打分的小工具:0 到 100,还留历史(Braxis)

●  谷歌 Gemini 4 Argon 杀回前三,跑同样的活只要对手五分之一的钱(新智元)

●  新考卷实锤:不圈出范围,AI 基本找不出代码里的错(SWE-sweep)

●  日本三人小队做的 AI,在漏洞悬赏平台拿了季度第一(Layer8)

●  一份每周重排的榜:167 个给 AI 搭干活流程的框架都在上面(Best-of-Agent-Harnesses)

明日关注 · TOMORROW

①  微软那张「不圈范围就找不出错」的新考卷,盯有没有人拿别家 AI 复跑一遍。

②  Gemini 4 Argon 那个低价,盯它经不经得起复跑、名次稳不稳。

③  新研究说人和 AI 对「很可能」的理解对不上,盯有没有人拿中文模型再跑一遍。

—— 以下为早上预览版 ——

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.10.02 · 周五

第 065 期 · 预览版

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1不告诉 AI 错在哪,它基本找不出来

它能帮你干什么活:有人做了一张新考卷,叫 SWE-sweep。它把一整个真实的代码仓库交给 AI,只说一句「这里头有错,你自己找」,哪个文件、哪一行、什么毛病,一句提示都不给。结果大多数 AI 交了白卷:只有明确告诉它「错在哪」,它才能顺手修好。

编程领域专家·老徐说|这正戳中我平时最头疼的地方。真项目里的毛病,没人会先给你标好位置,能自己找出来才算本事。它现在找不到,说明你让它干活,还得自己先把范围圈小。想试就先拿一个丢了不心疼的小仓库滚一周,别直接上你在维护的那套。

小编小禾说|我不写代码,但这条我听懂了。它说的是:AI 像个只会照着答案改的学生,题目得你先出好。以后让它查东西,我会先把「大概哪儿不对」讲清楚,不然它多半答不上来。

来源:Hacker News(2026-10-01)

重点 2日本三个人做的 AI,在找漏洞比赛里拿了第一

它能帮你干什么活:有家日本小公司叫 Layer8,只有三个人。他们做了个专找网站漏洞的 AI,叫 Trident。它参加漏洞悬赏平台 HackerOne 的 2026 年第三季度排名(付钱请人来找自家网站漏洞的地方),拿了第一。也就是这一季在同一个平台上,它比多数人类找得又好又多。

安全领域专家·老周说|会找漏洞的 AI,也能被反过来用。这类工具我不问它多聪明,先问三件:谁授权它扫、它一路做了什么、出事能不能一键停。企业拿它去练自家靶场没问题,别对外乱扫。个人的动作很实在:网站该打的补丁别拖。

小编小禾说|我想到的是反过来那面:找漏洞的 AI 厉害了,那使坏的 AI 是不是也厉害了。这条让我更不敢把公司系统乱开权限,退掉不常用的助手那件事,我这周就办。

来源:Hacker News(2026-10-01)

重点 3看猫的照片,AI 就学会做没见过的题

它能帮你干什么活:何恺明团队发了份新研究。他们先让 AI 看大量猫的照片,再看一种专考「没见过的新题」的卷子,叫 ARC。这种卷子不许背题,考的是能不能找到规律、举一反三。他们的做法,让 AI 在这类题上抓住了没教过的规律。

产品领域专家·阿哲说|现在的 AI 大多是背题高手,碰没教过的题就露怯。谁先真会举一反三,谁才敢把更自主的活交给它。挑工具的人记一句:别只看它答过多少题,看它碰到新题稳不稳。这事离普通人还有距离,先记下方向,不用急着换手上那套。

小编小禾说|这条对我来说偏虚,但我记住一句话:会背题不等于会想事。我平时用 AI,最烦它一本正经地胡说。以后碰上要紧的事,我还是自己再核一遍。

来源:量子位(2026-10-01)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1人类盲投文本榜 · 榜单暂未更新(数据截至 2026-09-30)

#模型厂商盲投得分(场次)
1gemini-4-argon-highGoogle1525(4,942 场)
2claude-opus-4-6-highAnthropic1505(77,193 场)
3claude-fable-5-highAnthropic1505(37,900 场)
4claude-opus-5.5-highAnthropic1504(3,932 场)
5claude-opus-4-7-highAnthropic1502(64,607 场)

大白话|这张榜是人类一对一投票投出来的:两个人拿同一个问题的两份答案,谁也不知道哪份是哪家做的,凭感觉选。榜单暂未更新:最新快照还是 2026-10-01 那一份,跟上期完全相同,榜单自身的更新日停在 2026-09-30。名次先别拿来挑工具。头名是谷歌的 Gemini 4 Argon,但它只攒了不到 5,000 票,位置还在晃;第二名有 7 万多票,更靠得住。

快报 2编程榜 · 榜单暂未更新(数据截至 2026-09-30)

#模型厂商盲投得分(场次)
1claude-opus-5.5-maxAnthropic1818(1,976 场)
2gpt-6-astra-maxOpenAI1789(5,918 场)
3gpt-6.1-sol-maxOpenAI1759(1,264 场)
4claude-fable-5.1-maxAnthropic1751(6,137 场)
5claude-sonnet-5.5-highAnthropic1709(1,810 场)

大白话|这组专门考写代码,靠真人两两盲投。本期同样没更新,数据截至 2026-09-30。榜首是 Anthropic 的 Opus 5.5,紧跟 OpenAI 的 GPT-6 Astra。头名只攒了不到两千场,位置还不稳;第四名有六千多场,更靠得住。挑写代码的 AI,先看括号里的场次够不够多。

快报 3实干能力榜 · 榜单暂未更新(数据截至 2026-09-30)

#模型厂商净改进分
1Claude Fable 5.1 (Max)Anthropic14.55
2Claude Opus 5.5 (High)Anthropic13.78
3GPT 6 Astra (Max)OpenAI12.18
4GPT 6 Sol (Max)OpenAI10.65
5Claude Opus 5 (High)Anthropic8.76

大白话|这组考的是让 AI 真上手干活(替你点鼠标、改文件)之后,有没有把事办成。分数叫净改进分,意思是比原来好了多少,分越高越好。本期没更新,数据截至 2026-09-30。头名还是 Anthropic 的 Fable 5.1。名次先记账,等它稳住一两轮再说。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

一个只会从清单里挑选项的模型,学不会说话

有人拿 typesafe.ai 的 Jev 模型做了个小实验。这个模型的特点是:它不自己编句子,只能从一张写好的清单里挑一个选项。实验想看看这样「只挑不写」的模型能不能学会说人话。结论是:不行。项目代码放在 GitHub 上,谁都能复看。

一句话点评|把话说死到只能挑选项,确实省了钱,但也换不来会聊天。

来源:Hacker News(2026-10-02)

盘点:让机器人动起来的 AI,现在是什么水平

有人写了一篇长文,把当前人形机器人背后那套 AI 梳理了一遍。讲到 NEURA Robotics 等几家公司各自的路子,也讲了机器人在真实环境里怎么感知、怎么迈步。不是产品广告,是行业科普。

一句话点评|机器人离进家门还早,先看清它现在到底会什么、不会什么。

来源:Hacker News(2026-10-01)

为什么大模型没有变成只回背的复读机

一篇科普讲了个反直觉的现象:模型越大,按理说越容易偷懒照抄训练材料,可它偏偏没有。文章解释了大模型是怎么在大量例子里抓规律、而不是把例子整段背下来。看懂它,就明白为什么它有时能答没教过的题,有时又一本正经地胡说。

一句话点评|抓规律是真本事,会胡说也是真毛病,两头都得防。

来源:Hacker News(2026-10-02)

每一步都批准过,整件事还是办错了

一篇分析讲了一种新麻烦:以前 AI 出错,是它直接答错。现在它替你办事,每一步单独看都合规矩、都有人点过头,可几件事串起来,整体结果还是错的。文章说,光盯着每一步放不放行,已经不够了。

一句话点评|管事不能只看每个动作合不合规,得回头看整件事办成没有。

来源:Hacker News(2026-10-01)

Cloudflare 开源了一批「做判断用」的小模型

Cloudflare 放出了自己的一组小模型,专干「判断」这类活,比如把一个请求分到哪条流程、一封邮件算不算可疑。这些模型开源,还配了一个能自己喂数据、把它练得更合你意的平台。它想解决的是:很多判断不用麻烦大模型,养个又小又便宜的就够。

一句话点评|不是所有判断都得请大模型出场,小模型够用还省钱。

来源:Cloudflare Blog(2026-10-01)

英伟达出了套工具,专门关「乱来的 AI」禁闭

英伟达发布了一套开源的安全工具,用来管住不听话的 AI 助手。它的招牌本事是「隔离」:发现某个 AI 在乱来,能在千分之几秒内把它单独关起来、不让它碰别的。硬件加软件一起上。

一句话点评|给 AI 装个能一键关禁闭的开关,比事后追责实在。

来源:Tom's Hardware(2026-10-02)

给写代码的 AI 一间互不打扰的独立小房间

GitHub 上有个开源项目,给写代码的 AI 各自开一间隔离的小环境:一个 AI 一间房,跑起来互不干扰,也不会碰坏你本机的文件。适合你同时放好几个 AI 一起干活、又怕它们互相踩脚的时候。

一句话点评|让多个 AI 并行干活,先把它们隔开,出事也不连带。

来源:Hacker News(2026-10-02)

把 AI 干过的活录下来,下次直接回放

这个开源工具的思路是:让 AI 先完整干一遍活,全程录下来;下次遇到同样的活,直接照录像快速放一遍,只在真正需要判断的地方才叫上 AI。它想省的是「同一件事反复烧钱」这笔账。

一句话点评|重复的活没必要每次重新花钱,录一遍、回放着用。

来源:Hacker News(2026-10-01)

一个小命令,帮好几个 AI 在同一份代码上各干各的

Worktrunk 是个命令行小工具,管的是代码的「分岔路口」。多个 AI 要在同一份代码上同时开工时,它给每个 AI 开一条互不干扰的分支,谁改了什么分得清清楚楚,合到一起时不打架。

一句话点评|多个 AI 同时改代码,先分好支线,比事后找冲突省心。

来源:Hacker News(2026-10-02)

有人把「训练大模型」的整套工具箱开源了

艾伦人工智能研究院发布了 Olmo-core 3,把自己搭大模型用的那套训练工具全公开了,主打能训练「混合专家」这类结构的大模型(一种把大模型拆成多个小组、每次只叫醒几组的省力做法)。代码开源,想自己练模型的人能照着来。

一句话点评|训练大模型的「配方」越公开,后来者越容易上手。

来源:HuggingFace(2026-10-01)

大家都在看 · HOT

●  谷歌 Gemini 4 Argon 上线当天,同时出现在好几个榜单的第一名(Arena)

●  日本三人小队做的 AI,在漏洞悬赏平台拿季度第一(Layer8)

●  英伟达放出能一键隔离乱来 AI 的开源安全工具(Tom's Hardware)

●  新考卷实锤:不圈出范围,AI 基本找不出代码里的错(SWE-sweep)

●  何恺明团队:看猫片就能让 AI 学会做没见过的题(量子位)

明日关注 · TOMORROW

①  榜单这期没更新,盯 Arena 这几天会不会重算,或有没有新榜接上。

②  那张「不圈范围就找不出错」的新考卷,盯有没有人拿别家 AI 复跑一遍。

③  AI 找漏洞拿了第一,盯这套工具会不会被要求公开授权、一路留痕。

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-10-02

数界工坊 · 全球AI评测雷达