物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.23 · 周三

第 056 期

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1扫地机老手的长测推荐:科沃斯 X8 Pro Omni,同门 Max 便宜一大截

它能帮你干什么活:9 月 22 日,TechRadar 一位常年测扫地机的编辑写下自己的推荐:科沃斯 X8 Pro Omni 适合大多数人,但同门的 Max 版本便宜得多,作者给的价格是 899 澳元。这类稿子给的是作者自己长期用下来的感受,不是第三方机构跑出来的标准成绩。

穿戴领域专家·阿凯说|扫地机吃灰,多半卡在基站维护和充电顺不顺手这两件事上,跟扫得干不干净关系不大。这篇最值钱的部分是边角覆盖和基站清理这两段,宣传页从来不写。899 澳元这一档值不值,看你家有没有地毯、有没有掉毛的宠物。

小编小禾说|我家那只天天躺墙角,缠头发、撞桌腿。买之前我就问两个实在的问题:基站用不用我天天清理、它认不认我家沙发腿。便宜那档和贵的那档差在哪,等有人用满三个月再说。

来源:TechRadar(2026-09-22)

重点 2Rabbit 把新 AI 助手搬出那台小机器:不买硬件也能用

它能帮你干什么活:9 月 22 日,The Verge 报道 Rabbit 上线了新的 AI 助手 OS3,不用买它家那台 R1 设备也能用。Rabbit 是靠 R1 那台小机器出的名,当年也因为响应慢、说好的功能没兑现被骂得很惨,这次改成了纯软件的路子。

产品领域专家·阿哲说|硬件公司回头做软件,通常说明硬件那条路没走通。看它这次值不值得试,就盯一件事:要装的东西越少越好,最好打开一个网页就能用。R1 的老用户先别高兴,还得看老设备能不能继续用。

小编小禾说|这东西当年被骂成那样,现在说不用买设备了,我倒是愿意试一下网页版。要是还得先注册、排队、绑卡,那就还是算了,等第二批人用完再说。

来源:The Verge(2026-09-22)

重点 3一位开发者把 Devin 的新版本用了一轮,写下了卡住的地方

它能帮你干什么活:9 月 22 日,一位开发者在自己的博客上贴出 Devin 的上手记录。他把这一套都试了一遍:桌面应用、命令行工具、新出的写代码模型 SWE-2(Devin 自家的模型),以及把几个模型合起来用的模式。Devin 是能自己读代码、自己改文件的 AI 编程工具。这篇是个人试用记录,没有公开跑分。

编程领域专家·老徐说|单人一次上手的记录,值钱的地方是它写了哪一步卡住。我看这类文章先找两样东西:仓库有多大、报错之后它能不能自己改回来。这两样官方演示里从来不提。要接自己的项目,先拿丢了不心疼的小模块滚一周。

小编小禾说|我看不懂 SWE-2 是什么,只关心它能不能把我那个跑了三年的小项目改明白。要是得先把项目怎么启动教给它,那还不如我自己动手。先记账,等第二个人贴出跑通自己项目的记录再考虑。

来源:catalins.tech(2026-09-22)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1文本盲测榜 · 榜单暂未更新,数据截至 2026-09-21

#模型厂商分数(人类投票算出来的)
1claude-fable-5-highAnthropic1506(30,057 场,上下 5 分)
2claude-opus-4-6-highAnthropic1505(71,993 场,上下 4 分)
3claude-opus-4-7-highAnthropic1502(60,002 场,上下 4 分)
4muse-spark-1.2 (xHigh)Meta1500(3,227 场,上下 11 分)
5claude-fable-5.1-maxAnthropic1498(5,783 场,上下 8 分)

大白话|这张榜的上榜数据是 9 月 13 日更新的,到今天十天没动。前五名只差 8 分,头名和第五名基本算打平。第四名是 Meta 的 Muse Spark,只打了 3,227 场,榜上标的浮动是 11 分,比它跟第三名差的 2 分大得多。前五名里四席是 Anthropic 的 Claude,头两名之间只隔 1 分。

快报 2编程盲测榜 · 榜单暂未更新,数据截至 2026-09-21

#模型厂商分数(括号里是对战场次和浮动)
1gpt-6-astra-maxOpenAI1800(2,281 场,上下 16 分)
2claude-fable-5.1-maxAnthropic1758(3,036 场,上下 14 分)
3claude-opus-5-maxAnthropic1687(12,087 场,上下 7 分)
4qwen3.8-max-0902阿里1681(2,262 场,上下 15 分)
5kimi-k3-max月之暗面1674(4,547 场,上下 11 分)

大白话|榜首 1800 分,比第二名高 42 分,看着很稳,可它只有 2,281 场、浮动 16 分;第三名一万两千多场,浮动只有 7 分。这张榜上次更新是 9 月 11 日,十二天没动,昨天和今天上线的新模型一个都没进榜。挑模型别只看名次,先看括号里的场次。

快报 3图片理解盲测榜 · 榜单暂未更新,数据截至 2026-09-21

#模型厂商分数(括号里是对战场次和浮动)
1claude-fable-5-highAnthropic1310(11,304 场,上下 8 分)
2qwen3.8-max阿里1302(8,665 场,上下 8 分)
3claude-opus-4-7-highAnthropic1301(21,092 场,上下 7 分)
4claude-opus-4-7Anthropic1300(21,450 场,上下 7 分)
5claude-opus-4-6-highAnthropic1299(20,835 场,上下 7 分)

大白话|这张榜考的是看图干活的本事,比如认图里的物件、读图上的表格。前五名挤在 11 分之内,第三、四、五名之间只差 1 分,浮动却有 7 分,说明这三家现在谁排前面分不出来。阿里的 qwen3.8-max 排在第二,是前五里唯一一家非 Anthropic 的模型。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

一篇把小米新模型 MiMo-V2.6 拆开讲的稿子

雷锋网 9 月 23 日的技术拆解,讲小米新模型 MiMo-V2.6 是怎么练出来的:写字、看图、安全这三类活儿共用一套训练办法,给它的奖励规则也重新设计过。标题里的「2.5 万条轨迹」指的是训练时攒下的两万五千条操作记录,「1M」说的是它一次能读进去的资料长度。文章是作者根据官方公开信息做的整理,没有第三方跑分。

一句话点评|这类稿子我只盯两处:它换掉的旧办法原来是哪一步卡住,新办法在哪张公开卷子上涨了多少分。第二处这篇没写,先记账。

来源:雷锋网(2026-09-23)

给自己常用的模型出一套私人考卷

every.to 上的一篇方法文,9 月 23 日在 Hacker News 上被顶上来。做法是把你自己常干的活整理成十几道题,每季度拿这些题把在用的模型跑一遍,看谁答得稳。文里给的例子是写邮件、改稿子、查资料这类日常活。

一句话点评|公开榜考的是通用题,你的活它不管。这套做法省事的地方是不用装新工具,麻烦的地方在于刚开始得花两小时把题写出来。

来源:Hacker News / every.to(2026-09-23)

用一分钟给代码仓库做一次上线前体检

Hacker News 上出现的新工具 DriftDetector:把代码仓库的地址贴进去,它给一个 0 到 1 的分数,看这个仓库离能上线还差多远,再列几条主要毛病。工具是该团队自己做的,打分口径也由他们定。

一句话点评|自动体检的结论当提示用,别当判决书。新工具的评分规则还没被别人验过,先拿丢了不心疼的小项目试。

来源:Hacker News(2026-09-23)

拿真实的服务器配置脚本考了几家模型

steampunk.si 发的一篇对比,9 月 23 日上了 Hacker News。作者拿一套真实的服务器配置脚本去跑几家主流模型,题目从部署网页服务到网络设置都有。这类脚本行内叫 Ansible,作用是把一批服务器按同一份说明配好。文章把题目和模型给的答案都贴出来了,别人可以照着复跑。

一句话点评|题目和答案一起公开的比较,比发布会上的分数可信。规模还是小:题都出自一家公司的日常活,换到你的场景不一定同样结果。

来源:Hacker News(2026-09-23)

给 AI 助手起个情景喜剧角色的名字,同事更愿意用它?

The Register 9 月 22 日报道,一家安全公司做了个内部实验:给自家的 AI 助手起上情景喜剧里的角色名,同事更愿意找它们干活,交接也顺一点。文章写的是这家公司的观察,用了多少人、怎么统计都没公开。

一句话点评|名字能解决的是同事愿不愿意用,解决不了它干得对不对。选工具先看有没有记录每一步干了什么,再谈好不好用。

来源:The Register(2026-09-22)

OPPO 出了个 499 元的「AI 心力球」,一个新品类

OPPO 在 9 月 22 日的发布会上带来一款穿戴新品,叫「AI 心力球」,体验价 499 元,官方主打把 AI 能力放进一个随身小球里。发布会上没有给续航、每天会用几次这类数据。

一句话点评|新品类先别抢首发。穿戴设备能不能留下来,看的是充电顺不顺手、戴一天会不会忘,这两条官方从来不写。

来源:IT之家(2026-09-22)

给 AI 助手搭一个不会闯祸的练习场

Firedrill 是个测试框架。你先造几个假工具、假数据,再让 AI 助手在上面干活,然后检查它每一步调了什么、有没有按你定的规矩走。假工具就是不会真发邮件、不会真转账的替身。

一句话点评|测试 AI 助手最省事的办法,是别让它碰真东西。难的地方在后面:你得先写清楚什么算干对了,这一步没人能替你做。

来源:Hacker News / GitHub(2026-09-22)

DeepMind 写了篇长文,讲怎么动态地考模型

谷歌 DeepMind 的研究院发了一篇文章,主张用动态的办法测试前沿模型的能力:不靠一张固定卷子,而是随着模型变强同步换题。文章讲的是方法,没有给出具体成绩。

一句话点评|卷子固定、模型越来越大,是眼下所有榜的共同毛病。动态出题这个方向站得住,但出题方自己也该被同样标准检查。

来源:DeepMind 研究院(2026-09-23)

一所大学的教务长,被校报查出多篇署名文章像 AI 写的

达特茅斯学院的校报做了一次调查,把该校教务长 2026 年发的评论文章和学术文章过了一遍检测工具,中位数落在「像 AI 写的」区间。检测工具给的是概率,校方和当事人还没有正式回应。

一句话点评|又是同一类事故:分数高不等于证据。真该追问的是,谁有权拿这个分数去质疑一个人的署名。

来源:The Dartmouth(2026-09-22)

开源社区开始给自己立规矩:AI 写的代码怎么进仓库

一篇文章梳理了开源项目最近的动作:从最早一律禁止,到给 AI 助手写专门的说明文件(比如 AGENTS.md),再到担心自动审查机器人本身被塞指令。文里举了内核自测、QEMU 规则草案、审查机器人被注入指令几个例子。

一句话点评|规矩从「禁止」变成「写清楚怎么用」,这一步走对了。短板在审查这一环:机器人也可能被喂假指令,那谁来审机器人。

来源:freenode.net(2026-09-22)

大家都在看 · HOT

●  Claude Opus 5.5 和 GPT-6 Sol、Luna 一夜之间全上线,两家都把调用价格砍了约一半(虎嗅)

●  OpenAI 请数学家当顾问,帮着改进模型评测的办法(The Verge)

●  三星一次冰箱软件更新让部分冰箱直接罢工,官方已暂停推送(IT之家)

●  荣耀、小米、阶跃三款手机端侧生成式 AI 服务通过网信部门备案(IT之家)

明日关注 · TOMORROW

①  Arena 快照还停在 2026-09-21,新上线的 Claude Opus 5.5 和 GPT-6 两款都没进榜,等下次刷新看名次稳不稳(虎嗅)

②  科大讯飞新一代语音识别模型明日上线讯飞输入法,等第三方拿嘈杂会议室录音复跑,再谈换不换默认输入法(IT之家)

③  OpenAI 请的数学家名单和评审规则都还没公开,先记账,等它写出考题怎么定的再当依据(The Verge)

—— 以下为早上预览版 ——

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.23 · 周三

第 056 期 · 预览版

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1帮你在网上比价的 AI,还是分不清「查到的」和「编出来的」

它能帮你干什么活:彭博社 9 月 22 日的一篇通讯说,替人挑货比价的 AI 购物助手,仍然很难分清网页上哪些是事实、哪些是编出来的。这类助手的工作是读商品页、看评论、比价格,再把结论交给你。它读到的内容里,有商家自己填的参数,也有来路不明的说法,两者混在一起。

产品领域专家·阿哲说|购物这件事的胜负点一直不在谁挑得快,在你信不信它。上周上线的 Meta Muse 也把购物推荐当卖点,讨论的焦点同样落在信不信上。我的建议是先让它干筛选,付款和下单自己点,参数回官网对一遍。

小编小禾说|上周我让 AI 帮我挑充电宝,它报了一个「一万毫安时只有 80 克」的机型,这个数字我不信。现在的用法是让它列三个候选项,参数我自己去官网一条条核。多花五分钟,少踩一次坑。

来源:Bloomberg(2026-09-22)

重点 2一位开发者把 Devin 的新版本用了一轮,写下了卡住的地方

它能帮你干什么活:9 月 22 日,一位开发者在自己的博客上贴出 Devin 的上手记录。他把这一套都试了一遍:桌面应用、命令行工具、新出的写代码模型 SWE-2(Devin 自家的模型),以及把几个模型合起来用的模式。Devin 是能自己读代码、自己改文件的 AI 编程工具。这篇是个人试用记录,没有公开跑分。

编程领域专家·老徐说|单人一次上手的记录,值钱的地方是它写了哪一步卡住。我看这类文章先找两样东西:仓库有多大、报错之后它能不能自己改回来。这两样官方演示里从来不提。要接自己的项目,先拿丢了不心疼的小模块滚一周。

小编小禾说|我看不懂 SWE-2 是什么,只关心它能不能把我那个跑了三年的小项目改明白。要是得先把项目怎么启动教给它,那还不如我自己动手。先记账,等第二个人贴出跑通自己项目的记录再考虑。

来源:catalins.tech(2026-09-22)

重点 3星海争霸的排位赛里混进了 AI,有人教你从操作里认出它

它能帮你干什么活:一位开发者写了篇文章,讲他在星海争霸的线上排位赛里怎么认出对面是 AI。星海争霸是 1998 年的老对战游戏,排位赛指按胜率分级的线上对局。他给的办法是从操作节奏、开局习惯这些细节里找规律,给每个玩家做一份「指纹」。文章是作者自己的观察,没有第三方核对。

安全领域专家·老周说|认出机器和人,本质上是身份问题。文章里没写误判率是多少,这是最关键的一项。同一套「像机器就下判断」的做法,搬到作业查重、招聘筛选上,判错一次的成本全落在人身上。

小编小禾说|游戏里认错对手,最多骂一句重开。这套判断搬到考试和论文上我就不放心了:检测工具给的分只是线索,不是判决书。看到「像 AI」的结论,先问有没有第二种证据。

来源:Hacker News(2026-09-22)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1文本盲测榜 · 榜单暂未更新,数据截至 2026-09-21

#模型厂商分数(人类投票算出来的)
1claude-fable-5-highAnthropic1506(30,057 场)
2claude-opus-4-6-highAnthropic1505(71,993 场)
3claude-opus-4-7-highAnthropic1502(60,002 场)
4muse-spark-1.2 (xHigh)Meta1500(3,227 场)
5claude-fable-5.1-maxAnthropic1498(5,783 场)

大白话|这期换上一张上期没用过的文本榜。前五名只差 8 分,头名和第五名基本算打平。第四名是 Meta 的 Muse Spark,只打了 3,227 场,榜上标的浮动是 11 分,比它跟第三名的差距还大,名次先别当真。前五名里四席是 Anthropic 家的 Claude。另外,这张榜上次更新是 9 月 13 日,比快照日期还早八天。

快报 2编程盲测榜 · 榜单暂未更新,数据截至 2026-09-21

#模型厂商分数(括号里是对战场次)
1gpt-6-astra-maxOpenAI1800(2,281 场,上下 16 分)
2claude-fable-5.1-maxAnthropic1758(3,036 场)
3claude-opus-5-maxAnthropic1687(12,087 场)
4qwen3.8-max-0902阿里1681(2,262 场)
5kimi-k3-max月之暗面1674(4,547 场)

大白话|第一名 1800 分,跟第二名拉开 42 分,看着很稳。它的场次只有 2,281 场,浮动 16 分;第三名 12,087 场,浮动只有 7 分。场次薄的分数经不起多看。还有一件事:这张榜上次更新是 9 月 11 日,十三天没动过,前五名里有四个的场次不到五千。

快报 3智能体实干榜 · 榜单暂未更新,数据截至 2026-09-21

#模型厂商样本(对战场次)工具说错话的比例
1Claude Fable 5.1 (Max)Anthropic13,3200.37
2GPT 6 Astra (Max)OpenAI10,3720.37
3Claude Opus 5 (High)Anthropic24,7940.33
4Claude Opus 5 (Max)Anthropic19,9340.35
5Claude Fable 5 (High)Anthropic38,2930.37

大白话|这张榜考的是能自己调工具、连着干好几步的 AI,行内叫智能体。它不排总分,六项分开算:办成事、少说错话、听不听指令、出错后能不能自己爬起来。「工具说错话」指它把没发生的工具调用说成真发生了。前五名这一项都在 0.33 到 0.37 之间,差别很小,拉开名次的是办成事那一项:第一名 19.83,第二名 17.7。场次最厚的不是头名,第四名打了一万九千多场。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

给 AI 助手搭一个不会闯祸的练习场

Firedrill 是个测试框架。你先造几个假工具、假数据,再让 AI 助手在上面干活,然后检查它每一步调了什么、有没有按你定的规矩走。假工具就是不会真发邮件、不会真转账的替身。

一句话点评|测试 AI 助手最省事的办法,是别让它碰真东西。难的地方在后面:你得先写清楚「什么算干对了」,这一步没人能替你做。

来源:Hacker News / GitHub(2026-09-22)

DeepMind 写了篇长文,讲怎么动态地考模型

谷歌 DeepMind 的研究院发了一篇文章,主张用动态的办法测试前沿模型的能力:不靠一张固定卷子,而是随着模型变强同步换题。文章讲的是方法,没有给出具体成绩。

一句话点评|「卷子固定、模型越来越大」是眼下所有榜的共同毛病。动态出题这个方向站得住,但出题方自己也该被同样标准检查。

来源:DeepMind 研究院(2026-09-23)

一所大学的教务长,被校报查出多篇署名文章「像 AI 写的」

达特茅斯学院的校报做了一次调查,把该校教务长 2026 年发的评论文章和学术文章过了一遍 AI 检测工具,中位数落在「像 AI 写的」区间。检测工具给的是概率,校方和当事人还没有正式回应。

一句话点评|又是同一类事故:分数高不等于证据。真该追问的是,谁有权拿这个分数去质疑一个人的署名。

来源:The Dartmouth(2026-09-22)

OPPO 出了个 499 元的「AI 心力球」,一个新品类

OPPO 在 9 月 22 日的发布会上带来一款穿戴新品,叫「AI 心力球」,体验价 499 元,官方主打把 AI 能力放进一个随身小球里。发布会上没有给续航、每天会用几次这类数据。

一句话点评|新品类先别抢首发。穿戴设备能不能留下来,看的是充电顺不顺手、戴一天会不会忘,这两条官方从来不写。

来源:IT之家(2026-09-22)

一个专攻古希腊残片的 AI,想把缺掉的字补出来

Wired 报道,研究者做了一个叫 Apollo 的模型,专门对付图书馆里破损严重的古希腊纸莎草残片,目标是把缺的字补上、把出处和年代对上。这类残片在几十万片量级,很多已经破到人读不下去。

一句话点评|补字这活儿最怕补得通顺却补错。看这类成果先找两样:有没有公开的对照答案、补出来的东西能不能被历史学者复核。

来源:Wired(2026-09-22)

一个开源的聊天界面,在线模型和本地模型都能接

IntelliChat 是开源的聊天前端,用 Next.js 写,目标是把好几家模型的接口接进同一个界面。开源的意思是代码可以自己部署、自己改。

一句话点评|换模型不用换界面,对同时用好几家的人是刚需。自己部署要自己管密钥、管日志,图省事的人不划算。

来源:Hacker News / GitHub(2026-09-22)

开源社区开始给自己立规矩:AI 写的代码怎么进仓库

一篇文章梳理了开源项目最近的动作:从最早一律禁止,到给 AI 助手写专门的说明文件(比如 AGENTS.md),再到担心自动审查机器人本身被塞指令。文里举了内核自测、QEMU 规则草案、审查机器人被注入指令几个例子。

一句话点评|规矩从「禁止」变成「写清楚怎么用」,这一步走对了。短板在审查这一环:机器人也可能被喂假指令,那谁来审机器人。

来源:freenode.net(2026-09-22)

给 AI 剪辑助手准备的「爆款镜头」参考库

RetentionVolt 收了 50 多万条剪接点和开头钩子,来自一千多位短视频作者,按周更新。它把这些整理成 AI 助手能直接调用的接口,这个接口方式叫 MCP。

一句话点评|素材库的价值在能检索,风险在趋同:大家都照同一批爆款剪,画面会越来越像。当参考用,别当模板抄。

来源:Hacker News(2026-09-23)

Rabbit 放出一个不用买它家硬件的 AI 助手

The Verge 报道,Rabbit 上线一个能单独运行的 AI 助手,不买它那台 R1 设备也能用。Rabbit 之前那台硬件卖得一般,这次把软件单独拿出来。

一句话点评|硬件卖不动就转软件,这条路不新鲜。判断标准还是两条:能不能替你办成事、出错后你找不找得到它干了什么。

来源:The Verge(2026-09-23)

「会跟你顶嘴」的 AI 创业团队工具

LiveCrew 给创始人配四个 AI 角色,各管一块活,会互相挑错并附上依据。产品页的演示里,有人改完文案,另一个角色会回一句「这个决定我不同意」,然后列理由。

一句话点评|多角色互相挑错这个思路我们聊过:不同来路的 AI 互相审,比同一个 AI 自查难糊弄。它到底挑不挑得出真错,得有人拿自己的项目跑一遍。

来源:Hacker News / LiveCrew(2026-09-23)

大家都在看 · HOT

●  马斯克的 Grok Bot 上线一个月用户破 40 万(Bloomberg)

●  微软 Xbox 又一轮裁员,多家工作室并入动视(IT之家)

●  有人在 Hacker News 上发现 Couchsurfing 整站被 AI 重写,配图也是官方生成的(Hacker News)

●  AstroForge 把下一次小行星任务的指挥权交给 AI(TechCrunch)

明日关注 · TOMORROW

①  刚发布的 Claude Opus 5.5 和 GPT-6 Sol、Luna 还没进 Arena 快照(快照停在 2026-09-21),等下次刷新看名次稳不稳(IT之家)

②  云栖大会开到 9 月 24 日,AgentCore 和 Qwen4 的第三方跑分还没出,官方口径先记账(雷锋网)

③  Meta 的 Muse 上线一周用户破 50 万,等第三方拿出实际任务完成率,再谈它算不算购物入口(The Information)

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-09-23

数界工坊 · 全球AI评测雷达