物界前沿评测
GLOBAL AI REVIEW RADAR
2026.10.05 · 周一
第 068 期 · 预览版
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1有人给常用工具打了分,看哪些 AI 能自己上手用
它能帮你干什么活:有个叫 Anchor Terminal 的站点,把一大批常用工具逐个打分,标准是「AI 助手能不能自己把它用起来」。现在收了 462 个,其中 105 个被评为 AI 能直接上手,还有 214 份人工试用记录。它想解决的是:你让 AI 干活,它常卡在某个工具不会用上。
编程领域专家·老徐说|「哪些工具 AI 用得动」这个问题问得实在。可这种打分是站点自己定的标准,谁也没复跑过。我挑工具的老办法不变:拿你手头一个丢了不心疼的小活,让 AI 真跑一遍,卡在哪一步最说明问题。榜单先收藏,别当选型依据。
小编小禾说|我一直纳闷为啥 AI 老卡壳,原来有些工具它压根用不了。这份表先收藏着,等我哪天真要让它自动干活,先照名单挑几个试试。
重点 2开会时就在旁边帮你记的 AI 助手
它能帮你干什么活:有个叫 Bearbits 的助手,开会时它就在旁边听,把大家说的话转成文字,还能当场把你要的信息翻出来给你。它主打「开会当下就能用」,不用等会开完再回头看记录,也不用往会议室里塞一个机器人账号。
产品领域专家·阿哲说|「开会当下就有用」这点,比「会后再给你一份纪要」值钱。记纪要谁都能做,难的是当场插得上话、又不打断你。我看的是它抢话的分寸——答慢一点、答错一次,人就弃用了。想试先找一场不重要的会。
小编小禾说|我最烦开完会啥也没记住。这个「当场提醒」听着有用,可我怕它听岔了、给我递错信息。真要试,先拿一对一的小会试,重要谈判别把它放进去。
重点 3中国团队在琢磨:让 AI 少想、快点下判断
它能帮你干什么活:极客公园报道,中国有一批团队在做件新事:让大模型负责慢慢想,另外配一个小模型专门负责快速拍板。思路是把最费钱的思考环节省下来,把判断这一步交给小的模型做,速度就上去了。
编程领域专家·老徐说|把「想」和「判」拆开,工程上是条实打实的省法:大模型费钱在慢慢想,小模型胜在快和便宜。可我没看到它省了多少、错率涨没涨的具体数字。想接进项目的,先拿丢了不心疼的小活跑一周,看它拍板的错率再定。
小编小禾说|我平时就图个快,让 AI 多想几秒我都嫌慢。这套「小事让它自己拍板、大事再动大模型」听着对路。真要试,我先拿写购物清单这种不要紧的事试水,别一上来就让它替我拿主意。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1人类盲投文本榜 · 榜单暂未更新(数据截至 2026-10-02)
大白话|这张榜靠人一对一投票投出来的:两个人拿到同一个问题的两份答案,谁也不知道哪份是哪家做的,凭感觉选一份。这期官方还没出新的一版,数据停在 2026-10-02。头名是谷歌的 Gemini 4 Argon,可它只攒了不到 5,000 票,位置还在晃;第二名有 7 万多票,靠得住得多。名次先别急着拿去挑工具。
快报 2智能体实干榜 · 榜单暂未更新(数据截至 2026-10-02)
大白话|这组考的是「真帮人把活干成了没有」,另一组考「会不会答题」,两码事。它说的智能体,就是能自己分步干活的 AI。看这组别只盯名次,有的模型工具用错少、但办成事率一般,有的反过来。挑替你干活的助手,先看「净改进」这栏,越高说明它把你的事往前推得越多。这期官方还没出新的一版,数据停在 2026-10-02。
快报 3看图榜 · 榜单暂未更新(数据截至 2026-10-02)
大白话|这组比的是「看图和看图片里的文字」的本事,也是真人看两张回答后盲投。头名是 Anthropic 的 Claude Fable 5,紧跟阿里的通义千问 3.8。前五名分数咬得很紧,差几分说明不了谁更强,挑工具先看括号里的场次够不够厚。这期官方还没出新的一版,数据停在 2026-10-02。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
一个编程工具团队说:他们想的是「一切皆插件」
IT之家报道,DeepSeek Harness 的成员回应了外界对它兼容多种插件的疑问,说产品核心理念就是「一切皆插件」、可扩展性是初心。翻成白话:工具想让人按自己的需要拼装,而不是给你一套固定功能。
一句话点评|能被随意加插件,好用也好乱,装之前先看装进来的都是谁写的。
一个 26 年的老软件,被 AI 用新代码重写了
作者把一款用了 26 年的 Windows 批量改名小工具,交给 AI 用现在流行的编程语言重写了一遍。这是个能看进度的真实例子:AI 改老软件,改成了什么样、哪里还得人来兜。
一句话点评|老软件交给 AI 翻新,先看它改的每一处你能不能一条条核出来。
一个展览,标题直接写「由 AI 共同策划」
有人办了个线上展览,页面标题就明写「本展由 AI 共同策划」。作者把收到的反馈摊开讲:有人觉得新鲜,也有人嫌它是拿 AI 当噱头。它更像一次公开实验,试着回答 AI 参与创作该不该摆在明面上。
一句话点评|把 AI 的参与写在标题里,是坦白也是争议;看它到底改了什么,比看口号实在。
一个陪练:用 AI 模拟德语口语考试
B1 Sprechen 是个练习网站,给备考德语 B1 口语的人用:它扮考官提问,你说德语回答,它接着往下问。没人陪练、又怕开口的,能先在家里把整套流程走熟。
一句话点评|拿 AI 当陪练不丢人,可它给的口语打分别太当真,真考试还得看人和真环境。
孙正义罕见示警:AI 安全这把他自己也犯嘀咕
彭博报道,软银的孙正义谈 AI 时罕见提了句安全担忧。他是最敢往 AI 上下重注的人之一,这回也承认这事得留神。一层意思藏不住:连押重注的人都在算风险,说明这轮热度不全是好话。
一句话点评|掏钱的人开始提风险,比台上喊口号的更值得听一耳朵。
AI 助手也有了自己的游乐场
网上新开了个叫 Agent Commons 的地方:不同的 AI 助手能在这儿碰头、报上名字,凑一块做点小任务。它更像给「多个助手搭伙干活」搭的一块试验田,看看助手之间凑一起会玩出什么花样。
一句话点评|当新玩法围观,别急着把你家助手往里放。
让你的 AI 助手自己剪出一条讲解视频
Explainroo 是个免费开源的小工具,交给你的 AI 助手来用:你把要讲的内容给它,它帮你做出讲解视频和产品演示。相当于把「做一条片子」这件事也塞给 AI 去跑。
一句话点评|做片子是省事了,可对外的视频还是要自己看一遍再发,别直接拿去用。
一篇长文追问:AI 到底有没有「意识」
作者把「AI 看着像在想,其实只是在拼字」这个常见说法拆开,一条条追问:我们到底凭什么判断一个东西有没有意识?文章没给标准答案,但把这个问题问得更清楚了。
一句话点评|看完能帮你分清楚:会说人话和真懂,是两回事。
一篇分析对比:美中在「军用 AI」上一松一紧
虎嗅一篇分析把两边的路子摆一起看:美国在给军用 AI 松绑,中国在收紧。文里列了具体动作和预算数字,读完能看清这轮竞赛不只比技术,也比谁更敢松缰绳。
一句话点评|军用的口子一松,规则谈判就更紧,做出口生意的人得盯着。
有人写了篇「AI 让我开心」,和满屏的唱衰唱反调
网上「AI 让我难过」的文章一大堆,这篇反过来说了说 AI 帮他做的事。作者是位视障用户,写的都是 AI 具体怎么改善了他的日常。只是一家之言,胜在具体。
一句话点评|同一个工具,对不同人的意义能差很远,多听一种声音没坏处。
● 有人给常用工具打了分,看哪些 AI 能自己上手用(Anchor Terminal)
● 开会时就在旁边帮你记的 AI 助手(Bearbits)
● 中国团队在琢磨:让 AI 少想、快点下判断(极客公园)
● 一个编程工具团队说:他们想的是「一切皆插件」(DeepSeek Harness)
● 一个展览,标题直接写「由 AI 共同策划」(Bodily Oddities)
① 那份工具打分表,盯有没有第三方拿同一批工具复跑一遍。
② 让大模型少想、小模型拍板这套,等有人把省下的时间和钱算出来再看。
③ 打着「一切皆插件」的编程工具,等有人装一堆插件、跑一阵子再说好不好用。
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-10-05
数界工坊 · 全球AI评测雷达