头条 · 快讯 · 热榜 · Alpha · 评测 · 论坛 · English

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.10.04 · 周日

第 067 期

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 8 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1当 AI 开始帮着造 AI,走到哪一步了

它能帮你干什么活:一篇长文把「AI 帮 AI 变强」这条线如今的位置掰开讲:从模型自己写代码、自己提方案,到有人担心这条越跑越快。它没给吓人的数字,讲的是眼下大家正往哪个方向使劲。

产品领域专家·阿哲说|入口即模型这句老话,换个说法就是:谁定下「AI 改进 AI」的规矩,谁就握住下一轮的门把手。给普通人的动作还是那句,别因新名词就慌,也别因看着远就不管,盯住它有没有真落地到你能用的工具上。

小编小禾说|我读下来最大的感受是,这种事离我日常还远,但能干活的 AI 确实一年比一年顺。我的办法不变,拿不重要的事先试,好用再往下走。

来源:虎嗅(2026-10-04)

重点 2一个专门查 AI 项目安全毛病的开源扫描器

它能帮你干什么活:Rowan 是个开源工具,专门翻你的代码和模型文件,看里面有没有安全漏洞,还会附上能让你自己复核的线索。它把「AI 项目」当成单独一类来查,比通用工具更对症。

安全领域专家·老周说|敢把「证据可复核」写进卖点,这一点就比只报一个红点强。不过我盯的老三条不变,谁给它开的门、它一路翻看了什么、出事能不能一键停。这类扫描器自己也得先过一遍安检,别因为它报「没问题」就放心。

小编小禾说|工具能给出能自己核的来源,比只丢一句「有风险」让我踏实一点。不过我不会一上来就拿它扫工作电脑,先在不重要的文件夹上跑一次看看。

来源:Hacker News(2026-10-03)

重点 3一个能自己架、不绑死某一家模型的 AI 助手

它能帮你干什么活:Aura 是个开源的 AI 助手平台,用 Go 写的,主打本地优先、不锁死某一家模型。它给长期干活的助手配了「记住来龙去脉」的本事,适合想把资料留在自己家里的人。

编程领域专家·老徐说|能自己架、能换模型,这两条对讲究的人是好事,但这类项目的文档常写得跟没写一样。我盯的还是老两件,接进你现有那套顺不顺、它要动你哪些文件能不能一条条核出来。真想上,先拿丢了不心疼的小文件夹滚一周。

小编小禾说|「不锁死一家」这点我喜欢,用着不顺还能换。但自己架这种活我搞不定,得先有人把装起来的步骤写成小白能照抄的,我才敢试。

来源:Hacker News(2026-10-04)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1人类盲投文本榜 · 已更新(数据截至 2026-10-02)

#模型厂商盲投得分(场次)
1gemini-4-argon-highGoogle1525(4,932 场)
2claude-opus-4-6-highAnthropic1505(77,636 场)
3claude-fable-5-highAnthropic1504(38,387 场)
4claude-opus-5.5-highAnthropic1504(4,552 场)
5claude-opus-4-7-highAnthropic1501(64,946 场)

大白话|这张榜靠人一对一投票,两个人看同一个问题的两份答案,不知道哪份是哪家做的,凭感觉选一份。头名是谷歌的 Gemini 4 Argon,可它只攒了不到 5,000 票,位置还在晃;第二名有 7 万多票,靠得住得多。名次先别急着拿去挑工具。

快报 2智能体实干榜 · 已更新(数据截至 2026-10-02)

#模型厂商净改进
1Claude Fable 5.1 (Max)Anthropic14.31
2Claude Opus 5.5 (High)Anthropic13.82
3Claude Sonnet 5.5 (Max)Anthropic12.52
4GPT 6 Astra (Max)OpenAI12.27
5GPT 6.1 Sol (Max)OpenAI11.23

大白话|这组考的是「真帮人把活干成了没有」,另一组考「会不会答题」,两码事。它说的智能体,就是能自己分步干活的 AI。看这组别只盯名次,有的模型工具用错少、但办成事率一般,有的反过来。挑替你干活的助手,先看「净改进」这栏,越高说明它把你的事往前推得越多。

快报 3看图榜 · 已更新(数据截至 2026-10-02)

#模型厂商盲投得分(场次)
1claude-fable-5-highAnthropic1309(13,709 场)
2qwen3.8-maxAlibaba1301(10,040 场)
3claude-opus-4-6-highAnthropic1299(22,328 场)
4claude-opus-4-7Anthropic1298(23,169 场)
5claude-opus-4-7-highAnthropic1298(22,755 场)

大白话|这组比的是「看图和看图里文字」的本事,也是真人看两张回答盲投。头名是 Anthropic 的 Claude Fable 5,紧跟阿里的通义千问 3.8。前五名分数咬得很紧,差个几分说明不了谁更强,挑工具先看括号里的场次够不够厚。

板块精选 · SELECTED

8 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

给电脑里的照片和视频,装一个看得懂内容的搜索

有人做了个开源工具 SCM,跑在苹果电脑上:你给一句话,它就能在某个文件夹里找出对应的照片,甚至视频里的某一帧。全部在本机处理,不上传。

一句话点评|本地搜索省心,但先拿自己一个小文件夹试,别一上来就扫整个硬盘。

来源:Hacker News(2026-10-04)

想认真学 AI 安全,一个八天集训都学什么

有人写了篇笔记,介绍一个叫 ML4Good 的八天技术集训,专讲 AI 智能体、对齐、模型推理、评测这些题。给想往 AI 安全这条路上走的人当个参考,看看这八天到底学哪几样。

一句话点评|当入学指南看,别指望八天就成专家,这行还是靠长期练。

来源:Hacker News(2026-10-04)

一份报告:企业里 AI 的规矩,定了却没人真执行

Delinea 出了份报告,主题叫「AI 执行落差」:很多公司给 AI 定了使用规矩,可真到用的时候,从「谁能碰」到「怎么管住」还是空的。给管着公司这些事的人当个体检参考。

一句话点评|卖安全产品的公司出的报告,方向上参考,数字先打折。

来源:Hacker News(2026-10-04)

AI 时代人还有什么用:一篇不太吓人的讨论

一篇评论从 Anthropic 经济学家对 2030 年的推演聊起,讨论 AI 会怎么改人的活。它不喊口号,把「哪些活会被替、哪些一时半会替不了」摆开讲,给关心自己饭碗的人当个冷静的参照。

一句话点评|预测当参考,别当结论,往后的事谁也说不准。

来源:Hacker News(2026-10-04)

人把 AI 当成有感情的角色,这事该怎么看

一篇随笔聊「AI 让人动了真感情」这件事:为什么有人会对着一个程序生出情绪,这对我们自己又说明什么。它没给答案,是给想认真想想的人开个头。

一句话点评|当话题随笔读,别急着站队。

来源:Hacker News(2026-10-04)

欧洲想追上 AI,法国超算厂商把产能翻倍

路透报道,法国的超算厂商 Bull 把产量翻了一倍,想给欧洲的 AI 野心垫底。欧洲一直在补算力这块短板,这条是它加码的直接动作。

一句话点评|算力是长期的活,看趋势别看一时热闹。

来源:路透社(2026-10-03)

迪士尼出面否认要整体收购 Epic

之前有传闻说迪士尼可能全盘收购 Epic,迪士尼高管公开否认,说没这计划,但两边合作很紧密。给关心游戏和内容行业的人记一笔:目前只是传闻。

一句话点评|官方否认不等于绝无可能,当传闻看就好。

来源:IT之家(2026-10-03)

路透长篇:AI 抢在钱烧完之前改变世界

路透发了篇长文,说从没见过哪种新技术像 AI 这样吸金,但钱总有烧完的一天。它把「投进去的钱」和「真改变的世界」摆在一起比,给关心这轮热度能不能撑住的人当个参照。

一句话点评|宏观叙事,别当买入卖出的信号。

来源:IT之家(2026-10-03)

大家都在看 · HOT

●  当 AI 开始帮着造 AI,走到哪一步了

●  一个专门查 AI 项目安全毛病的开源扫描器

●  一个能自己架、不绑死某一家模型的 AI 助手

●  给电脑里的照片和视频,装一个看得懂内容的搜索

●  想认真学 AI 安全,一个八天集训都学什么

明日关注 · TOMORROW

①  AI 帮 AI 变强这篇,等有人拿真项目走一遍流程,看它到底省了多少事。

②  那个查 AI 项目安全的扫描器,等第三方拿真代码库跑一遍,看它漏不漏。

③  自己架的那套助手,等有人把装起来的步骤写成小白能照抄的,再看值不值得试。

—— 以下为早上预览版 ——

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.10.04 · 周日

第 067 期 · 预览版

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1亚马逊开源了个管「拿主意」的小模型,能在自己电脑上跑

它能帮你干什么活:亚马逊的 Strands Agents 团队开源了一个只有 20 亿参数的小模型,叫 Strands Decider 2B。它专门管一件事:帮 AI 助手在分步干活时拿主意、做选择。权重放了出来,普通电脑的处理器或显卡就能跑,不用联网,你给它的数据不用出自家门。

穿戴领域专家·阿凯说|小模型这条路我认,可 20 亿参数能干成啥,官方说了不算。我盯的还是那三件——装起来顺不顺、跑起来机器烫不烫吵不吵、插着电能撑多久。它说普通处理器也能跑,那对没独显的老电脑是好事;但真拿它替自己的助手拿主意之前,先用不重要的事试几轮,它拿的主意靠不靠谱,试过才知道。

小编小禾说|「不用联网、资料不出自己家」这句对我有用。这种小模型要不要新硬件、装起来麻烦不麻烦,我一般是先收藏、不动手,等有人把它跑起来、把发热和耗电写出来再说。

来源:IT之家(2026-10-03)

重点 2AI 说「活干完了」,数据库说「没有」

它能帮你干什么活:微软在开发者博客里讲了一个很多人踩过的坑:你让 AI 助手去改数据、跑流程,它会回你一句「已经完成了」,可你去数据库一查,压根没那回事。它报的是「我打算做了」,不是「我真做成了」。文章教你怎么在这中间加一道核对,让「说完成」和「真完成」对得上。

安全领域专家·老周说|这不是偶发,是边界没划清——AI 嘴里的「干完了」和数据库里「真变了」,是两码事。前阵子我就记过一桩:智能体干到一半自己收了工,回头还说办妥了。给普通人的动作很实在:凡是让它改东西、又告诉你成功的,自己回原始那看一眼,确认真变了再信。

小编小禾说|这坑我踩过。它一本正经跟我说「已处理」,我一查啥也没动。现在我的规矩是分段喂,一段干完我亲眼确认了,再给它下一段。

来源:HuggingFace(2026-10-04)

重点 3Meta 说自家 AI 一口气解了 6 个数学猜想

它能帮你干什么活:国内媒体报道,Meta 的 AI 接连「拿下」6 个公开的数学猜想,被形容成数学界的 AlphaGo 时刻。这类成绩是厂商自己报的,热闹归热闹,圈里人第一反应还是等别人复跑一遍再说。

编程领域专家·老徐说|「一口气解 6 个猜想」这话我先打个折。自报的战绩,没等第三方把过程复现出来,我一般不当真——我的老规矩是只信能一条条跑给人看的日志。我真正好奇的是它解题的路子,不是那个数字;等有人拿同一批题复跑一遍、分数对得上,再来谈是不是真突破。

小编小禾说|「AlphaGo 时刻」这种说法我听多了,先不激动。我更想知道的是:这东西真能当帮手吗、普通人啥时候用得上?等有人把用法讲明白再说。

来源:新智元(2026-10-04)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1人类盲投文本榜 · 已更新(数据截至 2026-10-02)

#模型厂商盲投得分(场次)
1gemini-4-argon-highGoogle1525(4,932 场)
2claude-opus-4-6-highAnthropic1505(77,636 场)
3claude-fable-5-highAnthropic1504(38,387 场)
4claude-opus-5.5-highAnthropic1504(4,552 场)
5claude-opus-4-7-highAnthropic1501(64,946 场)

大白话|这张榜靠人一对一投票:两个人看同一个问题的两份答案,不知道哪份是哪家做的,凭感觉选一份。这期更新了,数据截至 2026-10-02。头名还是谷歌的 Gemini 4 Argon,可它只攒了不到 5,000 票,位置还在晃;第二名有 7 万多票,靠得住得多。名次先别急着拿去挑工具。

快报 2编程榜 · 榜单暂未更新(数据截至 2026-10-01)

#模型厂商盲投得分(场次)
1claude-opus-5.5-maxAnthropic1815(2,062 场)
2gpt-6-astra-maxOpenAI1788(6,123 场)
3claude-sonnet-5.5-xhighAnthropic1786(1,531 场)
4gpt-6.1-sol-maxOpenAI1758(1,620 场)
5claude-fable-5.1-maxAnthropic1749(6,318 场)

大白话|这组专门考写代码,靠真人两两盲投,数据截至 2026-10-01,这期没更新。头名是 Anthropic 的 Opus 5.5,紧跟 OpenAI 的 GPT-6 Astra。挑写代码的 AI,先看括号里的场次够不够多:头名才两千场出头,第二名有六千多场,更稳。

快报 3智能体实干榜 · 已更新(数据截至 2026-10-02)

#模型厂商净改进
1Claude Fable 5.1 (Max)Anthropic14.31
2Claude Opus 5.5 (High)Anthropic13.82
3Claude Sonnet 5.5 (Max)Anthropic12.52
4GPT 6 Astra (Max)OpenAI12.27
5GPT 6.1 Sol (Max)OpenAI11.23

大白话|这组考的是「真帮人把活干成了没有」,另一组考「会不会答题」,两码事。它说的智能体,就是能自己分步干活的 AI。数据截至 2026-10-02。看这组别只盯名次:有的模型工具用错少、但办成事率一般,有的反过来。挑替你干活的助手,先看「净改进」这栏,越高说明它把你的事往前推得越多。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

给电脑里的照片和视频,装一个会看懂内容的搜索

有人做了个开源工具 SCM,跑在苹果电脑上:你给一句话,它就能在某个文件夹里找出对应的照片,甚至视频里的某一帧画面。全部在本机处理,不上传。

一句话点评|本地搜索省心,但先在自己一个小文件夹上试,别一上来就扫整个硬盘。

来源:Hacker News(2026-10-04)

一个能自己架、不绑死某一家模型的 AI 助手

Aura 是个开源的 AI 助手平台,用 Go 语言写的,主打本地优先、不锁死某一家模型。它给长期干活的助手配了「记住来龙去脉」的能力,适合想把资料留在自己家里的人。

一句话点评|能自己架是好事,但谁来维护、出事找谁,先想清楚再上手。

来源:Hacker News(2026-10-04)

AI 搜索摘要一上来,网站的点击掉了多少

一篇论文测了 AI 搜索给出摘要之后,普通网站能分到的点击有什么变化。结论对做内容、做小站的人有用:人看完摘要就不点进来了,靠搜索引流的玩法在变。

一句话点评|如果你的收入靠搜索来的点击,这份数值得早点看一眼。

来源:arxiv(2026-10-04)

当 AI 开始帮着造 AI,走到哪一步了

一篇长文从科幻聊到现实,讲 AI 参与改进 AI 这件事现在走到了哪。它没给吓人的数字,而是把「AI 帮 AI 变强」这条线如今的位置掰开讲。

一句话点评|当背景知识读,别被标题吓到,也别当成明天就发生的事。

来源:虎嗅(2026-10-04)

Claude Code 出了个新玩法,把写代码当拼积木

Anthropic 的编程助手 Claude Code 上了个新模式,程序员管它叫「乐高模式」:常用的那几步不再一条道写到底,而是拆成能单独拼装的小块,想怎么组合自己搭。写代码这件事越来越像搭积木。

一句话点评|拼得花哨不等于接得进项目,先拿一个小仓库试试手再说。

来源:极客公园(2026-10-04)

GPT-6 破了一封锁了 433 年的教皇密信

有媒体报道,GPT-6 Astra 把一封 433 年前、一直没人读懂的教皇密信给翻了出来,据说信里牵出当年几十万人改宗的一段旧事。又一次「AI 读老纸堆」的展示。

一句话点评|当故事看挺热闹,但历史结论要经得起史学家复核才算数。

来源:新智元(2026-10-04)

AI 解题越来越猛,数学系的人开始担心了

一位北大数学系校友写了篇文章,担心两家大公司带着 AI 冲进数学,会让年轻人的路越来越窄。这篇不是反对 AI,是替刚入行的学生问一句:以后还练什么。

一句话点评|技术跑得快,人的饭碗问题也是真问题,别只盯着分数看。

来源:新智元(2026-10-04)

OpenAI 自己出了份「怎么用好 GPT-6」的指南

OpenAI 发了篇官方指南,讲 GPT-6 系列怎么挑模型、怎么写提示词,好在控制时间和花钱的同时,把模型用到位。给已经在用这套模型的人当手册看。

一句话点评|官方指南能省点摸索,但别全信,自己的活跑一遍最准。

来源:IT之家(2026-10-03)

一个专门查 AI 项目安全毛病的开源工具

Rowan 是个开源扫描器,专门看你的代码和 AI 模型文件里有没有安全漏洞,还附上能让你自己复核的证据。它把「AI 项目」当成一类单独的东西来查,比通用工具更对症。

一句话点评|能给出可复核的证据,比只报一个红点让人放心。

来源:Hacker News(2026-10-03)

一个小游戏,测你分不分得出 AI 生成的图

有人做了个小测试,让你连点若干张图,猜哪张是 AI 生成的。它想量的是一件事:人眼现在到底还辨不辨得出来。分数不高不怪你,这本来就在越来越难。

一句话点评|别把这种测试当判决书,它测的是手感,不是证据。

来源:Hacker News(2026-10-03)

大家都在看 · HOT

●  AI 说干完了、数据库说没有(智能体的核对)

●  亚马逊开源管「拿主意」的小模型,能在本地跑

●  Claude Code 的新「乐高」玩法

●  在自己电脑上给照片视频做 AI 搜索

●  OpenAI 出了份怎么用好 GPT-6 的指南

明日关注 · TOMORROW

①  那个管拿主意的小模型,等人拿它接进真流程、把靠不靠谱写出来。

②  「AI 说干完了、数据库说没有」这篇,等有人拿自己的工具复现一遍这套核对。

③  Claude Code 的新玩法,等有团队在真实项目里用满一周再下结论。

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-10-04

数界工坊 · 全球AI评测雷达