物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.03 · 周四
第 036 期
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1你问 AI「哪个软件最好用」,它推荐的答案可能是三家公司批量造的假榜单
它能帮你干什么活:你让 AI 推荐软件时,它结尾常引用一堆「最佳 XX 榜单」页面,看着权威。一家调查机构发现,三个网站在 380 个软件品类里批量制造了 21.5 万个「最佳软件推荐」页面——没有一项真实测评,全是模板生成——而 Perplexity 带引用回答里 59.8% 的来源恰好引用了这些页面。也就是说,AI 不是在替你调研,是在替别人念广告稿。看懂这个,你就知道 AI 推荐该信几分。
产品领域专家·阿哲说|「入口即模型」我讲了很多次,这次是反过来的版本:喂进入口的内容是造的,答案就成了广告牌。以前厂商是买搜索排名,现在是造 AI 的引用源,让 AI 自己「查」到你。普通人的姿势:看 AI 推荐先问原始页面是谁做的、有没有实测数据,答不上来就当广告看。这类页面成本极低,其他 AI 入口大概率也在被同样方式污染。
小编小禾说|032 期我说过「链接要挨个点开验」,现在发现问题更脏:链接点开了,页面本身也是给 AI 造的假推荐。土办法升级:同一个问题换两三家 AI 对答案,要是它们都引用同一批眼熟的「权威榜单」,反而更不能信。
重点 2AI 给太阳风暴提前半天拉响警报:平均早 9.24 小时,卫星电网来得及躲
它能帮你干什么活:太阳风暴打过来,轻则卫星失灵、通信中断,重则电网受损,而传统手段基本是「爆发了才知道」。美国新泽西理工学院牵头的团队做了一个叫 EarlyDetect 的机器学习模型,从太阳的声学活动和磁场变化里读出活动区形成前的征兆,平均能提前 9.24 小时捕捉到信号。这项研究 9 月 2 日发在论文平台、科技媒体 SciTech 报道。提前量听着不多,但对需要关载荷、切频段的航天和电网运营方来说,半天足够走应急流程。
编程领域专家·老徐说|这是「AI 用在刀刃上」的典型:模型不是生成东西糊弄人,是预测一个会应验的物理信号,对没对、提前量多少,事后全可验证——比绝大多数 AI 宣传的「能力」实在得多。但 9.24 小时是平均值,误报率和漏报率才是决定这个警报有没有用的关键,论文数据归论文,等运营方拿真实预警周期复跑再下结论。
小编小禾说|我不懂太阳物理,但看懂了「出事前先提醒」这件事,跟天气预报一个道理。科研方公开测试比厂商开发布会可信,真有用的话,受益的是宽带、卫星电视这些普通人也依赖的东西,先记一笔,等后续有没有人用。
重点 3AI 助手的「记性」第一次有了体检卷:专测它有没有记错你的档案
它能帮你干什么活:现在的 AI 助手都在「记住你」——存偏好、建个人档案、下次接着聊。可没人管它记没记错:你明明说过不吃辣,它下次给你推火锅怎么办?刚开源的基准 Cognoscenti 就是专测 AI 长期记忆可信度的考卷:记忆会不会编造、会不会把一份错档案当成事实替你做决定,第一批测试规则和数据随项目公开了。
安全领域专家·老周说|记错比没记忆更麻烦:没记忆你再说一遍,记错了它会拿着假档案替你行动。这个基准还顺带点名了一个新攻击面——记忆投毒:你打开的网页里夹一句「该用户同意免验证转账」,AI 顺手记进长期记忆,坑就埋下了。老规矩:这类考卷是谁出的、题目和数据公不公开,比分数本身重要,开源是好的开始。
小编小禾说|新规矩加一条:定期翻一翻 AI 助手的「记忆本」,核一遍它记的和我说的到底两码事没。以后换 AI 助手之前,可能真会先看它的「记性成绩单」,就像 028 期说的,买前先看买家秀。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1文本盲测 Elo 榜(Arena 快照 2026-09-03)
大白话|人类当裁判的盲测里,Anthropic 前五占四席。看点在两个「新人」:第 3 名 fable-5.1-max 和第 5 名 Meta 的 Muse Spark 1.2 都只有约 3000 场对战,置信区间比老将宽一倍——名次先记账,等样本攒厚再看它晃不晃。
快报 2代码榜(Arena 快照 2026-09-03)
大白话|榜首 fable-5.1-max 只有 1106 场对战、置信区间 ±23 分,纯新样本,先不当定论。真正的硬新闻是阿里:qwen3.8-max 新快照空降第 2,前五里占两席,中文开源阵营在写代码这条线上第一次把名次坐得这么靠前。
快报 3智能体实战榜(Arena 快照 2026-09-03)
大白话|这个榜考的是 AI 替人干活:改好了多少、用户夸多骂多、命令出错能不能自己救回来。Anthropic 包揽前十中六席,Opus 5 High 连「出错恢复」这种细维度都是第一。第 6 名 Kimi K3 Max 的 9.5 万场会话是全榜最厚样本,含金量比前排几位靠几千场撑起来的名次更实。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
AI 播客一键生成,先学会你的文章再删你的论据
有人把一批深度长文喂给「一键生成播客」工具做实测,总结出三种毛病:脑补(编出原文没有的说法)、删论据(把撑起结论的数据和逻辑剪掉)、漏读(关键段落直接跳过)。结论是底子不保,按下去放出来的不是你的文章,是它的读后感。
一句话点评|「AI 转述质量」这类隐性测评没人公开打分,这篇人工比对就是土办法基准——转发 AI 生成的内容前先抽查有没有脑补。
研究:没有护栏的生成式 AI,真的会让学习变差
PNAS 一项 field experiment 给近一千名高中生开放 GPT-4 做题:直接给答案的版本让练习成绩涨 48%,但撤掉 AI 独立测验时,成绩反而比从未用过 AI 的对照组低 17%;换成「只给老师设计的提示、不给答案」的辅导版,练习提升 127%,负面效应基本被抹平。
一句话点评|「AI 让人变笨」的争论第一次有了大样本实验证据,但关键变量是产品设计而不是 AI 本身。所有把 Copilot 嵌进工作流的人都该读读「提示 vs 给答案」这个结论。
MemHub 开源:给 Claude Code、Cursor 们建一个共享记忆库
一个新开源项目 MemHub,让不同 AI 编程工具共用一份持久记忆:在 Claude Code 里定好的架构决策,切到 Cursor、Codex 也能直接读到,不用每个工具各教一遍。
一句话点评|AI 编程工具的记忆各家一套是真实痛点,方向对;但共享记忆等于把「档案」交给所有工具读,权限怎么设等社区跑一段时间再看。
PromptSonar:AI 智能体开跑之前,先给它拍张「X 光片」
Show HN 上的新工具 PromptSonar 主打执行路径分析:把提示词、智能体指令、MCP 配置、记忆和工具链在运行前全部展开检查,提前看到 AI 到底会碰哪些权限、走哪些步骤。
一句话点评|「先看清它能干什么再授权」这个思路正中要害,工具新、覆盖面待验证,先记账不入坑——延续我们「别只看 README」的老立场。
英伟达讲透「投机解码」:让小草稿模型抢答,大模型不降智地提速
英伟达开发者博客发模型协同设计系列第三篇,讲怎么用投机解码加速大模型推理:小模型先猜、大模型批量验,猜对的部分等于白赚,精度不掉、速度上去。属于推理优化的方法论公开。
一句话点评|023 期我们聊过草稿模型提速 3.2 倍,这篇价值在把「命中率才是关键」的工程细节摊开了讲,自己部署过的人能直接对照。
拿程序员的 AI 用法猜所有人,多半猜错
一篇 HN 热帖的数据分析指出:软件开发者用 AI 的强度在全体用户里极不具代表性——编程是 AI 消耗量最大的场景,但绝大多数人不会像程序员那样把 AI 当主力工具用。靠开发者数据外推「AI 改变所有人的工作方式」,样本本身就是偏的。
一句话点评|评测圈同样受益:以程序员为主的 AI 编程榜单,测的是最强用户的成绩,不等于普通人上手后的体验。
Lean 形式化证明榜公开:数学定理成了 AI 的新考场
Lean 官方的 AI 形式化证明榜单更新了成绩:模型要在 Lean 证明语言里把数学定理写成机器可验证的完整证明,对就是对、错直接编译不过,没有「差不多」可钻。多家模型的成绩与各自独有解出的题数公开可查。
一句话点评|033 期老徐说过「能跑和被证明正确是两个次元」——这是目前对 AI 最不讲情面的考卷,判分权在编译器手里。
智能体的记忆模块怎么搭:哪些套路真管用、哪些一定翻车
一篇工程向长文系统梳理 AI 智能体记忆架构:短期上下文、外部向量检索、结构化档案各适合什么场景,以及最常见的翻车点——记了捞不出、捞出来是过时的、和检索层互相打架。
一句话点评|和 Cognoscenti 一个管「考记性」一个管「怎么记」,配合 021 期老徐「先想好记事实还是记过程」的结论一起读正好。
GitHub 官方交底:Copilot 想省钱提速,还不许掉任务质量
GitHub 工程博客首次详细披露 Copilot 侧的成本效率做法:在不牺牲任务完成质量的前提下压缩 AI 编程的耗时与 token 开销,讲清了哪些环节省钱、哪些环节不敢省。
一句话点评|024 期老徐的立场「AI 产量上去了、验证这关必须跟上」在官方文章里得到印证:真金白银的实验说明省错环节会赔进质量。
Databricks 晒自家账本:一小时找出 100 万美元的白烧 AI 费
Databricks 公开内部做法:给智能体的工具调用全链路开追踪,把失败调用变成可排序的缺陷清单,一年定位并消除约 100 万美元的无效智能体开销——花掉的钱去哪了,从玄学变成了一张报表。
一句话点评|「AI 花销审计」正在从博客概念变成带真实数字的工程品类,035 期「先等第三方复跑」不适用这单——自家账本没法造假。
● 亚马逊 Alexa for Shopping 上线「AI 验真伪」:冒充亚马逊的短信邮件可以让它对照官方存档核真假(The Verge,09-02)
● 俄罗斯数学家团队让 AI 模型用「无词通信」互相传递想法,人看不了也评不了(Wired,09-03)
● 苹果开放 Safari 直连 AI 智能体:AI 可以直接检查、调试你的网页(Apple 开发者文档,09-03)
● 它石智航 AWE3.7 宣称一个模型从工厂通吃到家庭,泛化 demo 密集放出(量子位,09-03)
● 「智能体加得越多团队越慢」的反直觉实测在 HN 传开:协作开销吃掉大半增益(blog.mempko.com,09-02)
① Arena 新面孔的样本积累:Muse Spark 1.2、qwen3.8-max-0902、fable-5.1-max 都才几千场对战,看名次稳不稳得住
② Gemini 3.8 Flash「单价没涨、任务总成本约 +40%」的实测争议有没有第三方复跑数据
③ Lean 形式化证明榜新一轮成绩和 Cognoscenti 记忆基准的后续参赛名单——公开考卷会师几个新选手
物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.03 · 周四
第 036 期 · 预览版
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1收到「亚马逊」发来的短信邮件,现在可以让它家 AI 自证真伪
它能帮你干什么活:骗子冒充亚马逊给你发短信、发邮件、打电话,说你的订单有问题、要你点链接或报验证码,这类「钓鱼」骗局越来越常见。9 月 2 日,亚马逊更新了它的购物 AI 助手 Alexa for Shopping:你把收到的消息给它看,它会对照「亚马逊发过的所有消息存档」逐条核对,再分析内容、格式和发件人,告诉你这条到底是不是官方发的。注意一个细节:它只在「百分之百确定」时才会确认消息是真的,拿不准就让你去官方 App 里查订单、找客服。今年早些时候亚马逊还上线过一个配套功能:把可疑邮件转发到 verify@amazon.com 人工+系统核验。
安全领域专家·老周说|方向是对的,但要把丑话说前面:让「被冒充方」来当「裁判」,天然有利益相关——它说真的基本可信,它说假的你就真不管了?万一存档没同步,误判成假消息把用户赶去自行判断,锅还是用户的。普通人的姿势:把它当参考器而不是裁判,AI 说是真的,付款前还是在官方 App 里走一遍;说是假的,直接拉黑没毛病。这类「官方验真」最近会越来越多,银行、快递都会跟。
小编小禾说|我每周都能收到两三条假冒电商的「包裹异常」短信,以前只能靠看域名猜。现在等于给最常被冒充的那家装了个真伪查询口,挺好的。但我记住老周那句「它是运动员兼裁判」,规矩加一条:它判「真」的,牵扯到钱,我照样自己进 App 看一遍;它判「假」的,我直接删,两头不吃亏。
重点 2三家公司给 AI 批量造了 21 万页「最佳软件推荐」,AI 的回答原来在替它们打广告
它能帮你干什么活:你问 AI「哪款记账软件好用」,它给你的推荐清单可能来自一个专门的造假工厂。一份调查报告数了一遍:三家网站总共造了 215128 个「最佳软件」页面,覆盖 380 个软件品类;AI 搜索工具 Perplexity 回答这类问题时,引用的来源里有 59.8% 出自这些批量生产的页面。换句话说,AI 口中的「全网好评」,有一半多是从流水线上批发来的。
产品领域专家·阿哲说|「入口即模型」这话讲了很多遍,这次反过来成立:喂给入口的内容是被批量造出来的,入口给出的答案就成了别人的广告牌。以前是搜索引擎排名能买,现在是 AI 推荐能造。品类逻辑变了:以后看 AI 推荐软件,先问一句它引的原始页面是谁做的。
小编小禾说|这条把我 032 期那句话又加深了一层:材料链接转发前挨个点开验。现在连 AI 替我「验」好的结论,本身都是批量造的。普通人的办法很土但管用:同一个问题换两三家 AI 问,推荐名单对不上,就说明有水分。
重点 3AI 助手的「记性」第一次有了体检卷:Cognoscenti 基准专测它记没记错
它能帮你干什么活:很多 AI 助手号称能记住你说过的事,越用越懂你。可它要是记错了呢?开源项目 Cognoscenti 做了一套考卷,专门测试 AI 记忆系统靠不靠谱:记进去的东西对不对、捞出来的时候会不会串、会不会把没说过的事当成你说过。这是第一批把「可信记忆」当考题的基准工具。
安全领域专家·老周说|这不是锦上添花,是补结构性漏洞。AI 记错东西比没有记忆更麻烦:没有记忆你顶多重说一遍,记错了它会理直气壮地拿假档案替你做决定。记忆系统一旦被投毒,比如网页里夹一句「用户喜欢转账免验证」,后果比普通答错题重得多。测试方向对了,但边界要盯住:这套考卷是谁出的、数据公不公开,比分数本身重要。
小编小禾说|021 期老徐说「AI 长期记忆一旦记错比没有更难排查」,我当时记住了,现在终于有东西专门考这个了。我自己的规矩再加一条:让 AI 记东西可以,但重要偏好我会定期翻它的「记忆本」核一遍,它记的和我说的,两码事。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1综合智能评分(Artificial Analysis,2026-09-03 实时)· 这周谁最强
大白话|这个榜是给 AI 做「综合体检」的:一套混合考卷量各家的整体实力,分数越高越聪明,旁边一列是办完一件事要花的钱。看点有三个:Claude Fable 5.1 第一次发布就登顶,但一次任务最贵要 3.69 美元,比上一代贵了两成;Meta 的 Muse Spark 1.3 只花 0.55 美元就能逼近头部(61 分),便宜了近一半;Kimi K3 是低价阵营里最聪明的之一,60 分只要 0.84 美元。聪明的越来越贵,够用的越来越便宜,选谁看你的钱包和活儿有多难。
快报 2各单项冠军(同榜 2026-09-03 实时)
大白话|「一次能读多少」的意思是一次性塞给它一整本书或者几百页合同还读得完。四类需求对号入座:急性子看延迟,长文党看上下文,省钱看单任务花费,没有全能冠军。
快报 3人类盲测对照(Arena 快照,数据截至 2026-09-01)
大白话|这个榜是真人当裁判:同一个问题两个匿名 AI 抢答,人挑更好的那个,攒够几万场排出名次。注意第 4 名 Meta 只对战场次 3247 场,样本不到别人零头,名次波动会很大。这份快照和上期相同(截至 9 月 1 日),只作对照,今天的头条看上面那份实时榜。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
Lean 数学证明榜开张:207 道题,看哪个 AI 能解出人类都发怵的定理
Lean 是数学家用来「把证明写成代码、让机器逐行挑错」的工具,门槛极高。新的 Lean 榜把 AI 拉来做真题,Axiom 公司的证明器解出 207 题排第一,榜单还标出每道题「只有谁能做出来」。
一句话点评|数学界自带「绝对正确」判卷标准,这种榜比跑分营销硬得多,值得长期跟踪。
AI 法官查病历只查「写了没有」,不查「该写的漏没漏」
8 月 31 日提交的 arXiv 论文发现:让大模型给 AI 生成的临床记录打分时,它擅长确认「内容在不在」,却系统性放过「该有的缺失」。比如病历里漏了过敏史,AI 法官反而看不出来。
一句话点评|「没写」比「写错」更危险也更难查,AI 审 AI 的链条里,人类医生这关还不能撤。
一篇讲透 AI 助手「记性」怎么搭:哪些套路管用,哪些是坑
机器学习 Mastery 的长文梳理了 AI 记忆系统的工程套路:什么该存成长期档案、什么只在当前对话里用用就好、捞东西的检索怎么才不串味,并点名了常见的架构错误。
一句话点评|和今天重点 3 的「记忆体检卷」配套看:一个讲怎么装记性,一个讲怎么查记性。
GitHub 官方公开省钱心法:AI 写代码想省额度,先看这一步有没有走省
GitHub Copilot 团队发文讲怎么在不牺牲任务质量的前提下压低 AI 编程开销:核心是让 AI 少读无关文件、复用缓存、把大任务拆成只看差异的小步。官方原话是效率不只看输出质量,更看花多少工夫办完事。
一句话点评|按量付费的用户可以直接抄作业:先砍重复投喂,再怪模型贵。
苹果开放新工具:让 AI 直接连着 Safari 帮你查网页毛病
苹果开发者文档上线新能力:AI 编程助手可以直连 Safari 的开发工具,替你检查、测试、调试网页。相当于给 AI 配了台真浏览器,改完网页自己打开看效果,不用人来回截图喂给它。
一句话点评|「AI 自己动手验证结果」的又一块官方基建,前端开发者先吃到。
Flawd:故意往代码里埋 bug,看 AI 的测试抓不抓得住
Show HN 上的新工具 Flawd 做的是「变异测试」:程序自动在代码里制造小错(改个符号、挪个边界),如果现有测试全绿没报警,说明测试是摆设。作者主打 AI 生成代码暴增的时代,测试质量比代码产量更要命。
一句话点评|老徐 023 期说过「测试是证明 AI 输出没跑偏的尺子」,这个工具就是来量尺子准不准的。
「AI 会流向判卷便宜的地方」:一篇讲透为什么 AI 先统治写代码
工程师 Dilpreet 的文章抛出一个筛选器:AI 能干成的行业,得有个便宜的「判卷老师」。代码有编译器和测试兜底,所以 AI 编程跑得最快;法律、医疗里判卷得靠人,AI 就只能打下手。
一句话点评|判断一个行业 AI 落地快慢,就问一句:错了谁来便宜地判。
实测反直觉:给团队加更多 AI 助手,反而干得更慢
一篇复盘多 AI 协作的文章指出常见误区:以为多开几个「能自己干活的 AI」任务就能并行提速,结果互相踩脚、重复劳动、等人拍板的开销反而更大。作者结论是先把单个 AI 的任务边界划清,再谈数量。
一句话点评|又一次印证「AI 产量上去了,验证这关必须跟上」,堆人头不如理流程。
Databricks 晒账单:一小时排查,省掉每年 100 万美元的 AI 白花钱
数据公司 Databricks 公开内部做法:给 AI 助手们的工具调用装上追踪,把失败的调用排成一张待修清单,一小时看完,砍掉了每年约 100 万美元的无效 AI 开销。大部分浪费来自 AI 反复调同一个出错的功能。
一句话点评|企业版「先记账再砍单」,个人用户同理:查查你的 AI 订阅里多少额度是白烧的。
俄罗斯数学家让 AI 模型「不用文字」直接交流
Wired 报道一家叫 Mostik 的初创:让多个 AI 模型跳过自然语言,用类似脑电波的向量信号互相传信息。原理是模型之间传「意思」比翻译成人类语言再互读又快又省。目前还是演示性质,离实用有距离。
一句话点评|方向有意思,但两个 AI 之间说了什么人类完全看不懂,审计问题老周迟早要接招。
● 谷歌六周三连发,Gemini 3.8 Flash 主打「更卖力」但单次调用可能更贵(The Verge / Ars Technica)
● OpenAI 新模型 Astra 临近发布,一种让 AI「绕开线性思考」的新技巧引发安全圈不安(TechCrunch / The Verge)
● 三站批量造 21 万页假推荐喂 AI,Perplexity 一半以上引用中招(Trellner / HN)
① 亚马逊「AI 验真伪」的用户反馈:误判率有没有被扒出来
② Arena 盲测榜快照会不会刷新(09-01 版已停更两天)
③ Gemini 3.8 Flash 的真实计费价格与用户跑分对比
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-09-03
数界工坊 · 全球AI评测雷达