物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.09 · 周三
第 042 期
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1GPT-6 上手第三天,大家开始研究怎么「少喂Token」把事办成
它能帮你干什么活:GPT-6 Astra 上线这几天,讨论风向变了——第一天比的是谁更强,第三天比的是谁更省。有作者把它的三档推理等级拉出来逐个实测:日常问答、写邮件用低档,速度和账单都友好;改代码、做分析上中档;只有硬骨头任务才开满档。结论很直白:不是越「聪明」越合适,任务配档位,Token 花费能差出好几倍,大部分普通活儿根本用不到顶格推理。
产品领域专家·阿哲说|新模型发布周之后紧接着就是「怎么用最划算」周,这是每个入口成熟前的固定节目。08-29 期谷歌 Gemini 3.7 Flash 空降三榜时我们说过,性价比会成新战场;现在轮到旗舰自己长出档位说明书。入口即模型,但选档即省钱。
小编小禾说|我这种按字数心疼额度的人狂喜。老规矩:先拿周报、整理会议纪要这种丢了不心疼的活试低档,重要的活还得自己多核对一遍,别指望省了钱又白赚聪明。
重点 2有团队开始给 AI 公司的「安全承诺」记账:规则悄悄改了没告诉你
它能帮你干什么活:选 AI 服务时你看到的那份安全政策,可能已经不是三个月前那份。一篇新论文(Silent Revision)做了一套测量方法:逐版对比各家 AI 安全框架的历史文本,把「没发公告就悄悄改动规则」的行为量化出来。对用户意味着什么:厂商主页写「我们承诺」不再等于证据,你需要的是一份能查的「变更记录」。
安全领域专家·老周说|08-20 期我说过「不透明才是最大的风险」。这篇论文的价值不在结论,在把透明度变成可测量的对象——跟 08-17 期 AI 制药开公开榜、09-01 期黑客公开赛是同一个方向:打分权从厂商手里拿回来。这类「第三方记账」做法值得推广。
小编小禾说|以后选 AI 工具不光看功能,还得看它家政策页有没有「更新历史」可翻。没记录可查的承诺,跟没承诺差不多——这话我先记在小本本上。
重点 3让 5 个 AI 打完整季高尔夫:作者说我们的智能体考试方式从一开始就错了
它能帮你干什么活:一家叫 Offscript Labs 的团队做了个实验,让 5 个 AI 智能体像球手一样打完整季高尔夫——同一套规则、同一个赛季累计积分,而不是每道题单独计分。他们的发现:现有榜单把智能体拆成一道道孤立短任务,考不出「连着干一周会不会崩」。长任务里的误差会累积,单题满分掩盖了这一点。
编程领域专家·老徐说|方向戳中了:现有基准全是短闭环计分,量不出长任务的误差累积,「长任务要连着考」这个思路值钱。但这是自建土考场,出题、计分、发球权都是他们定的,分数先打折记账——延续我的老规矩:只信可复现日志,等第三方拿同样的赛季规则复跑。
小编小禾说|041 期我看「7 个 AI 开店发假账单」学到的,跟这次对上了:AI 单件事做得漂亮不等于长期靠谱。以后看「AI 全能助手」的宣传,先问一句:敢不敢连干一周公开记账?
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1文本盲测榜 TOP 5(快照 2026-09-09,Elo 分数,人类投票选出来的名次)
大白话|人类当裁判的文字盲测里,Anthropic 前五占四席;第3、5名对战数不到 4000 场,置信区间宽,名次会晃,先别当真。
快报 2代码能力榜 TOP 5(快照 2026-09-09,写程序盲测,Elo 分数)
大白话|GPT-6 Astra Max 登顶写代码榜,但只打了 1810 场、误差棒 ±19 分,比第2名多出的 32 分还没拉开一个安全距离——延续老徐 041 期的提醒:样本最薄的名次先别当真。
快报 3智能体实用榜 + 用量头条(AI 替你干真实活的综合表现)
大白话|智能体实用榜(快照 2026-09-09)前十 Anthropic 占六席,国产里 Kimi K3 Max 第8、腾讯 Hy4 preview 第10。另据调用量数据,腾讯 Hy4 环比暴涨 379% 登顶全球大模型调用榜(极客公园,9 月 9 日)——榜单比「谁聪明」,调用量比「谁被天天用」,两张榜对照着看。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
ChatGPT 生图罢工 7 个半小时,修好了也没给解释
OpenAI 状态页显示,北京时间 9 月 8 日 22:32 到 9 日 05:59,ChatGPT 和 Images API 的图像生成功能集体故障约 7 小时 27 分钟,目前已修复,事故原因尚未公布。
一句话点评|把活交给 AI 之前先看它的「 uptime 成绩单」——依赖越深,越要在意它坏不坏、坏了说不说。
2026 款 Apple TV 4K 曝光:升级 A19/Pro 芯片,支持 Siri AI
据爆料,苹果 2026 款 Apple TV 4K 将升级到 A19/Pro 级芯片并支持 Siri AI 能力,整机定位从流媒体盒子向家庭 AI 终端移动。
一句话点评|电视盒子拼算力不是新鲜事,关键是 Siri AI 在客厅场景到底能不能听懂人话——上市前都值得观望。
开发者把英伟达 DLSS 5 移植上苹果 M5 Pro:画质涨了,延迟 240 毫秒
有开发者成功在 M5 Pro 等苹果芯片上非官方移植英伟达 DLSS 5 超分技术,实测画面质量确有提升,但延迟高达 240 毫秒——玩动作游戏等于按键后半秒才有反应。
一句话点评|一次跨阵营硬件能力对照实测:画质和延迟这笔账摆得很直白,移植能跑通不等于能用。
为啥辅助驾驶能躲人,却会撞羊和路障?
一篇工程复盘拆解辅助驾驶的感知边界:行人、车辆这些「高频目标」训练充分,羊、路障、异形障碍物属于长尾类别,模型没见过就等于不存在。躲人能拿满分,撞羊不稀奇。
一句话点评|评测只考常见题,真实路况专出冷门题——「考场得分」和「路上安全」是两码事,买智驾别只看宣传视频。
开会时 AI 能听出「该谁说话了」,降噪耳机却还在把人声当噪音掐掉
Tavus Labs 开源语音模型 Sparrow-2,直接点名老大难:现有降噪为「掐掉背景人声」设计,一旦让 AI 助手边听边答,同事的话、你的半截话全被当噪音处理,AI 就抢话、漏话。Sparrow-2 主打整场声音理解,自称轮次判断榜 TurnBench 第一。
一句话点评|方向对——语音的下一战场不在听懂词,在听懂「该谁开口」;但 TurnBench 是主办方自家榜自家模型,等第三方拿真实会议录音复跑。
把银行账单接给 AI 帮你查账,先想清楚你交出的是哪把钥匙
周末项目 BankMCP 冲上 Hacker News 热榜:把多个银行账户流水接到 Claude、ChatGPT 等 AI 里,直接问「上个月外卖花了多少」。项目方强调两点防线:只读(AI 只能看不能转钱)、服务器你自己搭。
一句话点评|「只读+自建服务器」比交网银密码的云端助手清醒,但账单是行为画像——先只接一张不重要的卡试水,延续老周 042 期立场。
网站 AI 味检测器上线:逐页标出「哪里读起来像机器人写的」
SiteTell 会爬完你的整个网站,把读起来像 AI 泛泛生成的文案逐条标出来:给分数、给证据、按规则给出改写建议,瞄准「全站去 AI 味」这个新刚需。
一句话点评|给 AI 文本「验味」的工具本身也在立标准,检测器只能当提示、不能当判决书——延续老周 028 期对检测器的定性。
终端里长出的 AI 副驾:300 行 Zsh 实现命令实时建议
开源小工具 Aish 用约 300 行 shell 脚本,在终端里做出类似 Warp 的内联 AI 命令建议:每条命令跑完自动判断成败,给出下一步候选,主打轻量、可读、可自己改。
一句话点评|小而透明的实现适合拿来研究「AI 辅助到底加在哪一步」;给 AI 的建议留最终确认权在你手里,别直接回车。
给 AI 造「会故意遗忘」的记忆:Rust 实现反 RAG 思路
开源项目 Selmem 走反 RAG 路线:不做「全量事实堆叠」,而是选择性重构式记忆,允许 AI 有意遗忘、甚至有限度地「编」,作者认为堆满事实只最大化覆盖率,不接近人类记忆的使用方式。
一句话点评|AI 记忆一旦记错比没有更难查——延续老徐 021 期立场:先想清楚「记事实还是记过程」,再谈上不上。
证件照工具说不「像 AI」:上传一张照片保住你的脸
PortraitDesk 主打「你的脸还是你的脸」:上传一张肖像,生成证件照/职业头像时保留原有的五官比例、表情和相似度,回避常见的「AI 磨皮换脸感」。
一句话点评|「不像 AI」成了新卖点,本身就是生成图像同质化的注脚;求职用可以先拿免费版试相似度再谈掏钱。
● 升级后的 DeepSeek 让年轻人集体「失恋」:有人把它当赛博男友,活人感思维链成关键(虎嗅,9月9日)
● DeepSeek 官方预告 9 月 10 日前后发布 V4.1 Flash,称各项指标全面超越 V4 Pro(IT之家,9月9日)
● 蚂蚁百灵开源首个原生多模态模型 Ling-3.0-flash-VL:124B 总参数、单次激活 5.5B(IT之家,9月9日)
● 面壁 MiniCPM5-2B 开源:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力(IT之家,9月9日)
● 「AI Stack Selector」上线:明说自己的匹配分是打分启发式、不是基准测试(Hacker News,9月9日)
● Sonos 27 音频系统更新:向 S2 系列免费推送,预览外部 AI 接入(IT之家,9月9日)
① DeepSeek V4.1 Flash 预计今日发布:官方称「性能、费用、速度、总用时各项指标全面超越 V4 Pro」——老规矩,自报成绩单先打折记账,等 Arena/第三方榜单跑分落地再看成色。
② GPT-6 Astra Max 的代码榜第一(1796 分)对战数仅 1810 场:盯它接下来几天样本攒到万场后名次晃不晃,08-29 期 Gemini 3.7 Flash 空降的剧本可能重演。
③ ChatGPT 生图故障(累计约 7.5 小时)尚未公布原因:看 OpenAI 会不会补发事故复盘——公布与否本身就是「可审计性」的一次实测。
物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.09 · 周三
第 042 期 · 预览版
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1开会时AI能听出「该谁说话了」,降噪耳机却还在把人声当噪音掐掉
它能帮你干什么活。Tavus Labs 开源了语音模型 Sparrow-2,直接点名一个老大难。现在的降噪技术是为「掐掉背景人声」设计的,可一旦你让 AI 助手边听边答,降噪就把同事的话、你自己的半截话全当噪音处理,AI 听着听着就抢话、漏话。Sparrow-2 改的是判断逻辑,不只看「是不是人声」,还结合整场场景判断「现在轮没轮到这个人说」。作者说它在 TurnBench(专门考「什么时候该开口」的公开测试)的轮次判断项目里排第一,网页上能直接找它的数字人「PAL」对话试。现场演示 挂着,谁都能去插句话试试它抢不抢。
产品领域专家·阿哲说|语音助手品类的分水岭我一直说是延迟、打断、抢话这三件事,跑分再高,插话插得让人想摔耳机就是白搭。TurnBench 这种「什么时候开口」的公开考卷值得多看一眼,它考的正是发布会演示里最容易藏拙的环节。不过 #1 是主办方自己的榜、自己的模型,老规矩,等别人拿真实会议录音复跑一遍再下结论。
小编小禾说|我对付过这个坑。用 AI 记会议纪要,旁边同事一说话,记出来的东西一半是他俩的闲聊。要真能做到「谁该说话听得出来」,这是刚需。但官方演示永远挑最顺的场合给你看,我先拿自己家的嘈杂会议室去试,试完再说好不好。
重点 2让5个AI打了一整季高尔夫,作者说我们的智能体考试方式从一开始就错了
它能帮你干什么活。一家叫 Offscript Labs 的团队做了个实验,让 5 个 AI 智能体像球手一样打完整季高尔夫,同一套规则、同一个赛季积分,而不是像现在这样每道题单独计分。他们的发现是,现有榜单把智能体拆成一道道孤立任务考,考不出「连续干几十件事会不会越干越歪」这种真问题。打球的设定听着像玩,其实戳中了要害。你让 AI 帮你订一周的行程,第 6 天出错,往往不是它那天变笨了,是前面攒的小错滚到了一起,而现在的跑分根本看不见这个。实验页面和过程记录都公开在 官网。
编程领域专家·老徐说|这个实验我认真看完了,方向说到点子上了。我做项目最怕的不是 AI 单步写错,是它连着干二十步、错误在第十步埋下、第二十步才爆。现有基准全是短闭环计分,长任务的「误差累积」没人量。用高尔夫赛季做载体很聪明,规则简单、周期长、没法作弊。但提醒一句,这是自建的土考场,出题范围、计分方式都是他们自己定的,分数本身先别当真,「长任务要连着考」这个思路才是值钱的。
小编小禾说|我把它翻译成我的日子。让 AI 帮我规划一次全家旅行,机票酒店都订了,到第 4 站才发现它把日期接错了,前面订的全要退。原来是它不会「记住自己上一站干了啥」。所以以后看智能体广告,我先问一句,有没有连干一周不出错的记录,单题满分我不稀罕了。
重点 3把银行账单接给AI帮你查账,先想清楚你交出的是哪把钥匙
它能帮你干什么活。一个周末项目 BankMCP 冲上了 Hacker News,它把你多个银行账户的流水接到 Claude、ChatGPT 这类 AI 里,你可以直接问「上个月外卖花了多少」「这笔扣费是哪家」。项目方强调两点,只读(AI 只能看账单不能转账)、服务器自己架(数据不过它的第三方云)。思路是新的,接法也轻,一个下午就能搭起来。项目页 把能问的问题列了一屏。
安全领域专家·老周说|「只读」和「自建服务器」这两个设计我要肯定,比那种直接把网银账号密码交给云端助手的产品清醒得多。但边界不清的老问题还在。账单里全是行为画像,你在哪吃饭、给谁转账、什么时候花钱,AI 看到的不只是余额。你自己架的服务器要管好三件事,接进来的每个 AI 客户端有没有留对话记录、模型服务商会不会把这些查询存进训练数据、服务器钥匙落在谁手里。权限要设到最小,这句话在这里同样成立,先只接一张不重要的卡试。
小编小禾说|查账这事我确实懒,几百条流水翻到眼花。但把银行交给 AI,我第一反应是 041 期那个 7 个 AI 开公司自己发假账单的实验,AI 会自己发明它觉得该干的活。所以我的土办法是,用一张余额少的卡接进去试试水,主力卡先不动,看它会不会问出我都没问过的问题。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1文本盲测榜 TOP 5(Elo 分数,人类投票选出来的名次)
大白话|榜单暂未更新,数据截至 2026-09-08 快照(本期无近 48 小时新榜可替换,未冒充今日数据)。前五名里 Anthropic 一家占了四席,Meta 刚发布的 Muse 系列以第五名贴着第一集团。要留个心眼,第 3 和第 5 名对战数只有三千场上下,置信区间在 ±10 分开外,名次比头部四位虚得多,掉下去很正常。
快报 2智能体实用榜 TOP 5(快照 2026-09-08,AI 替你干真实活,净改进分,越高越好)
大白话|这张榜考的是 AI 当「数字员工」,净改进分是「比人自己干改善了百分之几」。Anthropic 前排包场,OpenAI 最高的 GPT 5.6 Sol 在第五。国产里 Kimi K3 排第 7(净改进 +8.0)、「确认办成事」率 16.6 排全体第二,实际办成事的功夫不差。
快报 3代码能力榜 TOP 5(快照 2026-09-08,写程序盲测,Elo 分数)
大白话|GPT-6 Astra 以 1797 分居首,但它只打了一千出头场盲测,置信区间 ±24 分,是头部五个里样本最薄的,第 2 名差 35 分看着不大,样本攒起来名次随时会晃。阿里 Qwen3.8 和 Kimi K3 挤进前五,是这张欧美榜上少见的中国名字。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
AI 证件照终于不打「换脸」牌了,卖点改成「还是你这张脸」
PortraitDesk 上架,专做职业头像,宣传语直接冲着一堆「生成完连亲妈都不认识」的 AI 写真去的,承诺保住你的脸型、表情和神态,只修光线和背景。
一句话点评|简历照、工牌这类刚需场景,「不像我」就是不及格,这个定位找得准,效果等用户晒对比图再说。
给你网站做「AI味检测」的工具来了,逐句指出哪段像机器写的
SiteTell 会爬完你整站,标出读起来像 AI 套话的词和句式,给出评分和证据,再按规则改写。做内容的人最近这两年怕的不是没流量,是被读者一眼认出「这稿子是 AI 灌的」。
一句话点评|检测自己的稿子这个需求真实存在,但它判定「AI 味」的标准就是它自己的词表,别拿它的分数当判决书。
AI 该拒绝的话题里,只有一小撮真正危险,全砍反而难用
HuggingFace 上一篇研究博客提出,模型拒答常常是整个话题一起拒(比如问什么都装死),但一个话题里真正有害的只是小子集。作者演示了按子集设防的做法,正常问题放行,只拦那一小撮。
一句话点评|这解释了我们平时的憋屈,问个历史题被当成危险分子。护栏做得越糙,用户被误伤越多,方向值得跟进。
AI 让数学产出暴涨,但一位学者警告,这可能是「高产的黑暗时代」
一篇引发讨论的长文担心,AI 让论文产量起飞后,学界「不发表就出局」的游戏规则会把大量 AI 生成但没人真正消化的成果堆进文献里,看着繁荣,实际读懂的人在变少。
一句话点评|OpenAI 今天宣布攻克 90 年数学难题的同一天看到这篇,正好对照。产量和洞察是两回事,这对所有用 AI 干活的人都成立。
一个工程师和 AI 单独干了 8 个月,交出 25 分钟的复盘实录
开发者 Patric Fornasier 写了份体验报告,记录他如何让 AI 通宵干活、自己退出手动环节,包括哪些活交出去放心、哪些交出去翻车。写代码 15 年的人给 AI 「放手」的过程,比普通用户的三天尝鲜值钱。
一句话点评|和上期那位用编程智能体改老游戏的独立开发者同类,都是比官方 demo 更可信的真实样本。
5 万多场铁人三项赛事数据,作者演示怎么用 AI 便宜地把公开数据扒干净
一个跑步数据站站长写了实操教程,讲他怎么在成本极低的前提下用 AI 抓取工具整理 5.3 万场赛事、2.2 万个主办方信息,包括哪些网站让抓、怎么抓不挨封。
一句话点评|「AI 扒公开数据」对小团队是真实生产力,教程难得讲清了成本和边界,做数据整理的人可以存下来。
不许用云端大模型的黑客松,只准手机级别的小 AI 干活
Ryze AI 办了一场 4 周线上黑客松,规则卡死一条,作品只能跑参数量不超过 5 亿的本地小模型,禁止任何云端 API。逼着参赛者拼小模型的极限,而不是拼谁调的旗舰模型贵。
一句话点评|这个赛制本身就是个评测,比出来的作品等于给「小模型到底够用不够用」交了一份集体答卷。
分析公司 Cube 发文,AI 助理想看懂数据,得先给它配一本「词典」
Cube 的工程博客提出,智能体直接对着数据库裸问数很容易问出驴唇不对马嘴的结果,需要先有一层「语义核心」,把「活跃用户」「毛利」这些词的定义钉死,AI 才有统一口径。
一句话点评|厂商讲自家产品逻辑的文章,立场先打个折,但它点的问题是真的,AI 查数错在口径,不错在算术。
又一家 AI 公司把内部研究助理搬上台面,主打「自己人先用了一年」
Applied Compute 公开了内部研究智能体 Ari,卖点是先在自家模型训练流程里干活的内部工具,对外说省掉了研究员翻论文、跑对比实验的重复劳动。
一句话点评|「内部工具转产品」是今年 AI 公司最常见的发布套路,宣传页上的效率数字记得先等客户实单验证。
免费 AI 海报生成器,生成内容会进公开画廊,这条要先看清
Posterlet 主打免费不限量做海报,页面写了一句容易被忽略的话,你生成的图片会展示在公开画廊里。
一句话点评|免费工具拿作品换算力是常见模式,但对拿它做商业海报的人是坑,公司物料别传上去,条款页要读完。
● OpenAI 宣称攻克困扰人类近百年的数学难题,纽约大学数学家同天挂出三个独立证明,「抢发」争议发酵(Guardian / TechCrunch / Wired)
● Meta 发布个人智能体 Muse,自动发邮件订票、强调隐私内建,开始向部分用户收费(Wired / CNBC)
● 中国定 2030 年 AI 算力翻四倍目标,美韩签 220 亿美元天然气电站喂数据中心(SCMP / TechRadar)
● Cognition 融资 20 亿美元估值 480 亿;The Exploration Company 拿 4.5 亿美元挑战 SpaceX(Bloomberg / TechCrunch)
● 安全公司演示首个微信「零点击」蠕虫 WeWorm,漏洞已修复(IT之家)
① OpenAI 数学难题之争继续发酵,看双方证明细节和被质疑的评审反应。
② Meta Muse 智能体向付费用户放量,第一批真实使用反馈值得盯。
③ Arena 榜单若刷新 09-09 快照,验证 GPT-6 Astra 代码榜首的名次在样本变大后稳不稳。
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-09-09
数界工坊 · 全球AI评测雷达