物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.15 · 周二

第 048 期

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 17名博士生一个暑假「手搓」出一个大模型:训练全过程摊开给你看

它能帮你干什么活:北京中关村学院的7名博士生,用一个暑假从零训练出一个7B规模的大模型ZGCM-1,而且把各阶段代码、训练数据和训练日志全部公开,报道说有几百个AI智能体参与了研发。对普通人来说,这件事的重点不是模型多强,而是「造一个AI」的全过程第一次被摊在桌面上:算力怎么花、哪一步翻车、怎么修,外界都查得到。这种「日志全公开」的打法,恰恰是第三方评测最需要的原始材料。

编程领域专家·老徐说|我十五年只信可复现日志,这次是少见的正面样本:不是发布会海报,是代码、数据、训练日志三件套全开源,几百个Agent参与研发说明「AI造AI」已经从口号走到实操。但提醒一句:7B的公开成绩单和量产旗舰不是一个量级,这份材料对你理解「大模型是怎么炼成的」值钱,对选型参考有限。

小编小禾说|训模型我是外行,但我看懂了一个区别:厂家自己说「我们很强」,和7个学生把答案全过程摊出来让别人查,我更信后者。老规矩:公开原始材料的算及格一半,等有人照着日志复跑一遍成功,才算全及格。

来源:量子位(2026-09-15)

重点 2AI安不安全,该不该换裁判?彭博把这问题摆上了台面

它能帮你干什么活:彭博9月14日的节目专门讨论「独立测试能不能让AI更安全」——这几天行业从「放缓前沿」吵到该不该请第三方审核,声音逐渐汇到一处:与其信厂商自己发成绩单,不如把最强模型交给外部机构公开测。这直接关系到你用的AI助手,那句「我们安全、不会乱来」到底有没有人验证过。

安全领域专家·老周说|护栏只建在厂商自觉上,等于没有——这话我说了一个月,现在行业口头共识算是立住了。但共识不等于落地,独立测试必须过三问:考题给不给公开、评分可不可复现、测的是不是用户手上那个版本。9月13期我说过「你评测的智能体可能不等于你部署的智能体」,三问缺一,独立测试就是自报分数换了个信封。

小编小禾说|换裁判我举双手赞成,但我的门槛不变:哪天某家AI的「安全体检报告」连着两期名次没大变、原始数据还能下载,我才敢拿它当挑工具的依据——运动员自己发奖牌不行,裁判临时找的也不行。

来源:Bloomberg Tech(2026-09-14)

重点 3扫地机新旗舰:「平价机皇」这四个字,Wired长测说了算还是直播间说了算

它能帮你干什么活:Wired发布了石头Qrevo 2的家用长测,标题直接抛出「新的平价扫地机之王?」——避障灵不灵、边角扫不扫得净、基站洗拖布会不会发臭,都是编辑在家里实打实用出来的结论,不是参数表。对纠结「几千块扫的地值不值」的人,第三方长测比发布会PPT有用得多。

穿戴领域专家·阿凯说|我评硬件的信一条:吃灰第一原因是安装和充电顺不顺手,从来不是吸力参数。这篇长测要盯的就是基站维护和边角覆盖写得实不实——发布会永远不写的,恰恰是「戴一整天你就知道了」的部分。9月2期我国内牵头的家用机器人11项测试标准刚立起来,往后机皇之争拿公开成绩说话,单一媒体好评只算半场。

小编小禾说|「平价机皇」先记到账上,等评论区吵起来再定——每次新品首发,总有两周后的翻车实录冒出来。家里养宠物毛多的,别信标题,直接搜三个月以上的长用贴,那才是买家秀原版。

来源:Wired(2026-09-14)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1人类盲测·文本榜(Arena,快照9月13日,今晨确认已更新)

#模型厂商Elo(±误差)对战数
1Claude Fable 5Anthropic1506(±5)30057
2Claude Opus 4.6 HighAnthropic1505(±4)71993
3Claude Opus 4.7 HighAnthropic1502(±4)60002
4Muse Spark 1.2(xHigh)Meta1500(±11)3227
5Claude Fable 5.1 MaxAnthropic1498(±8)5783

大白话|人类出题、人类当裁判的盲测里,Anthropic前十独占七席——几乎一家包场。看点在Meta神秘选手Muse Spark 1.2排第4,但只有3227场对战、±11分置信区间,比头名宽一倍还多,名次先记账别当真。

快报 2代码榜(Arena,快照9月11日)

#模型厂商Elo(±误差)对战数
1GPT-6 Astra MaxOpenAI1800(±16)2281
2Claude Fable 5.1 MaxAnthropic1758(±14)3036
3Claude Opus 5 MaxAnthropic1687(±7)12087
4Qwen3.8-Max-0902阿里1681(±15)2262
5Kimi K3 Max月之暗面1674(±11)4547

大白话|榜首领先第三名42分,对战数却只有2281场、±16分——前五里样本最薄,小样本的Elo是会晃的,过几天再认账。真正的信号是两款国产模型双双挤进前五:写代码这件事,开源阵营追得比榜单标题看起来凶。

快报 3视觉 + 智能体(Arena,快照9月13日)

大白话|视觉盲测:Claude Fable 5以1310分居首,阿里Qwen3.8-Max 1302分紧咬第二——前二里唯一非Anthropic选手,只差8分。智能体榜(AI替你干真活的「净提升」分):Claude Fable 5.1(Max)13.9分第一、GPT-6 Astra(Max)11.9分第二;Kimi K3(Max)以10.4万场会话是全场样本最扎实的选手,6.39分(±0.68)排第八——分数不高但名次可信度最高。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

不靠显卡机房的小模型,第一次有了「成绩单」

GitHub上刚开张的「裸机AI」榜,收录不依赖大框架、用C/C++/Rust手写的超轻量AI引擎,宣传口径是零依赖、亚毫秒响应,还附逐项基准索引——让AI直接在你手上的设备里跑起来的那批「小钢炮」,第一次被拉到同一张考卷下排名。

一句话点评|老徐提醒:出题计分都是仓库主自定,新考场先记账,挑榜上最漂亮的两个拿自己的活跑一周再谈。

来源:Hacker News / GitHub(2026-09-14)

AI声称解出千年数学难题:结果轰动,争议更大

9月15日登热的博文称,克拉数学研究所千年难题中的Navier-Stokes方程问题被新AI攻破,作者笔锋却对准「结果怎么验证、学界信不信」——一场本该是庆典的发布,先变成了可信度之争。

一句话点评|小禾规矩适用:「AI又神了」先问「别人复现了吗」,没有独立复核之前,题再大也不算数。

来源:Hacker News / The Zvi(2026-09-15)

把AI账单拆成四段看,才知道钱浪费在哪

一位工程师提出给AI调用费分类:加载模型、思考、调度干活、出结果四段分别算钱。现在的账单只会笼统告诉你花了多少字数(token)的钱,分不清哪些是有效思考、哪些是AI傻乎乎整本翻书。

一句话点评|延续9月10期烧钱表思路:让AI少读没用的材料,就是最实在的省钱法。

来源:Hacker News / Jeff Auriemma(2026-09-15)

安全研究员现场演示:一封邮件就能劫持客服AI

Intigriti团队把指令藏进邮件正文转发给AI客服系统,就能让它绕过规则、泄露其他客户信息——客服AI分不清「客户来信」和「给系统的命令」,提示词注入经典复发,9月15日登HN热榜。

一句话点评|老周的老话再添一锤:分不清数据和指令,是边界不清的结构性老毛病,不是偶发。

来源:Hacker News / Intigriti(2026-09-15)

AI助手记性太好也是病:昨天的正确答案,今天全错了

一篇工程师博客点名智能体的「缓存失效」问题:给AI配了长期记忆后,它会把过期结论(改前的价格、删掉的流程)当真理继续用,而且语气笃定。作者建议给AI的记忆设保质期,定期强制重验。

一句话点评|小禾9月3期的土办法有了工程版:重要偏好定期翻AI的「记忆本」核一遍,它记的和我说的可能两码事。

来源:Hacker News / Dr. Josh Simmons(2026-09-14)

1325个「AI参与写的」代码库被扒成公开数据集

研究者从GitHub挖出并公开1325个有AI辅助痕迹的代码仓库清单——想研究「AI写的代码到底靠不靠谱」的人,第一次有了大样本底库。

一句话点评|老徐等的就是这类素材:产量统计之后,终于能拿真实仓库测AI代码的存活率了。

来源:Hacker News / GitHub Strata(2026-09-14)

开箱即跑本地模型的最小AI助手,作者自嘲「就一壳子」

Show HN上的新玩具Otis:极简智能体,装好就能调用本地模型干活,不接云、不注册账号,「数据不出机器」是全部卖点。

一句话点评|断网能用是刚需,但按老规矩:先等别人实测小模型会不会「换小脑子变笨」。

来源:Hacker News / TriangLabs(2026-09-14)

断网也能用的时间记录器,AI只在你电脑里跑

Threshyr 1.2.1自动记录你在哪个窗口干了多久,端侧AI把你一天归总成「时间块」报告,全程不上传——适合想知道「一天到底耗在哪」又担心隐私的人。

一句话点评|小禾提醒:这类工具要一直开后台,先拿备用机试水两周再上主力机。

来源:Hacker News / Threshyr(2026-09-15)

让AI助手直接读写你的项目甘特图

ProGantt把传统项目排期图和MCP(让AI直连软件的通用接口)打包:接上编辑器或Claude Desktop,AI就能看排期、改任务、补进度,人只管批。

一句话点评|9月1期教训记得:AI改配置不留报错,合并前必看改动清单。

来源:Hacker News / ProGantt(2026-09-14)

AI帮忙整理十万人的访谈,社会科学研究先卷起来

arXiv论文讲了一套用AI做大规模质性研究的基础设施:上万人问卷访谈的原始文本,AI能分类、归纳、出主题报告,作者重点讨论怎么防AI在归纳时夹带私货。

一句话点评|离日常还远,但「AI读海量文字做总结」这条能力,正被研究方法圈正经检验。

来源:arXiv(2026-09-15)

大家都在看 · HOT

●  short-video-generator-AI等12个开源AI项目登第38周热度榜,一周榜单看尽开源风向(Hacker News / TheZakulo 周报)

●  Arena文本盲测前十Anthropic独占七席、Meta两席、谷歌一席——人类裁判的牌桌快被一家包场

●  Arena代码榜GPT-6 Astra以1800分居首,但仅2281场对战,样本前五最薄

●  阿里Qwen3.8-Max视觉榜1302分排第二,距榜首仅8分;Kimi K3智能体榜10.4万场会话样本全场最扎实

明日关注 · TOMORROW

①  Arena榜单下一批刷新:盯Claude Fable 5.1 Max(文本第5、5783场)对战数能不能攒够,Muse Spark 1.2(±11分)名次坐不坐得稳

②  7名博士生开源的7B模型:等第三方照训练日志复跑,验证「AI造AI」的成色

③  「放缓前沿」之吵的下一步:盯有没有厂商真公开给独立测试的考题和原始数据,共识落地才算数

④  国产模型双进代码榜前五后:Qwen3.8-Max、Kimi K3的下一轮快照名次,先记账不入场

—— 以下为早上预览版 ——

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.15 · 周二

第 048 期 · 预览版

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1想在自己旧电脑上跑 AI?先看看这份「裸机 AI」成绩单

它能帮你干什么活:有人刚在 GitHub 上搭了一个「裸机 AI」榜,专门收录不依赖任何大框架、用 C/C++/Rust 手写的超轻量 AI 引擎——宣传口径是零依赖、亚毫秒级响应。也就是让 AI 不靠显卡机房、直接在你手上的设备里跑起来的那批「小钢炮」,现在第一次有人把它们拉到同一张考卷下排名。榜单还附了一份基准索引,逐项标各家引擎的速度和支持的模型。

编程领域专家·老徐说|这类新榜单仓库我刚看一眼就想起老规矩:出题、计分都是仓库主自己定的,「零依赖」「亚毫秒」这些词宣传味很重。方向我举双手赞成——端侧 AI 真需要一张公开成绩单,别各说各话。但选型先别冲:跑分归跑分,接进真实设备前,先挑榜上分数最漂亮的两个,拿自己的活跑一周看断在哪一步。

小编小禾说|「在自己电脑上跑 AI」听着很美,但我这种小白就关心一句:装起来麻烦吗?要不要买新硬件?这榜连教程都还没几篇,我先收藏不动手,等有人拿普通笔记本实测「跑到什么速度、笨不笨」再说——这毛病是 8 月 15 期就落下的:断网能用是刚需,就怕本地版偷偷换小脑子变笨。

来源:Hacker News / GitHub(awesome-baremetal-ai)(2026-09-14)

重点 2AI 安不安全,凭什么让厂家自己说了算?彭博这场讨论把「第三方评测」摆上台面

它能帮你干什么活:彭博 9 月 14 日的一期视频节目专门讨论了同一个问题——独立测试到底能不能让 AI 更安全。背景是这几天行业吵翻天的「放缓前沿」之争:Anthropic 的 CEO 发文呼吁给最强模型踩刹车,OpenAI、马斯克跟着表态。吵到最后,大家不约而同指了同一个方向:与其信厂商自己发成绩单,不如交给外部机构来测。对普通人来说,这关系到你用的 AI 助手「不会乱来」这句话,是谁验证过的。

安全领域专家·老周说|这句话我说了很多遍:护栏只建在厂商自觉上,等于没有。独立测试是对的方向,但要盯三件事——考题给不给公开、评分逻辑可不可复现、被测的是不是你手上那个版本。9 月 13 期我说「你评测的智能体可能不等于你部署的智能体」,独立测试要是测的是特供版,公信力和自报分数没区别。

小编小禾说|翻译一下:以前是运动员自己给自己发奖牌,现在有人提议请外面的裁判。我站独立裁判,但老规矩不变——哪天我看到某个 AI 的「安全体检报告」连着两期名次没大变、原始数据还能下载,我才敢把它当成挑工具的依据。

来源:Bloomberg Tech(2026-09-15)

重点 3扫地机也进「考卷时代」:Wired 实测石头新旗舰,直呼平价机皇易主?

它能帮你干什么活:Wired 发布了石头(Roborock)新款 Qrevo 2 的长测,标题直接问「新的平价扫地机之王?」。评测圈的老规矩是参数谁都会写,长测才见真章——避障灵不灵、边角扫不扫得净、基站洗拖布臭不臭,都是编辑在家里实打实用出来再落笔的。对纠结「几千块扫的地到底值不值」的人,这类第三方长测比直播间喊话有用得多。

穿戴领域专家·阿凯说|我评硬件的信一条:吃灰第一原因是安装和充电顺不顺手,不是吸力参数。这期重点看 Wired 怎么写基站维护和边角覆盖——这两项是扫地机的「戴一整天你就知道了」时刻,宣传页永远不写。9 月 2 期我国内牵头的家用机器人 11 项测试标准刚立起来,以后的机皇之争,得拿公开成绩说话,单一媒体好评只算半场。

小编小禾说|「平价机皇」四个字我先记到账上,等评论区吵起来再定——每次新品首发,评论区总有人晒两周后的翻车实录。家里有宠物毛的,别信标题,去搜三个月以上的长用贴,那才是买家秀原版。

来源:Wired(2026-09-14)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1综合智能指数(Artificial Analysis · 今晨 6 点现拉)

#模型厂商综合评分
1Claude Fable 5.1(max)Anthropic53
1Claude Fable 5.1(xhigh)Anthropic53
3GPT-6 Astra(max)OpenAI53
4Claude Opus 5(max)Anthropic51
开源第一GLM-5.3(max)智谱45

大白话|最强大模型三家咬死在 53 分并列第一;真正的看点在免费开源阵营——智谱 GLM-5.3 以 45 分第一次压过月之暗面 Kimi K3(44 分),「白嫖最强」的旗子换人扛了。速度榜 Celeris-1 每秒能吐 1418 个字(token),最快。

快报 2中文权威榜(SuperCLUE · 9 月 11 日更新)

#模型总分变动
国产第二DeepSeek V4.1-Flash71.81首次进榜
3GLM-5.371.29从 63.27 大涨、跳至第 3

大白话|DeepSeek 上周(9 月 10 日)刚发的 V4.1-Flash 第一次参加「中文模型大考」就冲到国产第二;GLM-5.3 一口气涨了近 8 分。LMArena 的全球公司榜上,智谱也被 GLM-5.3 带着从第 6 升到第 5,把月之暗面挤了下去——国产开源这波排名在动真格。

快报 3会干活的 AI(用电脑 / 看病 / 综合对齐,数据截至 9 月 8-10 日)

大白话|「AI 替你操作电脑」的 OSWorld 考试(截至 9 月 10 日):中国团队实在 Agent 以 90.2% 登顶,第二名 Claude Fable 5 是 86.0%;医生考卷 HealthBench(9 月 8 日更新):Claude Fable 5 得分 0.660 领跑,而人类医生基线只有 0.437——注意,考卷本身偏简单,别看 AI 高分就以为能看病;综合对齐榜 BenchAlign(9 月 10 日快照)前三名还是 Claude Fable 5.1、GPT-6 Astra、Claude Opus 5。另:Arena 人类盲测榜快照仍是 9 月 14 日那批、与上期相同,榜单暂未更新,不作今日新变动引用。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

把 AI 账单拆成四段看,才知道钱浪费在哪

一位工程师提出给 AI 调用费分类:加载模型、思考、调度干活、出结果四段分别算钱。现在账单只会笼统告诉你花了多少字(token)的钱,分不清哪些是有效思考、哪些是 AI 傻乎乎整本翻书。

一句话点评|延续 9 月 10 期烧钱表的思路:让 AI 少读没用的材料,就是最实在的省钱法。

来源:Hacker News / Jeff Auriemma(2026-09-15)

AI 帮忙整理十万人的访谈,社会科学先卷起来了

8 月 30 日提交的 arXiv 论文讲了一套用 AI 做大规模质性研究的基础设施:上万人问卷访谈的原始文本,AI 能分类、归纳、出主题报告,作者讨论怎么防 AI 在归纳时夹带私货。

一句话点评|研究方法类论文,离你日常还远,但它说明「AI 读海量文字总结」这条能力正被正经检验。

来源:arXiv(2026-09-15)

不会写代码也能上:用固定流程指挥 AI 做软件

一篇写给外行的博客提出「流程驱动」的 AI 开发:不是跟 AI 聊天式碰运气(行话叫氛围编程),而是把需求、验收标准写成固定工作流,AI 按流程产出、人只在节点上检查。

一句话点评|思路和老徐 9 月 7 期夸过的「改现有小项目、当场验证」同路:把 AI 关进流程里,比指望它灵光更靠谱。

来源:Hacker News / Codeyam Blog(2026-09-15)

安全研究员现场演示:一封邮件就能劫持客服 AI

Intigriti 团队 9 月 2 日发布研究(9 月 15 日登 HN 热榜):把指令藏进邮件正文转发给 AI 客服系统,就能让它绕过规则、泄露其他客户信息——客服 AI 分不清「客户来信」和「给系统的命令」,是提示词注入的经典复发。

一句话点评|老周的老话再添一锤:分不清数据和指令,是边界不清的结构性老毛病,不是偶发。

来源:Hacker News / Intigriti(2026-09-15)

AI 助手记性太好也是病:昨天的正确答案,今天全错了

一篇工程师博客点名智能体的「缓存失效」问题:给 AI 配了长期记忆后,它会把过期结论(改前的价格、删掉的流程)当真理继续用,而且语气笃定。作者建议给 AI 的记忆设保质期,定期强制重验。

一句话点评|小禾 9 月 3 期的土办法有了工程版:重要偏好定期翻 AI 的「记忆本」核一遍,它记的和我说的可能两码事。

来源:Hacker News / Dr. Josh Simmons(2026-09-14)

AI 批量伪造「老板催款邮件」,安全圈预警 BEC 新阶段

安全公司 Decipher 报告:商业邮件诈骗(BEC)进入 AI 量产期——骗子借正规第三方邮件服务,把发件人显示成公司高管、称呼细节全对,转账指令写得比真人还客气,语法生硬这个老识别破绽基本消失。

一句话点评|老周 9 月 13 期新标准再加一条场景:凡是邮件里催你转账汇款的,一律电话回拨本人核实——AI 味儿闻不出来,制度闻得出来。

来源:Hacker News / Decipher(2026-09-14)

1325 个「AI 参与写的」代码库被扒出来了

研究者从 GitHub 上挖出并公开了 1325 个有 AI 辅助痕迹的代码仓库清单,做成数据集——想研究「AI 写的代码到底靠不靠谱」的人第一次有了大样本底库。

一句话点评|老徐等的那类素材:产量统计之后,终于可以拿真实仓库测 AI 代码的存活率了。

来源:Hacker News / GitHub (Strata)(2026-09-14)

开箱即跑本地模型的最小 AI 助手,作者自嘲「就一壳子」

Show HN 上的新玩具 Otis:一个极简智能体,装好就能调用本地模型干活,不接云、不注册账号。作者坦白它功能少,但「数据不出机器」是全部卖点。

一句话点评|方向对胃口(断网能用是刚需),但按老规矩:先等别人实测小模型会不会「换小脑子变笨」。

来源:Hacker News / TriangLabs(2026-09-14)

断网也能用的时间记录器,AI 只在你电脑里跑

Threshyr 1.2.1:自动记录你在哪个窗口干了多久的活,端侧 AI 把你一天归总成「时间块」报告,全程不上传。适合想知道「一天到底耗在哪」又担心隐私的人。

一句话点评|小禾提醒:这类工具要一直开后台,先拿备用机试水两周再上主力机(8 月 30 期老规矩)。

来源:Hacker News / Threshyr(2026-09-15)

让 AI 助手直接读写你的项目甘特图

ProGantt 把传统项目管理甘特图和 MCP(让 AI 直连软件的通用接口)打包:接上编辑器或 Claude Desktop,AI 就能看排期、改任务、补进度,人只管批。

一句话点评|「AI 替你管排期」听着省事,但 9 月 1 期教训记得:AI 改配置不留报错,合并前必看改动清单。

来源:Hacker News / ProGantt(2026-09-14)

大家都在看 · HOT

●  智谱 GLM-5.3 带动公司榜从全球第 6 升至第 5,挤下月之暗面(LMArena 公司榜,9 月 11 日批次)

●  人类盲测 Arena 文本榜前八里 Anthropic 独占六席、Meta 两席——但快照仍是 9 月 14 日批次,暂未更新

●  「中文模型大考」SuperCLUE 前十里 DeepSeek V4.1-Flash 首进榜即国产第二(71.81 分)

●  开源第一易主:GLM-5.3(45 分)压过 Kimi K3(44 分),GLM-5.3-Flash 42 分紧随(Artificial Analysis 开源榜)

明日关注 · TOMORROW

①  SuperCLUE、LMArena 公司榜下一批更新:看 GLM-5.3 第 3 名的位置坐不坐得稳,新名次先记账不入场

②  DeepSeek V4.1-Flash 的第三方复跑:官方说「推倒重来、更快更准」,等独立考场重新考一遍再当真

③  Arena 快照若今日更新:重点盯 claude-fable-5.1-max(目前仅 5783 场对战、样本最薄)票数能不能攒到置信

④  开源榜三国杀:GLM-5.3、Kimi K3、GLM-5.3-Flash 分差都在 3 分内,任何一次刷新都可能换榜首

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-09-15

数界工坊 · 全球AI评测雷达