物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.30 · 周三
第 063 期
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1写代码的工具,现在能听你说话了
它能帮你干什么活:IT之家 9 月 30 日消息,OpenAI 在开发者日上宣布 Codex CLI 升级:可以直接用语音下指令,终端界面也换了新样子。Codex CLI 是给写代码的人用的命令行工具,平时得一行行敲命令,以后可以开口说。升级当天只在开发者日上宣布,普通用户暂时还用不上。
编程领域专家·老徐说|语音这条对写代码帮助有限,敲一行命令比说一句话更快,也不会听错。我真正要看两件:新版本接进现有项目顺不顺、它改了哪几处能不能一条条核出来。老规矩不变,别急着搬进生产环境,先拿丢了不心疼的小模块滚一周。
小编小禾说|命令行界面我一看就头疼,这条给我的提醒很朴素:以后可能对着电脑说句话它就动手。真要试,我会先在那不重要的文件夹里试,别一上来就动工作文件。
重点 2国产模型的网络安全能力,被外面的机构公开测了一遍
它能帮你干什么活:美国国家标准与技术研究院下面的机构,给智谱的 GLM-5.3 做了一次网络安全能力评估,把过程写出来挂到了网上。评估的是这个模型会不会被人拿来找漏洞、搞破坏。国产模型能被外部机构这样公开测一遍,是少见的事。
安全领域专家·老周说|值得记的是「外面的人来测、测完公开写」这个做法。这类评估我只看三样:考卷公开没有、评分别人能不能复跑、测的是不是大家手上那一版。普通人不用抠细节,记住一句:被外部公开测过的模型,用起来比只听厂商自己讲踏实。
小编小禾说|「网络安全能力」这几个字我不太懂,大概意思是它会的东西也能被拿去干坏事。我能做的还是那句老话:给它开权限,能开多小开多小。
重点 3没独显的电脑,跑 AI 悄悄快了两成
它能帮你干什么活:Phoronix 实测了 AMD 给自家核显做的一次软件优化。核显是跟处理器做在一起、不用单独买的那种显卡,轻薄本和办公本用的都是它。装上新版系统(Linux 7.4)之后,同一台机器跑 AI 任务快了 18% 到 23%。
穿戴领域专家·阿凯说|数字不大,对没独显的机器却是实打实的:原来勉强能转的小模型,现在转得动了。我盯的还是那三样——热不热、吵不吵、插电撑多久。要验证也简单:拿你平时最重的那件事在这台机器上跑一遍,跑完摸摸烫不烫手,别只看那个百分数。
小编小禾说|我这台笔记本就没独显,跑个本地小工具风扇就呼呼响。等更新推过来,我挑个不急的活试一次,看是不是真快了。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1人类盲投文本榜 · 数据截至 2026-09-25
大白话|这张榜是人类一对一投票投出来的:两个人拿到同一个问题的两份答案,谁也不知道哪份是哪家做的。前五名还是被 Anthropic 一家占满。重点看括号里的场次,那是这个名次背后攒了多少票:第 1 名只有 2,307 票,名次还在晃;第 2 名有 7.6 万票,更靠得住。这张榜这一期没有更新,跟上期是同一份快照,数据截至 2026-09-25。
快报 2实干能力榜 · 数据截至 2026-09-28
大白话|这组考的是让 AI 真上手干活(替你点鼠标、改文件)之后,有没有把事办成。分数叫净改进分,意思是结果比原来好了多少。头名是 Anthropic 的 Fable 5.1,第二是它家的 Opus 5.5,第三是 OpenAI 的 GPT-6 Astra。这张榜这一期也没有换,数据截至 2026-09-28;想看更近的一组,往下看第三张。
快报 3编程榜 · 数据截至 2026-09-29
大白话|这组专门考写代码。榜首是 Anthropic 的 Opus 5.5,紧跟着 OpenAI 的 GPT-6 Astra。还是看括号里的场次:第 1 名只攒了 1,887 场,名次还在晃;第 5 名有 1.6 万场,更靠得住。这张榜这一期更新了,数据截至 2026-09-29,是下面三张里最新的一张。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
给 AI 用的浏览器太慢,有人做了个命令行工具提速
作者说现在 AI 用浏览器查网页慢得让人难受,于是他做了个叫 fab 的小工具专门治这个:让 AI 走命令行去开网页、取内容,绕开笨重的浏览器界面。项目放在 GitHub 上开源。
一句话点评|工具好不好用,先看它省下的那几秒值不值你多学一套命令。
马斯克那本 AI 写的百科又开工了
The Verge 报道,马斯克那边用 AI 写的在线百科 Grokipedia,在停更好几个月之后又开始更新词条了。
一句话点评|AI 写的百科能不能信,先看它引的是谁的原话。
AI 味的海报和菜单,已经铺到大街上了
TechRadar 这篇写的是:AI 生成的内容早就不只在网上,活动海报、咖啡馆菜单这些现实里的印刷品也满是它的痕迹。文章说 AI 让做宣传变便宜了,代价是粗制滥造的东西变多了。
一句话点评|看到一张海报,多问一句这是谁做的,比吐槽它丑有用。
AI 太好用的时候,这名开发者建议你偶尔自己硬啃
这位开发者写了自己最近的矛盾:编程、健康咨询、投资这些事都能交给 AI 了,可他发现自己越来越不愿意动脑。他给出的做法是挑一部分事坚持自己啃,别让省事把基本功废掉。
一句话点评|省力气没错,但别把判断也一起交出去。
想用 AI 又怕资料被看,有人把机器锁进小隔间
这个项目走的是硬件路线:用能隔离数据的专用芯片来跑 AI,让处理过程锁在一个别人打不开的小隔间里。它瞄准的是那些没法把资料交出去的场景,比如医院和银行。
一句话点评|隐私这事,看它能不能证明自己看不到,而不是听它保证。
搜索换了个用法:不给你链接,直接派一个 AI 去干
这个小工具把搜索改成了另一条路:你输入一句需求,它不去给你一堆网页链接,而是临时找一个能替你干这件事的 AI 跑一趟,再把结果交给你。项目发在 Python 的包仓库里。
一句话点评|让 AI 替你干活,先看它跑完有没有留下记录。
想知道自己到底会不会,让 AI 面你一轮
作者做了个小应用来考人:你选一门技能、填上名字,AI 就照着面试的路子问你问题,看你是不是真懂。他说想法来自面试里最难判的那件事——这个人到底会不会。
一句话点评|被 AI 考完别只盯分数,看它问的那几个问题是不是真难。
整理文件这件事,有人让 AI 全在你电脑上做
这个 Mac 上的小工具用本机跑的 AI 帮你把桌面上、下载夹里的文件归类。它的卖点是全程不联网,文件不出你这台机器。
一句话点评|碰私人文件的工具,先确认它是不是真的不上网。
全交给 AI 写还是自己写,有人把这道选择题摊开了
这篇短文说,AI 编程工具来了以后,写代码的人卡在一个两难里:全交给它,怕自己看不懂也管不住;不用它,又怕比别人慢。作者把两边的代价都摆了一遍。
一句话点评|两头不用选到底,按活的风险分着用更实在。
给 AI 写的代码把关,有人做了个 Mac 上的小工具
这个 Mac 应用只干一件事:把你让 AI 写的代码摊开,一段段帮你过一遍,标出它觉得有问题的地方。它是个要花钱的小工具,标价 5.99 美元。
一句话点评|审代码这活,工具只能帮你标出来,改不改还是你说了算。
● 国产模型 GLM-5.3 的网络安全能力,被 NIST 下面的机构公开评估了一遍(NIST)
● DeepSeek 开源了一整套面向华为昇腾平台的软件组件(IT之家)
● Anthropic 与 SpaceX 签下最高 845 亿美元的大单,包的是跑 AI 要用的机器资源(IT之家)
● 特朗普与一批科技巨头签下 AI 自愿安全协议,同时表态支持数据中心扩建(IT之家)
● OpenAI 计划在上市前再融至少 300 亿美元,估值约 1.4 万亿美元(IT之家)
① 国产模型被外面机构公开测一遍,会不会变成常事:盯下一份评估报告是不是也把考卷和评分一起公开。
② 写代码的工具开始能对话了,会不会真有第三方拿它做对比测试:盯有没有独立成绩,别只看官方演示。
③ Anthropic 与 SpaceX 那笔大单怎么落地:盯那批机器资源会不会进到普通人用得起的套餐里。
物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.30 · 周三
第 063 期 · 预览版
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1AMD 给核显做了个省力优化,跑 AI 快了 18% 到 23%
它能帮你干什么活:Phoronix 实测了 AMD 对自家核显做的优化:换上新版系统(Linux 7.4)之后,同一台机器跑 AI 任务比原来快 18% 到 23%。核显是跟处理器做在一起、不用单独买的那种显卡,轻薄本和办公本用的基本都是它。换句话说,你手上那台没有独立显卡的电脑,跑本地 AI 可能比原来顺一点。
穿戴领域专家·阿凯说|百分比看着不大,对没独显的机器却是实打实的:原来勉强能转的小模型,现在可能转得动了。我盯的还是那三样——热不热、吵不吵、插电撑多久。普通人要验证也简单:拿你平时最重的那件事在这台机器上跑一遍,跑完摸摸烫不烫手,别只看官方那个百分数。
小编小禾说|我这台笔记本就没独显,跑个本地小工具风扇就呼呼响。这条我先记下:等更新推过来,挑个不急的活试一次,看是不是真快了。
重点 2让 AI 替科学家做发现这件事,开始被单独拎出来考
它能帮你干什么活:MIT 科技评论的每日简报里提到一个新题目:AI 的发现难题,说的是让 AI 帮忙做科研时,怎么分清它给的到底是新东西还是编出来的。同一篇还提到,OpenAI 因为安全上的顾虑,撤下了一款本来要发布的新模型。两件事放在一起看,说的是同一层道理:本事越大,越要先有一套能验它的办法。
安全领域专家·老周说|撤模型这一步比发出来更值得记一笔,说明厂商自己也没把边界摸清。这类事我只看三样:考卷公开没有、评分别人能不能复跑、测的是不是用户手上那一版。换成普通人能用的一句:宣称本事大的 AI,先用不重要的事试,别一上手就把要紧的活交给它。
小编小禾说|科研这种话我不敢接,但撤模型这件事我懂了:它自己都没把握。我的做法还是老一套,拿不准的先自己核一遍再往外说。
重点 3写代码的工具开始能听你说话了
它能帮你干什么活:IT之家 9 月 30 日消息,OpenAI 在开发者日上宣布 Codex CLI 升级:可以直接用语音下指令,终端界面也换了新样子。Codex CLI 是给写代码的人用的命令行工具,平时要一行行敲命令,以后可以开口说。
编程领域专家·老徐说|语音这条对写代码的帮助有限,敲一行命令比说一句话快,也不会听错。我真正要看的是两件:新版本接进现有项目顺不顺、它改了哪几处能不能一条条核出来。老规矩不变:别急着搬进生产环境,先拿丢了不心疼的小模块滚一周。
小编小禾说|命令行界面我一看就头疼,这条给我的提醒很朴素:以后可能对着电脑说句话它就动手。真要试,我会先在那个不重要的文件夹里试,别一上来就动工作文件。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1人类盲投文本榜 · 数据截至 2026-09-25
大白话|这张榜是人类一对一投票投出来的:两个人拿到同一个问题的两份答案,谁也不知道哪份是哪家做的。前五名还是被 Anthropic 一家占满。重点看括号里的场次,那是这个名次背后攒了多少票:第 1 名只有 2,307 票,名次还在晃;第 2 名有 7.6 万票,更靠得住。这张榜这一期没有更新,跟上一期是同一份快照,数据截至 2026-09-25。
快报 2实干能力榜 · 数据截至 2026-09-28
大白话|这组考的是让 AI 真上手干活(替你点鼠标、改文件)之后,有没有把事办成。分数叫净改进分,意思是结果比原来好了多少。头名是 Anthropic 的 Fable 5.1,第二是它家的 Opus 5.5,第三是 OpenAI 的 GPT-6 Astra。这张榜这一期也没有更新,数据截至 2026-09-28。想看新鲜一点的数字,看下面第三组。
快报 3第三方智能指数榜(Artificial Analysis)· 2026-09-30 查阅
大白话|这组不是 Arena 的榜,是第三方评测机构 Artificial Analysis 的智能指数,我们在 2026-09-30 查的(这家站点不标具体更新日)。智能指数是把十几门考卷的分数合成一个总分,分越高说明会干的活越全。前五名里 Anthropic 占了三席,OpenAI 的 GPT-6 Astra 第五。国产这边,小米的 MiMo-V2.6-Pro 排第八,是开放权重(把模型本身公开、谁都能下载到本机跑)里最高的一个;阿里 Qwen3.8 Max 和智谱 GLM-5.3 都是 45 分。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
给 AI 用的浏览器太慢,有人做了个命令行工具提速
作者说现在 AI 用浏览器查网页慢得让人难受,于是他做了个叫 fab 的小工具专门治这个:让 AI 走命令行去开网页、取内容,绕开笨重的浏览器界面。项目放在 GitHub 上开源。
一句话点评|工具好不好用,先看它省下的那几秒值不值你多学一套命令。
马斯克那本 AI 写的百科又开工了
The Verge 报道,马斯克那边用 AI 写的在线百科 Grokipedia,在停更好几个月之后又开始更新词条了。
一句话点评|AI 写的百科能不能信,先看它引的是谁的原话。
AI 味的海报和菜单,已经铺到大街上了
TechRadar 这篇写的是:AI 生成的内容早就不只在网上,活动海报、咖啡馆菜单这些现实里的印刷品也满是它的痕迹。文章说 AI 让做宣传变便宜了,代价是粗制滥造的东西变多了。
一句话点评|看到一张海报,多问一句这是谁做的,比吐槽它丑有用。
AI 太好用的时候,这名开发者建议你偶尔自己硬啃
这位开发者写了自己最近的矛盾:编程、健康咨询、投资这些事都能交给 AI 了,可他发现自己越来越不愿意动脑。他给出的做法是挑一部分事坚持自己啃,别让省事把基本功废掉。
一句话点评|省力气没错,但别把判断也一起交出去。
想用 AI 又怕资料被看,有人把机器锁进小隔间
这个项目走的是硬件路线:用能隔离数据的专用芯片来跑 AI,让处理过程锁在一个别人打不开的小隔间里。它瞄准的是那些没法把资料交出去的场景,比如医院和银行。
一句话点评|隐私这事,看它能不能证明自己看不到,而不是听它保证。
搜索换了个用法:不给你链接,直接派一个 AI 去干
这个小工具把搜索改成了另一条路:你输入一句需求,它不去给你一堆网页链接,而是临时找一个能替你干这件事的 AI 跑一趟,再把结果交给你。项目发在 Python 的包仓库里。
一句话点评|让 AI 替你干活,先看它跑完有没有留下记录。
想知道自己到底会不会,让 AI 面你一轮
作者做了个小应用来考人:你选一门技能、填上名字,AI 就照着面试的路子问你问题,看你是不是真懂。他说想法来自面试里最难判的那件事——这个人到底会不会。
一句话点评|被 AI 考完别只盯分数,看它问的那几个问题是不是真难。
英国快递公司试了台两条腿的送货机器人,会爬楼梯
TechRadar 报道,Evri 在英国试跑一台两条腿的送货机器人,卖点是能上楼。公司自己把话说得很清楚:这东西是给快递员搭把手,不是替掉人。
一句话点评|楼梯这种活,先等它装满货在真楼道里跑几趟再说。
整理文件这件事,有人让 AI 全在你电脑上做
这个 Mac 上的小工具用本机跑的 AI 帮你把桌面上、下载夹里的文件归类。它的卖点是全程不联网,文件不出你这台机器。
一句话点评|碰私人文件的工具,先确认它是不是真的不上网。
全交给 AI 写还是自己写,有人把这道选择题摊开了
这篇短文说,AI 编程工具来了以后,写代码的人卡在一个两难里:全交给它,怕自己看不懂也管不住;不用它,又怕比别人慢。作者把两边的代价都摆了一遍。
一句话点评|两头不用选到底,按活的风险分着用更实在。
● OpenAI 开发者日一次发了三样:常驻的 AI 助手 dots、每月 500 美元的 Pro 套餐、新的协同工具(IT之家)
● OpenAI 为自家 AI 助手闯进澳大利亚政府网站道歉(TechCrunch)
● Anthropic 的招股书里写着:AI 可能带来灾难性风险(The Verge)
● 美国白宫上线 AI 聊天机器人 America.gov,帮人查政府办事流程(TechCrunch)
● 智能穿戴公司 OURA 推迟上市,理由是市场不确定(IT之家)
① OpenAI 那批新东西什么时候真能用上:盯 dots 和每月 500 美元套餐的开放范围,别只看发布会。
② Arena 那几张榜多久真正刷新一次:盯各分榜标的更新日能不能落到同一周,别再连着几期发同一份快照。
③ AI 助手闯进政府网站这件事怎么收尾:盯 OpenAI 会不会把它能碰什么、谁在看记录讲出来。
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-09-30
数界工坊 · 全球AI评测雷达