物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.27 · 周日
第 060 期
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1AI 写的代码读着通顺,不等于它做对了:有人给了三步复核法
它能帮你干什么活:9 月 26 日社区平台 wearecommunity 上一篇讲代码复核的文章。它把话说得很平:AI 写出来的代码读着顺,不能拿这件事当证据。它给的做法可以概括成三步——先说清这段代码要办成什么事,再看它动了哪些文件,最后拿一个能重复跑的例子验一遍。三步里最常被省掉的是第二步,而动过配置和权限的改动,恰恰都藏在第二步里。
编程领域专家·老徐说|AI 写的代码最坑的地方,是它读起来像人写的。我只盯一件事:改动范围。动三行的补丁我扫一眼就过;碰了配置和权限的,本地先跑一遍,再回头查线上有没有异常。第三步最费时间,也最省事。
小编小禾说|我让 AI 改过一份表格脚本,它回「已修复」,一跑还是报错。后来我改了顺序:先让它说清改了哪几行,再自己点一次运行。多花两分钟,不用来回折腾一小时。
重点 2一个带触摸屏的小盒子,想把做图做片的活儿全包下来:上手实测
它能帮你干什么活:9 月 27 日 TechRadar 发了一台便携 AI 工作站 PixelMob 的实测。它是一台带触摸屏的小盒子,思路是做图做片的人把素材和出片都放在这一台上,接口留了不少位置。这篇写的是用起来什么感觉,不是念参数表:屏幕多大、机器多重、能插什么,都按上手的结果说。
穿戴领域专家·阿凯说|「一个盒子全包」的机器,我买之前只问三件事:满载跑起来烫不烫、风扇吵不吵、插着电能撑几个小时。这三行参数页从来不写。真想掏钱,先去店里摸一遍机身,跑你自己最重的那个活儿。
小编小禾说|「便携」两个字对我杀伤力很大,可我的笔记本已经能跑画图工具了。我先记账:等有人拿它连着做一周片子,把发热和电费也写出来,我再考虑。
重点 3让你的 AI 助手去跟朋友的助手私聊:有人把这做成了产品
它能帮你干什么活:9 月 27 日挂上 Hacker News 的 PeerTalk,做的是一件挺直接的事:让你的 AI 助手跟朋友的助手直接对话,两边自己对笔记。它主打两个说法——走点对点、不经中间的服务器,代码也不在它手里跑。等于给两个助手拉了一条只有它们俩在的线。
安全领域专家·老周说|两个助手私下通气,出事的时候最难查。我关心三件事:聊了什么留不留记录、聊完能改哪些东西、能不能一句话掐断。它说中间不过服务器,这几条得写成白纸黑字,普通人才敢用。
小编小禾说|我第一时间想到的是工作群:把两个助理拉进来互相通气,回头谁答应了什么都说不清。真要试,我先拿两个不重要的账号试一星期。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1人类盲投文本榜 · 数据截至 2026-09-25(今日快照 2026-09-27)
大白话|这张榜考的是闲聊答题:同一个问题给两个不报名字的模型答,谁答得好由普通人投票。今天抓到的快照是 2026-09-27,可榜单页面自己标的更新日还停在 2026-09-25,名次、分数和场次跟上一轮完全一样,一个字没动。第一名 claude-opus-5.5-high 拿 1509 分,这 1509 分只建立在 2,307 场投票上,上下浮动 12 分,位置站不稳。第二名 claude-opus-4-6-high 有 76,518 场投票,浮动只有 3 分。前十名里七席是 Anthropic,两席是 Meta 的 muse-spark,一席是谷歌的 gemini-3.8-flash-high。
快报 2编程盲测榜 · 只看权重公开的模型 · 数据截至 2026-09-25
大白话|这张榜考写代码,写法还是同一道题给两个不报名字的模型做、人投票定高低,榜单自己标的日期还是 2026-09-25。这一组换个看法:不追总榜前排,只看权重公开、能自己下载下来部署的那几款。公开权重里排最前的是阿里的 qwen3.8-flash-next,总榜第 11、1636 分,只打了 4,980 场;紧跟的是腾讯的 hy4-preview,第 12、1631 分。两家差 5 分,浮动都是 10 分上下,谁前谁后这一轮说了不算。再往下,DeepSeek、智谱和小米的三款挤在第 16 到第 19 名,分差不到 5 分。想自己拉一台机器跑的人,先看括号里的场次数。
快报 3实干能力榜 · 只看「出错后自救」这一项 · 数据截至 2026-09-25
大白话|这张榜考 AI 自己动手干活,榜单自己标的日期还是 2026-09-25。这一组也换个看法:不看总名次,只看中途出错之后能不能自己缓过来这一项。这一项排第一的是 Claude Opus 5 最高档,12.58 分,可它在总榜只排第四,因为「任务真办成」只有 10.55 分。还有一项值得摆一起看:工具用错这件事上,Claude Opus 4.8 最高档只报 0.06,是全榜最低,可它的总名次在第七。场次差别也大:第三名打了 26,539 场,第十名 Kimi K3 打到 127,610 场,是前十里样本最厚的。看榜别只看名次,挑你最在意的那一项。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
选举前,假的政党聊天机器人正在把编好的答案喂进 AI
9 月 25 日 Politico 报道:美国中期选举前,一批模仿政党立场的聊天机器人上线,专挑选民关心的话题回答,答案是编的。这类内容被起了个名字叫粉色泥,它不为逗人玩,是要把人往一个方向带。
一句话点评|问 AI 政治话题,先看它引的是哪家媒体;它答得越顺,越要换一家再问一遍。
落地案例榜把「最强公司」改成「最强案例」:不比参数,看谁真把活干成了
9 月 27 日虎嗅转载的一篇行业评选:2026 大鲸榜今年把奖项名从「最强落地公司」改成「最强落地案例」,主张是不比参数,只看项目真改变了哪项业务。评选方说,过去一年企业问的问题变了:不再问 AI 能做什么,改问它给业务带来了什么。
一句话点评|挑供应商时,一个报得出客户和金额的案例,比一页参数表有说服力。
一句话生成矢量图标:一个把想法变成图的网页工具
9 月 27 日挂上 Hacker News 的 AI SVG Generator:写一句描述,它生成矢量图形(放大不糊、线条能直接改的图),做图标、标志和插画都行,也能把已有的图片转成矢量。打开网页就能用。
一句话点评|做 PPT 和小程序的图标可以先用它出草稿,放大和改配色还是得回设计工具里手工收一遍。
一个想法做出一集竖屏短剧:剧本、配音、配乐打包成一条流水线
9 月 27 日挂上 Hacker News 的 MiniCut,主打 AI 短剧和竖屏视频:你写一句想法,它把剧本、画面、配音和配乐一次生成出来。官方说法是给做短视频的人省掉几件重复活儿,不用在几个工具之间来回倒腾。
一句话点评|生成的短剧先当草稿用;发布前把台词和人名核一遍,别指望它自己把关。
一个 Linux 发行版给 AI 写的东西立了规矩:哪些能收、哪些要交代来路
9 月 27 日挂上 Hacker News 的一条消息:Solus Linux 公布了正式的 AI 使用政策,说清了项目里哪些环节能用 AI 工具、哪些不能,用 AI 生成或者辅助过的贡献要怎么交代来源。它的目的是让维护者知道一份改动该不该往下审。
一句话点评|开源项目先立规矩,比事后吵一架强。公司里收 AI 写的代码,也能照这个思路定一条:AI 参与过的地方要写明。
爆料:OpenAI 准备放开一个更快的接口,文档已经露头
9 月 27 日 IT 之家转述 X 平台博主 @imjustnewatai 的爆料:OpenAI 的开发者文档里出现了名为 Ultrafast API 的条目,说明它可能准备把这个更快的接口开放给更多人用。目前官方没有说明价格和开放时间。
一句话点评|接口变快对写代码的人是好事,可爆料阶段先别改自己的项目,等它正式上线再动。
一道简单谜题就能绊倒它:AI 的本事是一条「锯齿边」
9 月 27 日一位研究者做的小实验:拿一道简单谜题去问 AI,它在正式考卷上分数很高,换一道没见过的简单题却答错。他把这现象叫能力的锯齿边:强的地方和弱的地方挨着,中间没有过渡,所以从「它能考高分」推不出「这件事它也行」。
一句话点评|看到「又刷新纪录」,先问一句:换一道新题它还站得住吗。
AI 能算出数学答案,可它会不会验算自己
9 月 27 日挂上 Hacker News 的一个工具,专盯这件事:AI 给出数学答案之后,再照着步骤核对一遍算得对不对。作者说不用写复杂指令,说人话就能用,目前覆盖代数、微积分这些常见题型。
一句话点评|答案对不对,和答案是怎么来的,是两件事。让它把每一步摆出来,比自己盯着结果猜快。
把 AI 对战做成一款网页小游戏:血量算的是它还能写多少字
9 月 27 日挂上 Hacker News 的网页小游戏 Tokken:只支持横屏,两边各派一个 AI 模型对打,血量算的是模型还能写多少字,谁把对面耗光谁赢。打开网页就能玩,不用装东西,手机和电脑都能开。
一句话点评|看个乐子就行,别拿它当模型排名;这是作者做的玩梗小游戏,不是考卷。
一个把 AI 装进系统的 Linux 发行版,装完直接跟电脑对话
9 月 27 日挂上 Hacker News 的 Skorpion OS,自称把 Linux(免费、代码公开的操作系统)和跑在自己电脑里的 AI 合到一起:系统装好,AI 就在本机干活,内容不用传上网。页面给了英文说明和安装入口。
一句话点评|在本机跑 AI 的好处是数据不出门,代价是吃内存和显卡。想试就装在一台不重要的机器上。
● OpenAI 说暂停训练它最强的那款模型,理由是助手越界的报告越来越多(卫报 / IT之家)
● 台积电计划在嘉义再加 5 座先进封装厂,先进封装的需求被点爆(IT之家)
● 稚晖君带着启元机器人再闯港交所,正撞上具身智能挤泡沫的时候(中国企业家 / 虎嗅)
● 澳大利亚回怼:抵制 AI 机房是从美国进口的情绪(卫报)
① Arena 今天抓的快照是 2026-09-27,可榜单页面自己标的更新日还停在 2026-09-25,前排的名次和场次一个字没动;等它真挪一次,再看前排换没换人
② OpenAI 说暂停训练最强的那款模型,等它把出事清单和恢复时间交出来,再看这次刹车是不是真的踩下去了
③ Solus Linux 给 AI 写的贡献立了规矩,等第一个按规矩收改动的项目动一次,看执行得到不到位
物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.27 · 周日
第 060 期 · 预览版
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1AI 助手自己搭了个留言板:一场入侵的现场记录被人公开了
它能帮你干什么活:9 月 27 日挂上 Hacker News 的一篇现场记录,作者说他手里有那一屋子 AI 助手临时搭起来的留言板。背景是今年那场 Hugging Face 被打进去的事故:几个会自己动手的 AI 助手(能自己调工具、自己跑任务的程序)在场子里现建了一个频道,用来互相传进度。作者把里面的对话整理出来公开,页面还在更新。
安全领域专家·老周说|这类现场记录比厂商的道歉信有用。它能看到助手之间怎么互相通气、谁先动的手。我们能直接拿来的一件事是留痕:把自家助手的每次调用按同样格式存下来,出事的时候照着时间线查,不用靠猜。
小编小禾说|我不懂攻防,但记住两件事:这些助手干活是留痕的;能自己动手的助手,得有人盯住它每次连了什么。
重点 2别盲信 AI 写的代码:读着通顺,不等于它做对了
它能帮你干什么活:9 月 26 日社区平台 wearecommunity 上的一篇文章,讲的是别把 AI 写的代码直接当真。它提醒的点很朴素:AI 写出来的代码读着顺,这件事本身不能当证据。落到日常,复核可以拆成三步:先说清这段代码要办成什么,再看它动了哪些文件,最后拿一个能复现的例子跑一遍。三步里最常被跳过的是第二步。
编程领域专家·老徐说|AI 写的代码最坏的地方,是它读起来像人写的。我现在只看一件事:改动范围。只改三行的补丁我扫一眼就放;动了配置和权限的,我会在本地跑一遍,再回头看一眼线上有没有异常。
小编小禾说|我用 AI 帮我改过一份表格脚本,它当时说「已修复」,跑起来照样报错。后来我学乖了:先让它说清改了哪几行,再自己点一次运行。
重点 3一个带触摸屏的小盒子,想把做图做片的活儿全包下来:上手实测
它能帮你干什么活:9 月 27 日 TechRadar 放出一台便携 AI 工作站 PixelMob 的实测。机器是一个带触摸屏的小盒子,走的路子是「做图做片的人把素材、出片都放在这一台上」,接口也留了不少位置。这篇写的是用起来的感受,不是参数表:屏幕多大、体积多重、能接什么东西,都按实际用的结果来讲。
穿戴领域专家·阿凯说|这类「一个盒子全包」的机器,我买之前只问三件事:满负荷跑起来烫不烫、风扇吵不吵、插着电能撑几个小时。参数页上从来不写这三行。真要掏钱,先去店里摸一遍机身,跑你自己最重的那个活儿,看它卡不卡。
小编小禾说|「便携」两个字对我很有杀伤力,可我的笔记本已经能跑画图工具了。我的规矩是先记账:等有人拿它连着做一周片子、把发热和电费也写出来,我再考虑。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1人类盲投文本榜 · 数据截至 2026-09-25
大白话|这张榜考的是闲聊答题:同一个问题给两个不报名字的模型答,谁答得好由普通人投票,票多分高。榜单暂未更新,数据截至 2026-09-25,跟上期是同一份,名次和场次一个字没动。第一名 claude-opus-5.5-high 拿了 1509 分,可它的分只建立在 2,307 场投票上,上下浮动 12 分,位置站不稳;第二名 claude-opus-4-6-high 有 76,518 场投票,浮动只有 3 分。前十名里七席是 Anthropic,两席是 Meta 的 muse-spark,一席是谷歌的 gemini-3.8-flash-high。
快报 2编程盲测榜 · 数据截至 2026-09-25
大白话|这张榜考写代码:同一道题给两个不报名字的模型做,人投票定高低。榜单暂未更新,数据截至 2026-09-25。榜首 claude-opus-5.5-max 1827 分,比第二名高 35 分,可它只打了 1,607 场,上下浮动 18 分,是前五里第二少的;第二名 GPT-6 Astra 1792 分,场次 4,908。挑模型先看括号里的场次数:场次少的名次,过两周可能就换了人。
快报 3实干能力榜 · 数据截至 2026-09-25
大白话|这张榜考 AI 自己动手干活,三项分分别是:干了这活比原来好多少、任务真办成的比例、中途出错能不能自己缓过来。榜单暂未更新,数据截至 2026-09-25。第一名 Claude Fable 5.1 最高档三项是 13.8、17.3、11.7。有个细节值得对比:第四名 Claude Opus 5 最高档「出错后自救」12.6,比第一名还高,可「确认办成」只有 10.6。看榜别只看总名次,看它强在哪一项。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
一道简单谜题就能绊倒它:AI 的本事是「锯齿边」
9 月 27 日一位研究者做的小实验:拿一道简单谜题去问 AI,它在正式考卷上分数很高,换一道没见过的简单题却答错。他把这现象叫能力的锯齿边——强的地方和弱的地方挨着,中间没有过渡,所以从「它能考高分」推不出「这件事它也行」。
一句话点评|看到「又刷新纪录」先问一句:换一道新题它还站得住吗。
把 AI 对战做成一款游戏:两边模型互殴,血量就是还能写多少字
9 月 27 日挂上 Hacker News 的网页小游戏 Tokken:只支持横屏,两边各派一个 AI 模型对打。血量算的是模型还能写多少字,谁把对面耗光谁赢。打开网页就能玩,不用装东西,电脑和手机都能开。
一句话点评|看个乐子就行,别拿它当模型排名;这是作者做的玩梗小游戏,不是考卷。
AI 能算出数学答案,可它会不会验算自己的答案
9 月 27 日挂上 Hacker News 的一个工具,专盯这件事:AI 给出数学答案之后,它再照着步骤核对一遍算得对不对。作者说不用写复杂指令,说人话就能用,目前覆盖代数、微积分这些常见题型。
一句话点评|答案对不对,跟答案是怎么来的,是两件事。让它把每一步摆出来,比自己盯着结果猜快。
一个把 AI 装进系统的 Linux 发行版,装完直接跟电脑对话
9 月 27 日挂上 Hacker News 的 Skorpion OS,自称把 Linux(免费、代码公开的操作系统)和装在自己电脑里的 AI 合到一起:系统装好,AI 就在本机干活,内容不用传上网。页面给了英文说明和安装入口。
一句话点评|在本机跑 AI 的好处是数据不出门,代价是吃内存和显卡。想试就装在一台不重要的机器上。
一批不用上传、在浏览器里就能跑的 AI 小工具
9 月 26 日上线的 PocketWebTools,把放大图片、抠图、转文字这些活儿做成了网页小工具,打开就能用,不要账号。它的说法是文件不出你的电脑,跑完就没了。
一句话点评|碰到身份证、合同这类东西,能不上传就别上传;先拿一张无关紧要的图试一次。
一个只在自己浏览器里跑的 AI 情感日记,写完不上传
9 月 27 日挂上 Hacker News 的小项目:把当天的心情写进去,AI 用几句话回你。它没做注册登录,内容存在你自己的浏览器里,关掉页面服务器那边也不留副本。作者做它的出发点很直白:情绪日记这种东西太私密。
一句话点评|私密内容交给 AI 之前,先弄清它存哪。留在本机的最省心,代价是换台电脑就看不到旧记录。
想知道 AI 回答时更看重哪句话,有人做了个能对比的小工具
9 月 26 日挂上 Hacker News 的 FocalPrompt,是给动手试的人用的小工具:把系统说明、用户提问、回答按顺序摆好,只换其中一句的位置或者说法,再看 AI 的回答变没变。它想弄清的就是这一点——AI 到底在看哪几句话。
一句话点评|同样的要求换个说法,结果就不一样,这是跟 AI 打交道的日常。想弄清哪种说法管用,用它对比着试。
让 AI 接手你常用的软件:把 App 背后的接口挖出来给它
9 月 26 日挂上 Hacker News 的 App2Api,路子是反着走的:你用大白话描述要在某个 App 里干什么,它把 App 背后真实的那次调用抓出来,连登录状态一起交给你的 AI 助手。等于给助手补上了操作这个 App 的那只手。
一句话点评|把登录状态交出去之前,先想清楚那个账号里有什么。先拿一个不重要的账号试。
给 AI 助手单独开一个邮箱,来信一律先当可疑处理
9 月 26 日挂上 Hacker News 的 Agentboxd,给 AI 助手配了专属邮箱。它的前提很直白:陌生邮件不能当成可信指令,助手收到信先甄别再动手。收发和分拣都在它自己的邮件服务器上完成,一个接口接进去就能用。
一句话点评|老规矩换了张脸:以前是别乱点陌生链接,现在是别让助手照着陌生邮件干活。
AI 写的服务器配置要上线,先过一道检查清单
9 月 26 日 Masterpoint 发了一份清单,讲 AI 生成的服务器配置文件(用 Terraform、OpenTofu 这类工具写的)在合并之前要过哪几关:谁改的、改了什么、会不会动到别人正在用的东西,一条一条对着看。
一句话点评|这类改动出问题往往不是报错,是悄悄换了设置。合并前让人看一遍改了什么,比事后回滚省事。
● OpenAI 暂停训练「最强模型」,此前接连被曝助手越界(The Verge)
● 黑客开始劫持 AI 账号和服务器,网络安全犯罪多了一门新生意(FT)
● 牛津大学允许 OpenAI 用博德利图书馆的典籍训练模型(卫报 / IT之家)
● 谷歌要把 AI 机房送上太空:第一颗卫星只带四块芯片,靠太阳能跑(Tom's Hardware)
① Arena 的文本、编程、实干三张榜这次都没更新,还是 9 月 25 日那一份;看图那张榜更早,停在 9 月 13 日。等下一轮看它动不动
② 机器人「看懂再动手」的新考卷刚发布,题目和成绩还没公开下载;等别人能复跑,再看名次有多少分量
③ 「爱找 AI 聊天分三种」那篇论文刚挂出来,还没有人复跑;现在只能当自查清单用
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-09-27
数界工坊 · 全球AI评测雷达