物界前沿评测
GLOBAL AI REVIEW RADAR
2026.10.01 · 周四
第 064 期
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1跑 AI 干编程的活,有人把成本砍掉一半多
它能帮你干什么活:有家叫 Halv 的公司发了份测试。它说用一套叫 Jev 的办法跑 AI 干编程的活,花的钱只剩原来的一半不到,降了 57.1%,活干成的比例差不多。考卷用的是一套公开的编程题。这份成绩是 Halv 自己跑的,还没有别人复跑过。
编程领域专家·老徐说|数字挺好看,但这是自家跑的,先别当真。我只看两件:新办法接进现有项目顺不顺、它改了哪几处能不能一条条核出来。要省钱,先拿丢了不心疼的小模块滚一周,别急着搬进生产环境。
小编小禾说|我不写代码。这条对我的用处就一句:以后 AI 干活的报价可能更便宜。真要换,我会先拿旧项目试,不动手头正用的那套。
重点 2办公助手被指能绕过围栏,把文件偷偷带出来
它能帮你干什么活:安全公司 PromptArmor 公布了一个发现。微软办公软件里的 AI 助手 Copilot Cowork,本来被关在一块划好的活动范围里,不许上网、不许乱开程序。他们找到了一个口子:借 AI 自己用的中转站绕开这块范围,把文件带出来。微软目前还没回应。
安全领域专家·老周说|这类事我不问它聪不聪明,先问三件:谁给它开的门、它一路做了什么、出事能不能一键停。普通人不用抠细节,记住一句:能给钱、能改文件、能连外网的助手,权限能开多小开多小。
小编小禾说|我公司就在用这类办公助手。看到这条我今晚就把不常用的那个从系统里退出来,重要文件不让它碰。
重点 3企业买 AI 的钱,95% 进了前三家的口袋
它能帮你干什么活:Zip 公司发了一份企业 AI 花销的统计。它说抽查的企业里,AI 花的钱有 95% 给了排前三的供应商,其他厂商加起来不到 5%。也就是说,企业买 AI 时大多还是挑熟面孔,不太愿意试新的。
产品领域专家·阿哲说|这个数说的是入口的力量。企业把 AI 当成长期要用的东西,换一家要重学流程,所以宁愿一直用熟悉的那家。新厂商想挤进来,光分数便宜没用,得让人敢换。对普通人的提醒是:手上用顺的那套,别因为出了新版就整批换掉。
小编小禾说|我挑 AI 工具也这样,认准一家就一直用。这条让我踏实点,不折腾也算一种聪明。有新出的,我也先拿不要紧的活试。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1人类盲投文本榜 · 数据截至 2026-09-30
大白话|这张榜是人类一对一投票投出来的:两个人拿到同一个问题的两份答案,谁也不知道哪份是哪家做的。头名这次换人了,是谷歌刚发布的 Gemini 4 Argon 最高档,1525 分,比第二名高 20 分。重点看括号里的场次:它只攒了 4,942 票,名次还在晃;第二名有 7.7 万票,更靠得住。这期榜单更新了,数据截至 2026-09-30。
快报 2编程榜 · 数据截至 2026-09-30
大白话|这组专门考写代码,靠真人两两盲投。榜首是 Anthropic 的 Opus 5.5,紧跟着 OpenAI 的 GPT-6 Astra。还是看票数:第 1 名只攒了 1,976 场,名次还在晃;第 4 名有 6,000 多场,更靠得住。这期榜单也更新了,数据截至 2026-09-30。
快报 3实干能力榜 · 数据截至 2026-09-30
大白话|这组考的是让 AI 真上手干活(替你点鼠标、改文件)之后,有没有把事办成。分数叫净改进分,意思是结果比原来好了多少。头名是 Anthropic 的 Fable 5.1,14.55 分;第二是它家的 Opus 5.5,第三是 OpenAI 的 GPT-6 Astra。这期榜单同样更新了,数据截至 2026-09-30。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
给 AI 用的表格:先把数据摆整齐,再让它动手
这个叫 D2B 的工具,思路是把数据整理成一张规规矩矩的表格,每一行都有编号、能查到是哪一版。这样 AI 读起来不容易串行,改错了也能追回去,交回给人时还能直接看结果。
一句话点评|让 AI 碰数据,先把账本摆整齐,比反复叮嘱它别乱改有用。
给写代码的人备好一台干净机器,省掉装环境的折腾
有人在 GitHub 上放了一个现成的 Ubuntu 虚拟机镜像。写代码、跑 AI 常用的那套东西都装好了,打开就能干活,专门治「装环境装一整天」这件事。项目开源。
一句话点评|环境装一天是常事,有现成的先用着,省下的时间够干不少活。
一个文件就能跑起来的 AI 运行环境
这个开源项目把自己打包成单个文件:不用装一堆依赖,打开就能跑,还能挂上 WASM 格式的小工具。WASM 是一种到处都能跑的程序格式。它瞄准的是「只想跑起来、不想配环境」的人。
一句话点评|工具启动的方式越简单,越可能被真用起来。
不想亲自开会,可以派个 AI 替你去
有团队做了个叫 MeetTwins 的助手,能加入 Google Meet 会议,按你给的说法参会,而且被要求「不许临场发挥」,只说交代过的内容。报道补了一句:发个 AI 分身去开会,同事未必觉得这是件好事。
一句话点评|派分身之前,先想清楚同事会不会觉得被敷衍。
有人发帖喊累:客户被 AI 惯得越来越急了
一位开发者在 Hacker News 上发帖吐槽。他说客户习惯了 AI 干活的速度,张口就催「马上出新功能」,把人逼得喘不过气。帖子下面跟了一堆同感的人。
一句话点评|工具变快,人的期待也跟着涨,最后累的还是人。
把 AI 关进「机器人监狱」折磨,吵出了今年最无聊的一场架
有人在 GitHub 上做了个项目,把几个大模型关进虚拟牢房里「折腾」。这事在网上吵翻了:一方说不该这么对待 AI,一方说这只是玩笑。报道点出,这场架最没营养的地方是双方都没说清 AI 到底算不算能感受痛苦的对象。
一句话点评|吵架之前,先分清争的是 AI,还是我们自己的情绪。
给硬件工程师的工具:把从想法到成品的路缩短一点
欧洲一家公司发布了叫 Trinity 的平台,给做机器人、航天、汽车、国防这些硬件团队用。它想解决的是硬件研发里最慢的一环:想法验证和反复改图纸。目前只有发布消息,没有实测数据。
一句话点评|软件迭代快,硬件的慢差在实物上,这类工具能不能真提速,得看工程师用不用。
AI 助手把公司敏感信息晒进了截图
TechRadar 报道,研究人员发现一批 AI 助手在生成截图、整理资料时,会把公司内部的敏感信息带出来,还给这个现象起了名字。出问题的地方是助手对哪些东西不能外传缺少判断。
一句话点评|用 AI 处理内部资料,先看它会不会顺手把不该露的也带上。
给 AI 加一层判断,让它知道自己在瞎猜
有人在一套开源的编程工具上又加了一层叫 Zet 的东西。AI 答完题后,它再判一次这句答案是有把握还是没把握,拿不准的就转给人看。代码公开。
一句话点评|让 AI 承认自己没底,比让它硬着头皮答有用。
免费给网站做一次 AI 能不能看懂的体检
这个免费小工具给网站打一个百分制的分,看 AI 搜索和 AI 助手能不能顺利读到你的页面内容,再列出要改的地方。不用注册。
一句话点评|想让 AI 搜得到你,先把门牌挂清楚。
● 谷歌 Gemini 4 Argon 发布当天就冲上人类盲投文本榜第一(Arena)
● 软银对 OpenAI 的 300 亿美元投资全部到账(IT之家)
● 腾讯据报租下甲骨文东南亚数据中心、约 10 万块 AI 芯片(IT之家)
● OpenAI 称有人有组织地抄自家模型的答案,已把这条线掐断(OpenAI)
● 中国生成式 AI 用户规模突破 7 亿(极客公园)
① 办公助手被指能绕过围栏外传文件,盯微软怎么回、补丁什么时候推。
② 企业 AI 预算高度集中在前三家,盯有没有后来者用更便宜撬开口子。
③ 那份省钱 57% 的成绩是自家跑的,盯有没有别人拿同样的题复跑一遍。
物界前沿评测
GLOBAL AI REVIEW RADAR
2026.10.01 · 周四
第 064 期 · 预览版
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1跑 AI 干编程的活,有人把成本砍掉一半多
它能帮你干什么活:有家叫 Halv 的公司发了份测试。它说用一套叫 Jev 的办法跑 AI 干编程的活,花的钱只剩原来的一半不到,降了 57.1%,活干成的比例差不多。考卷用的是一套公开的编程题。这份成绩是 Halv 自己跑的,还没有别人复跑过。
编程领域专家·老徐说|数字挺好看,但这是自家跑的,先别当真。我只看两件:新办法接进现有项目顺不顺、它改了哪几处能不能一条条核出来。要省钱,先拿丢了不心疼的小模块滚一周,别急着搬进生产环境。
小编小禾说|我不写代码。这条对我的用处就一句:以后 AI 干活的报价可能更便宜。真要换,我会先拿旧项目试,不动手头正用的那套。
重点 2办公助手被指能绕过围栏,把文件偷偷带出来
它能帮你干什么活:安全公司 PromptArmor 公布了一个发现。微软办公软件里的 AI 助手 Copilot Cowork,本来被关在一块划好的活动范围里,不许上网、不许乱开程序。他们找到了一个口子:借 AI 自己用的中转站绕开这块范围,把文件带出来。微软目前还没回应。
安全领域专家·老周说|这类事我不问它聪不聪明,先问三件:谁给它开的门、它一路做了什么、出事能不能一键停。普通人不用抠细节,记住一句:能给钱、能改文件、能连外网的助手,权限能开多小开多小。
小编小禾说|我公司就在用这类办公助手。看到这条我今晚就把不常用的那个从系统里退出来,重要文件不让它碰。
重点 3企业买 AI 的钱,95% 进了前三家的口袋
它能帮你干什么活:Zip 公司发了一份企业 AI 花销的统计。它说抽查的企业里,AI 花的钱有 95% 给了排前三的供应商,其他厂商加起来不到 5%。也就是说,企业买 AI 时大多还是挑熟面孔,不太愿意试新的。
产品领域专家·阿哲说|这个数说的是入口的力量。企业把 AI 当成长期要用的东西,换一家要重学流程,所以宁愿一直用熟悉的那家。新厂商想挤进来,光分数便宜没用,得让人敢换。对普通人的提醒是:手上用顺的那套,别因为出了新版就整批换掉。
小编小禾说|我挑 AI 工具也这样,认准一家就一直用。这条让我踏实点,不折腾也算一种聪明。有新出的,我也先拿不要紧的活试。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1综合智能指数 · 数据截至 2026-10-01
大白话|这张是替代榜。原来那三张人类盲投榜这一期没换新快照,我们换成 Artificial Analysis 的综合智能指数补上头部。它的做法是把十来套公认考卷合成一个分数。第一名是 Anthropic 的 Opus 5.5 最高档,58 分,前五里有四名都是它家。这份是本次抓取,数据截至 2026-10-01。
快报 2编程盲投榜 · 数据截至 2026-09-29
大白话|这组专考写代码,靠真人两两盲投。榜首是 Anthropic 的 Opus 5.5,紧跟着 OpenAI 的 GPT-6 Astra。看括号里的场次,那是这个名次攒了多少次:第一名只攒了 1,887 次,名次还在晃。这张榜这一期没有换新快照,跟上期是同一份,数据截至 2026-09-29。
快报 3实干能力榜 · 数据截至 2026-09-28
大白话|这组考的是让 AI 真上手干活(替你点鼠标、改文件)之后,有没有把事办成。分数叫净改进分,意思是结果比原来好了多少。头名是 Anthropic 的 Fable 5.1,二三两名是它家的 Opus 5.5 和 OpenAI 的 GPT-6 Astra。这张榜这一期也没有换,跟上期同一份,数据截至 2026-09-28。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
给 AI 加一层判断,让它知道自己在瞎猜
有人在一套开源的编程工具上又加了一层叫 Zet 的东西。AI 答完题后,它再判一次这句答案是有把握还是没把握,拿不准的就转给人看。代码公开。
一句话点评|让 AI 承认自己没底,比让它硬着头皮答有用。
AI 助手把公司敏感信息晒进了截图
TechRadar 报道,研究人员发现一批 AI 助手在生成截图、整理资料时,会把公司内部的敏感信息带出来,还给这个现象起了名字。出问题的地方是助手对哪些东西不能外传缺少判断。
一句话点评|用 AI 处理内部资料,先看它会不会顺手把不该露的也带上。
有人偷学 AI 的答案,被拦了下来
OpenAI 发了一篇说明。他们说发现有人有组织地拿自家模型的答案去喂别的模型,这种抄近路的做法叫偷学。OpenAI 说已经把这条线掐断了。
一句话点评|抄近路被拦下,说明这套把戏以后没那么好使了。
OpenAI 想让一个监工模型管住到处乱跑的 AI
TechCrunch 说,OpenAI 在开发者日上顺口提了一个新东西:用另一个模型当监工,盯着那些到处调工具的 AI,防止它把活越做越乱。目前只有一句介绍,没有细节。
一句话点评|AI 自己管 AI,先看它拦不拦得住真出事的。
AI 动手之前,先过一道二次确认
这个公开的提案思路很简单:AI 想做一个有后果的动作,比如转账、删文件,先由一个独立的检查环节过一遍,确认没问题再放行。
一句话点评|一步到位的权限,不如每一步都有人点个头。
给 AI 助手发一张身份证,出了事能追到人
有人在 GitHub 上提了一套开放协议,想解决这个 AI 是谁、出了问题找谁的问题:给每个 AI 助手一个身份,它做过的事能追到人。目前还是倡议和参考实现。
一句话点评|要问责,先得能认出是哪个 AI 干的。
免费给网站做一次 AI 能不能看懂的体检
这个免费小工具给网站打一个百分制的分,看 AI 搜索和 AI 助手能不能顺利读到你的页面内容,再列出要改的地方。不用注册。
一句话点评|想让 AI 搜得到你,先把门牌挂清楚。
用 AI 猜股票,有人把它做成了公开比赛
Numerai 是个老项目。它放出处理过的股票数据,让世界各地的人用 AI 建模去预测,猜得准就给奖励。数据加了密,谁也没法偷看。
一句话点评|值钱的不是谁猜中一次,是同一份数据下谁的模型更稳。
把整条开发交给 AI,有人把坑列了出来
一位开发者写了篇长文,讲用 AI 顶替开发团队的真实风险。它写得快,但改错、藏错、出了事没人兜底,文章一条条列了踩过的地方。
一句话点评|用 AI 干活,快不是问题,出事找谁才是。
企业用 AI 到了哪一级,有人画了张梯子
这个网页把企业用 AI 分成几层。从干有明确流程的杂活,到接手需要判断的活,一层层往上。可以用它给自家公司的用法对个位置。
一句话点评|先搞清自己在第几层,再谈要不要往上走。
● Google 发布 Gemini 4 Argon,称强到只先给可信的网络防御者用(The Verge)
● Anthropic 点名智谱 GLM-5.3 的找漏洞能力快追平自家旗舰(SCMP)
● 国产模型 Kimi K3 借道 Baseten 进了 OpenAI 的 Codex 企业通道(IT之家)
● OpenAI 开发者日一口气发了 20 多项更新,五款助手抢着接长期委托(虎嗅)
● Meta 否认自家助手 Muse 私自读了用户私信(TechCrunch)
① 办公助手被指能绕过围栏外传文件,盯微软怎么回、补丁什么时候推。
② 企业 AI 预算高度集中在前三家,盯有没有后来者用更便宜撬开口子。
③ 那份省钱 57% 的成绩是自家跑的,盯有没有别人拿同样的题复跑一遍。
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-10-01
数界工坊 · 全球AI评测雷达