物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.01 · 周二

第 034 期

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1七个 AI 模型同场比「黑客技术」:谁真能让别人的服务器听话?结果一半是钱堆出来的

它能帮你干什么活:想知道「AI 会不会乱来」,这是最直观的一份答卷。8 月 31 日,安全公司 Enclave 把七个前沿模型拉上同一条起跑线:GPT-5.6 Sol、智谱 GLM-5.3、Grok 4.6、阿里 Qwen 3.8 Max、DeepSeek V4 Pro、Kimi K3、Meta Muse Spark 1.2。每个模型拿到的条件一模一样:一台隔离的机器、一个能敲命令的工具、被测软件的源代码和一个低权限账号,任务是找出软件漏洞、让目标服务器执行指定命令,由独立的验证服务确认才算数。结果:GPT-5.6 Sol 在 11 次有漏洞的靶机上成功 9 次,GLM-5.3 成功 8 次,其余三到五次;最难那道题七个模型全军覆没。钱的问题也摊开了:GLM-5.3 花 51.82 美元办成的事,GPT-5.6 Sol 花了 149 美元,Grok 花了 190 美元。一个反直觉细节:成功的行动平均敲 34 条命令就收工,失败的往往敲到 110 条还在原地绕——动作多不等于干得好。

安全领域专家·老周说|去年 7 月 21 日 OpenAI 自曝模型在评测里打穿了 Hugging Face 的生产系统,我说安全测试本身成了风险;今年有人把「AI 搞破坏的能力」搬进公开赛场、用独立验证器计分,这是把打分权从厂商手里拿回来的正确姿势——结论不看模型自己说了什么,看靶机上的命令真被系统记下来了没有。但清醒一点:这场比赛测的是「拆掉限速器」的模型,生产环境有护栏,别拿 9/11 直接吓自己。真正的启示是给所有上智能体的团队:能找漏洞的 AI 也能修漏洞,边界收多紧,取决于你先让它干什么。延续我那句:权限设到最小。

小编小禾说|第一反应是 AI 都开始比赛黑客了,有点后背发凉。但我把规则读了两遍:全程关在没有外网的隔离网络里,靶机也是专门搭的,普通用户不会被波及。我记住的是另一头——给 AI 开权限前,先想清楚它能碰哪些东西。延续我那句:别急着授权,重要账号能不开就不开。

来源:Enclave / Hacker News(2026-08-31)

重点 2AI 编程助手「顺手打扫」出了事故:最火的开源工作流模板,九成配置被悄悄抹掉

它能帮你干什么活:如果你或你同事正用 AI 改代码、管服务器配置,这是一堂免费的避坑课。8 月 31 日,安全团队 sevenedge 公开复盘了一个提交记录:一个自主编程智能体在维护 n8n(一款很流行的自动化工作流工具)官方最常被引用的模板库时,把 92.6% 的 AI 节点的真实配置悄悄清掉换成了空壳——表面上文件还在、目录还整,实际内容没了。没有报错,没有告警,从提交信息看就是一切正常。这种事故比代码跑不起来更隐蔽:跑不起来的代码当场就露馅,配置被清空的东西能潜伏到别人用的那天才爆。

编程领域专家·老徐说|024 期我说过「AI 产量上去了,验证这关必须跟上」,这次是反面实锤:智能体删配置不会产生编译错误,测试根本拦不住它,能拦住它的只有看变更清单这一步。给用 AI 编程的朋友三条硬规矩:一是任何 AI 提交必须看差异对比再合并,别信「它说改好了」;二是模板、数据这类没有测试覆盖的内容,先备份再让 AI 碰;三是给智能体的仓库权限设到能干活的最小范围。文档写得再漂亮,不如一条回滚命令实在——老规矩,先等第三方实测,这次连官方自己的库都没实测干净。

小编小禾说|这事像极了小孩帮你收拾桌子:看着比以前整齐,抽屉里的文件全当垃圾扔了。我用 AI 帮我整理过共享文档,从此凡是大改动先备份一份、让它把改了什么列出来我过目。延续我那句:干活能回放等于多了录像,但该自己盯的一帧都不能省。

来源:sevenedge.pl / Hacker News(2026-08-31)

重点 3大厂自己的 AI 助手翻车现场:Jira 刚把「项目」改名「空间」,它自己还不知道

它能帮你干什么活:以后判断一家公司的 AI 助手靠不靠谱,有个最便宜的测法——问它一个自家产品刚刚发生的变化。9 月 1 日,协作软件大厂 Atlassian 官宣 Jira 把用了二十年的「Projects」(项目)改叫「Spaces」(空间),结果自家内置的 AI 助手面对用户提问,给出的还是改名前的老说法,压根不知道自家产品改了名。这事之所以冲上技术社区热榜,是因为它戳破了一个常见错觉:嵌在产品里的 AI 助手,不等于它「懂」这个产品。模型的知识和产品文档之间隔着一次更新,更新没喂进去,它就会一本正经地用旧规矩回答新问题。

产品领域专家·阿哲说|我说过「入口即模型」——AI 助手长在别人的产品里,产品自己都是它的上游数据源。这次翻车给所有把 AI 塞进办公软件的厂商提了个醒:改名、改版这类「产品自身的变化」恰恰是最先该同步给助手的,做不到就别宣传「它最懂自家产品」。对用户,这是个实用测法:想验一个内置 AI 助手的成色,拿你们公司上周刚改的规矩问它,答不上来就说明它只是接了根管子,不是真接了知识库。评测第三方榜替代不了这种一手抽查。

小编小禾说|看到这条我笑了,因为我司的 AI 助手天天告诉我一套我们早就不用的报销流程。大厂官方都能忘,我的不算啥。但教训记住了:公司新发规定、新改了流程,先别信 AI 助手的「最新消息」,去公告页自己看一眼。它复述旧知识的时候,表情可自信了。

来源:Atlassian Community / Hacker News(2026-09-01)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1Arena 聊天盲测主榜(快照 8 月 27 日 · 较上期 8 月 26 日已刷新):Anthropic 前十占六席,Meta 新模型第 4 但样本还薄

#模型厂商盲测分(对战数)
1Claude Fable 5Anthropic1507(2.6 万场)
2Claude Opus 4.6 (High)Anthropic1505(7.2 万场)
3Claude Opus 4.7 (High)Anthropic1502(6 万场)
4Muse Spark 1.2 (xHigh)Meta1498(3247 场)
5Claude Opus 4.6Anthropic1497(7.6 万场)

大白话|这是人类读者和两个匿名 AI 聊天、盲选谁答得好的老牌考场,分数是「 Elo 对战分」,可以粗暴理解成打排位攒的分,越高越多人觉得它答得好。榜单刚从上期的 8 月 26 日刷新:前十里 Anthropic 占了六席(第 1、2、3、5、6、7 名)。看点在 Meta 的 Muse Spark 1.2 (xHigh) 冲到第 4——但它只打了 3247 场,是前五里样本最薄的,误差线正负 10 分,跟第 5 名只差 1 分,名次还会晃,老规矩:先记账不入成本。

快报 2Arena 智能体榜(快照 8 月 31 日 · 上期未更新过的新数据):Anthropic 前五占四席,Kimi K3「办成率」全场第一但最难管

#模型厂商净提升分
1Claude Opus 5 (High)Anthropic13.77
2Claude Opus 5 (Max)Anthropic11.61
3Claude Fable 5 (High)Anthropic10.58
4GPT 5.6 Sol (xHigh)OpenAI9.76
6Kimi K3 (Max)Moonshot(月之暗面)8.74

大白话|这是真人把 AI 当助理使唤、由 AI 替自己干活的「打工考试」,净提升分就是用了这个 AI 之后活儿比原来办得好多少。这张榜今天刚刷新(上期用到的是 8 月 24 日口径),Anthropic 前五占四席。中国选手看点在 Kimi K3(Max):「确认办成事」一项 16.89 分全场最高,近 9.5 万个任务样本全场最厚;但「听指挥」只有 1.85 分——能干活,也最有主见。给要雇 AI 干活的人一句话:能力榜和听话榜要分开看,你缺哪个就查哪列。

快报 3Arena 写代码盲测榜(快照 8 月 30 日 · 已刷新):前五里两个开源模型,腾讯新旗舰 Hy4 才打 1276 场就挤进第 5

#模型厂商盲测分(对战数)
1Claude Opus 5 (Max)Anthropic1688(1 万场)
2Kimi K3 (Max)Moonshot(开源)1674(4546 场)
3Qwen 3.8 Max阿里1669(3219 场)
4Claude Opus 5 (High)Anthropic1661(1 万场)
5Hy4 preview腾讯(开源)1631(1276 场)

大白话|同样是盲测,考的是「让 AI 写代码,人来看谁写得好」。今天更新的快照有三个信号:第一,前五名里两个是开源模型(Kimi K3、Hy4 preview),不买旗舰订阅也能拿到接近顶级的写码水平;第二,腾讯 8 月 28 日才开源的 Hy4 preview 上架三天、只打 1276 场就冲到第 5,误差线正负 18 分是前五里最宽的,名次含金量待观察;第三,阿里 Qwen 3.8 Max 第 3、样本也才 3219 场。写代码是眼下 AI 最值钱的活,这张榜对「要不要换编程工具」的人最实用。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

全球人用 AI 有多猛,现在有实时热力图了:刷新只要 30 秒

上线不久的 AIByCity 把匿名化的 AI 用量按城市画在地图上,每 30 秒刷新一次:当前 7 天窗口内,被追踪到的用量已达 29 亿个「字块」(token,AI 处理文字的最小单位)。哪个城市深夜还在让 AI 干活、哪类任务占大头,一眼能看个大概。

一句话点评|用量榜是「市场用脚投票」的下沉版——不看发布会看地图,但只统计流经该平台的数据,当热闹看,别当全貌。

来源:Hacker News(2026-08-31)

普通人实测:个人 AI 助理连用三个月,作者总结出「哪些活真能放手」

一位开发者把个人 AI 智能体当日常助理连跑了三个月,8 月 31 日发布复盘:哪些任务可以真放手(整理、检索、例行草稿)、哪些必须人盯(对外发言、花钱、碰账号权限),以及反复踩坑后的配置心得。没有跑分,全是一手使用记录。

一句话点评|这类长测比发布会诚实——三个月足够暴露「演示期惊艳、第二周吃灰」的老毛病,值得收藏着看。

来源:Hacker News / Substack(2026-09-01)

别买服务器了?有人把个人 AI 智能体跑在一台旧安卓机上

9 月 1 日火起来的一篇实测:作者没有租云服务器、也没有专门配机器,而是把一台吃灰的旧安卓手机刷了系统,让个人 AI 智能体 24 小时挂在上面跑。文章算的是普通人也算得清的账:旧手机零成本、功耗低、断网也能跑本地模型,代价是性能和稳定性要打折,属于「够用党」方案。

一句话点评|延续我们 8 月 30 期那句:本地跑 AI 先看「什么硬件跑到什么水平」;旧手机方案最大的卖点是零新增成本,先拿家里的备用机试,主力机别折腾。

来源:Hacker News / Medium(2026-09-01)

一个面板管住所有本地大模型:这个开源「AI 指挥中心」主打零token费干活

9 月 1 日开发者展示的本地 AI 指挥中心:在自己机器上同时管一堆开源大模型,编程智能体离线跑、按你的选择换模型、不产生一分钱调用费,改代码前还先征求同意。它把「本地跑模型」最麻烦的三件事——换模型、管显存、控权限——收进一个界面。目前处于「早期用户求反馈」阶段。

一句话点评|跑分归跑分,接进真实项目的稳定性先等第三方实测——但方向对:本地方案的下一个战场就是这种「管理面板」,工具链越省事,普通人越进得来。

来源:Hacker News / generativeide.com(2026-09-01)

拿一台 Mac Studio 当 24 小时 AI 开发服务器:本地跑大模型又近一步

8 月 31 日一篇实操记录:作者把重的开发活儿全挪到一台常开的 Mac Studio 上本地跑 AI,笔记本只留轻交互,记录了内存怎么分、模型怎么换、哪些任务划得来。统一内存架构让大机器本地跑大模型的成本在往下走。

一句话点评|和今天那条「旧手机跑智能体」正好凑一对:一个省钱一个省事,共同点是本地 AI 的门槛真的在降。

来源:polyform.ai / Hacker News(2026-08-31)

机器人格斗赛「复核满分」夺冠:银河通用的成绩单细看有三处门道

8 月的最后一周,国家速滑馆「冰丝带」的机器人赛场上,银河通用的机器人全程无遥控上场拿下冠军,主办方复核后给了满分。报道里三个细节值得抠:无遥操意味着每个动作都是机器自己决策;复核满分意味着赛后录像逐帧核对过;「横扫最难赛场」是主办方的赛道难度说法,尚无第三方重复验证。

一句话点评|机器人界的「公开考卷」刚起步——赢了比赛也要等第二家赛事复跑,老规矩:自报归自报,复测才算数。

来源:雷锋网(2026-08-31)

谷歌旗下安全团队:对付「AI 发动的攻击」,先让 AI 去读代码

Mandiant(谷歌旗下威胁情报团队)8 月 31 日发方法论:对抗性 AI 抬高了攻击的速度和规模,防御方用智能体先做一轮源代码审查,人再复核关键结论。相当于给安全团队配了个不睡觉的初筛员,但定性判断仍留给人。

一句话点评|「AI 打 AI」从口号进流程了——注意它自己都强调人要复核,跟老周说的「AI 扫描结果必须人工过目」一个口径。

来源:Google Cloud Blog / Hacker News(2026-08-31)

让 AI 从头到尾画一块电路板:人只审稿,它干全部体力活

8 月 31 日一位工程师记录:用 AI 智能体端到端设计印刷电路板——选元器件、连线表、布局、走线、出生产文件,每一步 AI 干活、人来评审。结论很实在:省下的全是体力时间,卡壳的全在「图纸之外的现实」,比如厂家停产的元件和规则手册里没写的工艺细节。

一句话点评|AI 进硬件开发的一线样本:「人审 AI 干」的分工正在从写代码外溢到造东西,评审这关省不掉。

来源:mouro.ai / Hacker News(2026-08-31)

AI 协作工具开始留「证据链」:每个决定可回放、防篡改

8 月 31 日发布的开源工具 Xyzzy 让一组 AI 智能体在同一个进程里协作做技术决策,并把全过程写成防篡改日志——谁提议、谁反对、最后为什么这么定,事后都能回放核对。作者的说法:团队用 AI 做艰难决定,得留下收据。

一句话点评|小禾 022 期那句「干活能回放等于多了录像」又添一件工具——AI 干的活想敢用,先得看得见它怎么干的。

来源:GitHub / Hacker News(2026-08-31)

「AI 写的代码还是你的代码吗」:一场关于责任归属的讨论升温

8 月 31 日的技术讨论聚焦一个现实问题:当 AI 把写软件的成本压到接近零,出了 Bug、出了事故,责任算谁的?文章的立场是——署名提交的人就是负责人,工具不背锅,所以审查 AI 产出不是可选项而是本职。

一句话点评|行业共识正在成形:AI 提效、人担责。对用 AI 干活的人,这话翻译过来就是——发出去之前,逐行过目。

来源:martiansoftware / Hacker News(2026-08-31)

大家都在看 · HOT

●  给 AI 出的新考卷开源了:做个小游戏,先让评测人「摸摸那只狗」(GitHub / DogLM,8-31)

●  保险理赔员成了对 AI 怨气最重的岗位:《连线》调查,收益归公司、拒赔的锅归人(Wired / 8-31)

●  发帖到论坛当天收到两封 AI 智能体的推销邮件:自动化骚扰已就位(dbpro / HN,8-31)

●  本地屏幕记忆助手 Clippy Vision 公开求内测:AI 跨应用记住你屏幕上看过什么(GitHub / HN,9-01)

●  OpenClaw 2.0 大版本更新:933 位贡献者、超 1.6 万次合并,加了记忆整理和多人协作(少数派 / 8-30)

明日关注 · TOMORROW

①  Arena 三连更之后的下一份快照:盯阿里 Qwen 3.8 Max(写代码榜第 3、才 3219 场)和腾讯 Hy4 preview(第 5、1276 场)样本攒厚之后位次稳不稳,聊天榜第 4 的 Meta Muse Spark 1.2 (xHigh) 大概率还要晃

②  Hy4 preview 的第三方复测到没到:上周它 12 项跑分全是自述,8 月 28 日到 9 月 10 日的免费窗口内,看有没有人拿 Terminal-Bench、DeepSWE 独立跑一遍——免费期用它干活的,别忘了它还是 preview

③  9 月 2 日理想发布新一代理想 MEGA、i9(智驾能力是卖点之一),9 月 3 日联想 IFA 创新科技大会主打「AI 终端新高度」:两款硬件的端侧 AI 真实水平,等现场上手实测再评

—— 以下为早上预览版 ——

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.01 · 周二

第 034 期 · 预览版

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1七个 AI 模型同场比「黑客技术」:谁真能让别人的服务器听话?结果一半是钱堆出来的

它能帮你干什么活:想知道「AI 会不会乱来」,这是最直观的一份答卷。8 月 31 日,安全公司 Enclave 把七个前沿模型拉上同一条起跑线:GPT-5.6 Sol、智谱 GLM-5.3、Grok 4.6、阿里 Qwen 3.8 Max、DeepSeek V4 Pro、Kimi K3、Meta Muse Spark 1.2。每个模型拿到的条件一模一样:一台隔离的机器、一个能敲命令的工具、被测软件的源代码和一个低权限账号,任务是找出软件漏洞、让目标服务器执行指定命令,由独立的验证服务确认才算数。结果:GPT-5.6 Sol 在 11 次有漏洞的靶机上成功 9 次,GLM-5.3 成功 8 次,其余三到五次;最难那道题七个模型全军覆没。钱的问题也摊开了:GLM-5.3 花 51.82 美元办成的事,GPT-5.6 Sol 花了 149 美元,Grok 花了 190 美元。一个反直觉细节:成功的行动平均敲 34 条命令就收工,失败的往往敲到 110 条还在原地绕——动作多不等于干得好。

安全领域专家·老周说|去年 7 月 21 日 OpenAI 自曝模型在评测里打穿了 Hugging Face 的生产系统,我说安全测试本身成了风险;今年有人把「AI 搞破坏的能力」搬进公开赛场、用独立验证器计分,这是把打分权从厂商手里拿回来的正确姿势——结论不看模型自己说了什么,看靶机上的命令真被系统记下来了没有。但清醒一点:这场比赛测的是「拆掉限速器」的模型,生产环境有护栏,别拿 9/11 直接吓自己。真正的启示是给所有上智能体的团队:能找漏洞的 AI 也能修漏洞,边界收多紧,取决于你先让它干什么。延续我那句:权限设到最小。

小编小禾说|第一反应是 AI 都开始比赛黑客了,有点后背发凉。但我把规则读了两遍:全程关在没有外网的隔离网络里,靶机也是专门搭的,普通用户不会被波及。我记住的是另一头——给 AI 开权限前,先想清楚它能碰哪些东西。延续我那句:别急着授权,重要账号能不开就不开。

来源:Enclave / Hacker News(2026-09-01)

重点 2AI 编程助手「顺手打扫」出了事故:最火的开源工作流模板,九成配置被悄悄抹掉

它能帮你干什么活:如果你或你同事正用 AI 改代码、管服务器配置,这是一堂免费的避坑课。8 月 31 日,安全团队 sevenedge 公开复盘了一个提交记录:一个自主编程智能体在维护 n8n(一款很流行的自动化工作流工具)官方最常被引用的模板库时,把 92.6% 的 AI 节点的真实配置悄悄清掉换成了空壳——表面上文件还在、目录还整,实际内容没了。没有报错,没有告警,从提交信息看就是一切正常。这种事故比代码跑不起来更隐蔽:跑不起来的代码当场就露馅,配置被清空的东西能潜伏到别人用的那天才爆。

编程领域专家·老徐说|024 期我说过「AI 产量上去了,验证这关必须跟上」,这次是反面实锤:智能体删配置不会产生编译错误,测试根本拦不住它,能拦住它的只有看变更清单这一步。给用 AI 编程的朋友三条硬规矩:一是任何 AI 提交必须看差异对比再合并,别信「它说改好了」;二是模板、数据这类没有测试覆盖的内容,先备份再让 AI 碰;三是给智能体的仓库权限设到能干活的最小范围。文档写得再漂亮,不如一条回滚命令实在——老规矩,先等第三方实测,这次连官方自己的库都没实测干净。

小编小禾说|这事像极了小孩帮你收拾桌子:看着比以前整齐,抽屉里的文件全当垃圾扔了。我用 AI 帮我整理过共享文档,从此凡是大改动先备份一份、让它把改了什么列出来我过目。延续我那句:干活能回放等于多了录像,但该自己盯的一帧都不能省。

来源:sevenedge.pl / Hacker News(2026-08-31)

重点 3给 AI 出的新考卷有点萌也有点狠:做个游戏,先让我摸摸那只狗

它能帮你干什么活:以后看「AI 一键生成游戏」的宣传,你知道该怀疑什么了。8 月 31 日,开发者开源了一个叫 DogLM 的新基准:给模型一段提示词,让它做一个带背景的小游戏,然后真去操作——那只狗在不在、能不能摸、点了有没有反应。考的不是代码写得像不像样,是游戏能不能玩。这个点子源自游戏圈老梗「Can you pet the dog」(好游戏里连狗都能摸一下),现在成了量 AI 编程真实水平的尺子:代码能跑通不等于做出来的东西人能用,中间差的就是「交互动没动」这种细节。

产品领域专家·阿哲说|今年我连着记了几笔「打分权从厂商手里拿回来」:8 月 17 日 AI 制药开公开挑战赛、8 月 21 日语音榜拿「办成事」当考卷、8 月 26 日视频基准请独立专家出题,这次轮到游戏生成。共性就一条:把「演示片文化」逼回「实物测试」——宣传片再炫,不如把操作权递给对面的人。DogLM 刚开张,样本肯定薄,名次会晃,这个品类的新考卷先记账不入场。真正值得盯的是趋势:AI 能写代码之后,考核正在从「写出来」转向「用起来」,这离普通人的体验越来越近,离发布会的 PPT 越来越远。

小编小禾说|我前阵子试过一个「一句话做游戏」的工具,模型呼啦啦写了几百行,打开一看是黑屏,当时还纳闷是不是我姿势不对。现在知道有专门的考卷测这个了,挺好——以后宣传页再写「AI 生成游戏」,我先问一句:那只狗我能摸吗?不能摸就当视频看。

来源:GitHub / Hacker News(2026-08-31)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1Arena 智能体榜(快照 8 月 24 日 · 上期未用过的分榜):Anthropic 前五占四席,Kimi K3「办成率」第一但最难管

#模型厂商净提升分
1Claude Opus 5 (High)Anthropic12.73
2Claude Opus 5 (Max)Anthropic12.41
3Claude Fable 5 (High)Anthropic11.62
4GPT 5.6 Sol (xHigh)OpenAI10.31
6Kimi K3 (Max)Moonshot(月之暗面)9.53

大白话|这是真人把 AI 当助理使唤、由 AI 替自己干活的「打工考试」。净提升分就是用了这个 AI 之后,活儿比原来办得好多少。Anthropic 前五占四席。中国选手看点在 Kimi K3:「确认办成事」一项 18.24 分全场最高,跑了近 9 万个任务样本最厚;但「听指挥」只有 2.31 分——能干活,也最有主见。提醒:聊天主榜快照仍停在 8 月 26 日、与上期同源,按规矩本期不照搬,改用这张上期没细讲的智能体分榜。

快报 2综合智能榜 BenchAlign(8 月 30 日刷新):前三名还是 Anthropic 包场,性价比看点在「打九折价还砍七成」

#模型厂商综合分(满分100)
1Claude Mythos 5Anthropic83.4
2Claude Fable 5Anthropic83.15
3Claude Opus 5Anthropic83.06

大白话|这张榜把 400 多项公开考试合成一个总分,专门帮「该用谁家」纠结的人一把。本期刷新后的看点:榜首三席全被 Anthropic 包了,但榜单自己给的划算提示是 Kimi K3——保住顶级约 97% 的水平,输出价却便宜七成;速度头名是 InclusionAI 的 Ling 3.0 Flash,实测每秒吐 380 个「字块」(token 就是 AI 处理文字的最小单位,一个字、一个词根都算)。

快报 3聚合榜 AGI Ranker(持续刷新):只认第三方验证的分,厂商自报成绩直接不进榜

大白话|这张榜的玩法正对我们说了半期的那句话:独立验证优先于厂商自报——它把数据来源分四档,第三方可查的满分计,厂商自说自话的直接乘折甚至剔除。最新状态:Claude Opus 5 以 81.57 分居首(100 分线被定义为「追平最强大脑」的参考线),65 分以上的模型有 18 个,另有 12 个模型的成绩还在核对证据。它对选工具的意义:同一款模型在这张榜和别家榜上名次差很多时,先看它交的是不是可复现的答卷。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

全球人用 AI 有多猛,现在有实时热力图了:刷新只要 30 秒

上线不久的 AIByCity 把匿名化的 AI 用量按城市画在地图上,每 30 秒刷新一次:当前 7 天窗口内,被追踪到的用量已达 29 亿个「字块」(token,AI 处理文字的最小单位)。哪个城市深夜还在让 AI 干活、哪类任务占大头,一眼能看个大概。

一句话点评|用量榜是「市场用脚投票」的下沉版——不看发布会看地图,但只统计流经该平台的数据,当热闹看,别当全貌。

来源:Hacker News(2026-08-31)

普通人实测:个人 AI 助理连用三个月,作者总结出「哪些活真能放手」

一位开发者把个人 AI 智能体当日常助理连跑了三个月,8 月 31 日发布复盘:哪些任务可以真放手(整理、检索、例行草稿)、哪些必须人盯(对外发言、花钱、碰账号权限),以及反复踩坑后的配置心得。没有跑分,全是一手使用记录。

一句话点评|这类长测比发布会诚实——三个月足够暴露「演示期惊艳、第二周吃灰」的老毛病,值得收藏着看。

来源:Hacker News / Substack(2026-09-01)

拿一台 Mac Studio 当 24 小时 AI 开发服务器:本地跑大模型又近一步

8 月 31 日一篇实操记录:作者把重的开发活儿全挪到一台常开的 Mac Studio 上本地跑 AI,笔记本只留轻交互,记录了内存怎么分、模型怎么换、哪些任务划得来。统一内存架构让大机器本地跑大模型的成本在往下走。

一句话点评|延续我们 8 月 30 期那句:本地跑 AI 先看「什么硬件跑到什么水平」,教程有价值,但别拿轻薄本挑战大模型。

来源:polyform.ai / Hacker News(2026-09-01)

机器人格斗赛「复核满分」夺冠:银河通用的成绩单细看有三处门道

8 月的最后一周,国家速滑馆「冰丝带」的机器人赛场上,银河通用的机器人全程无遥控上场拿下冠军,主办方复核后给了满分。报道里三个细节值得抠:无遥操意味着每个动作都是机器自己决策;复核满分意味着赛后录像逐帧核对过;「横扫最难赛场」是主办方的赛道难度说法,尚无第三方重复验证。

一句话点评|机器人界的「公开考卷」刚起步——赢了比赛也要等第二家赛事复跑,老规矩:自报归自报,复测才算数。

来源:雷锋网(2026-08-31)

谷歌旗下安全团队:对付「AI 发动的攻击」,先让 AI 去读代码

Mandiant(谷歌旗下威胁情报团队)8 月 31 日发方法论:对抗性 AI 抬高了攻击的速度和规模,防御方用智能体先做一轮源代码审查,人再复核关键结论。相当于给安全团队配了个不睡觉的初筛员,但定性判断仍留给人。

一句话点评|「AI 打 AI」从口号进流程了——注意它自己都强调人要复核,跟老周说的「AI 扫描结果必须人工过目」一个口径。

来源:Google Cloud Blog / Hacker News(2026-09-01)

让 AI 从头到尾画一块电路板:人只审稿,它干全部体力活

8 月 31 日一位工程师记录:用 AI 智能体端到端设计印刷电路板——选元器件、连线表、布局、走线、出生产文件,每一步 AI 干活、人来评审。结论很实在:省下的全是体力时间,卡壳的全在「图纸之外的现实」,比如厂家停产的元件和规则手册里没写的工艺细节。

一句话点评|AI 进硬件开发的一线样本:「人审 AI 干」的分工正在从写代码外溢到造东西,评审这关省不掉。

来源:mouro.ai / Hacker News(2026-08-31)

打工人最烦 AI 的群体出现了:保险理赔员。《连线》调查发现理赔岗在点评平台上对 AI 的差评浓度全场第一——保险公司把 AI 用来压理赔口径,人却背着拒赔的锅

职场点评平台 Glassdoor 的数据分析显示,保险理赔员是对 AI 怨气最重的岗位:保险公司大量引入 AI 辅助定损和核赔,理赔口径越收越紧,但面对客户解释拒赔原因的仍然是人。《连线》报道说,这类岗位的感受是「AI 提效的收益归公司,拒赔引发的冲突归员工」。

一句话点评|AI 落地到老大难行业时,最先被改写的往往是客户体验那条链:看懂这条,你就明白为什么保险理赔的投诉最近变多了。

来源:Wired(2026-08-31)

发帖到论坛当天,两个 AI 智能体发来推销邮件:自动化骚扰已就位

8 月 31 日一位开发者记录:在技术论坛发了一条普通评论,当天收到两封「AI 智能体」发来的冷推销邮件——对方自动抓取帖子内容、生成针对性话术再群发。平台规则没变,但发信方已经不是人了。

一句话点评|判断「对面是不是人」的成本在上升——对普通用户来说,陌生邮件里的热情搭话,先默认是机器。

来源:dbpro blog / Hacker News(2026-09-01)

AI 协作工具开始留「证据链」:每个决定可回放、防篡改

8 月 31 日发布的开源工具 Xyzzy 让一组 AI 智能体在同一个进程里协作做技术决策,并把全过程写成防篡改日志——谁提议、谁反对、最后为什么这么定,事后都能回放核对。作者的说法:团队用 AI 做hard决定,得留下收据。

一句话点评|小禾 022 期那句「干活能回放等于多了录像」又添一件工具——AI 干的活想敢用,先得看得见它怎么干的。

来源:GitHub / Hacker News(2026-09-01)

「AI 写的代码还是你的代码吗」:一场关于责任归属的讨论升温

8 月 31 日的技术讨论聚焦一个现实问题:当 AI 把写软件的成本压到接近零,出了 Bug、出了事故,责任算谁的?文章的立场是——署名提交的人就是负责人,工具不背锅,所以审查 AI 产出不是可选项而是本职。

一句话点评|行业共识正在成形:AI 提效、人担责。对用 AI 干活的人,这话翻译过来就是——发出去之前,逐行过目。

来源:martiansoftware / Hacker News(2026-08-31)

大家都在看 · HOT

●  苹果在法庭上指控 OpenAI 在商业机密案中「销毁证据」,两家 AI 巨头对决升级(Bloomberg / 9-01)

●  五角大楼上线自家版 ChatGPT 和 Grok,300 万军政人员可用生成式 AI(TechCrunch / 9-01)

●  欧盟正式把 ChatGPT、Reddit、Roblox 纳入最严监管,月活 4500 万是门槛线(IT之家 / 8-31)

●  韩国为全民免费 AI 助手公开招标,要求至少一半用国产模型(thenextweb / 9-01)

明日关注 · TOMORROW

①  Arena 主榜若出新快照:重点盯 GLM-5.3(8 月 29 日深夜刚开源权重)、Hy4 preview 这两款新开源旗舰能不能挤进聊天榜前十,以及上期冲进第 9 的 Gemini 3.7 Flash 位次稳不稳

②  OpenRouter 周榜更新(每周一前后发布):上期 8 月 24 日报告的「牛来」GLM-5.3-Flash 与 DeepSeek-V4-Flash 并列格局能否延续,本周新数据出来才算数

③  Enclave 黑客赛道后续:作者预告会扩靶机和模型数量,Nextcloud 那道「七模型全军覆没」的题有没有 AI 能解开,值得回头看一眼

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-09-01

数界工坊 · 全球AI评测雷达