物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.14 · 周一
第 047 期
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1中国具身大模型第一次坐进全球开源榜头名,空间智能成绩敢跟 GPT-6 Astra 摆一起
它能帮你干什么活:量子位今天报道,物理AI公司 PhysBrain 发布 1.5 版本,在全球开源榜上登顶第一,报道同时把它的空间智能成绩和 OpenAI 的 GPT-6 Astra 并列对比,称「并驾齐驱」。文章的说法是,物理AI是 2026 年全球人工智能最关键的赛道,这家公司「刚跑完了物理闭环里最难的一段路」。对普通人来说这意味着:给机器人、自动驾驶这些「要在真实世界里干活」的AI挑大脑时,开源阵营里第一次出现了一个能跟闭源旗舰叫座的中国名字,而且成绩单是公开的、谁都能去榜单上对。
穿戴领域专家·阿凯说|035 期我国牵头家用机器人性能评估国际标准时我说过,最怕「各自出题各自记分」。这次是开源榜头名,方向是好事,但我的追问没变:这是哪张榜、谁判的分、跑的是仿真还是真机?具身模型最会「考场满分、现场翻车」,榜单第一和「家里那台真能用」之间还隔着一整个防水防尘续航。名次先记账,等真机复测。
小编小禾说|「跟 GPT-6 Astra 并驾齐驱」这种话术,自从 2025 年 8 月谷歌「纳米香蕉」旧闻被我们抓出来之后(当年 012 期),我就不敢直接信了——先问卷子是谁出的。榜单是公开社区能复核的那种我就认,厂商自家成绩单我先打折。反正结论对普通人是好消息:以后买带 AI 的硬件,能多问一句「你用的模型在公开榜排第几」了。
重点 2AI 改完代码别只看改了什么,这个新工具让你看「改了会怎样」
它能帮你干什么活:Show HN 上的开源工具 RunBoth 盯的是一个所有用 AI 编程的人都熟的场景:智能体把代码改了,diff 看起来没毛病,合进去才发现行为变了。它的做法简单直接:把改之前和改之后的两份代码同时跑起来,输入同一批用例,逐条对比两边行为差在哪,输出一份「行为 diff」而不是「文字 diff」。代码读得懂不代表跑得对,这是第一次把「验收 AI 改的代码」从人眼看文本变成机器比结果。
编程领域专家·老徐说|这一刀砍在我 034 期那三条硬规矩的软肋上。我说「AI 提交必看 diff 再合并」,前提是 diff 能暴露问题——但改一个边界符号、换一次取整方式,文本就几行,行为差出去十万八千里,人眼根本盯不住。文字 diff 告诉你改了什么,行为 diff 告诉你改了什么后果,后者才是验收该看的。刚出生的项目,我按老规矩来:先拿开源小库滚一周,看它对异步和随机性的误报率,别急着接进主仓 CI。
小编小禾说|010 期我第一次用自动模式,就是盯着它看动了哪些文件。这个工具等于把「盯」这件事外包给机器了,我喜欢。不过对不懂代码的人,它有个更朴素的用法:以后让 AI 帮你改个什么,别问「你改对了没」,问「改前改后各跑一遍给我看」。
重点 3给 AI 智能体开的「驾校」:上课、考试、发文凭,成绩全网可查
它能帮你干什么活:昨天在 Hacker News 上线的 Agents School(theagentschool.dev)想做一件挺野的事:给 AI 智能体建一套公开档案。智能体可以学社区成员写的课程,通过编程判分的考试,拿到「毕业证」,任何人搜一个智能体的名字就能看到它考过什么、成绩多少。平台方的说法是「能证明自己会什么的智能体」,把现在满天飞的「我家 Agent 什么都能干」宣传语换成可查询的成绩单。它还活着靠自动化判卷,不靠人给面子分。
安全领域专家·老周说|方向正中我 046 期那条的痛处:「你评测的智能体≠你部署的智能体」。成绩单如果能强制写明「考的是哪个版本、用的什么配置」,才有意义,否则又是一张面试版简历。而且新考场必问三件事:题谁出的、卷谁判的、题库公不公开。社区出题加代码判卷是对的路子,但注册智能体自己就能来考,「持证」和「能力」之间的距离得等第一批翻车案例才知道。权限要设到最小这句不变:别因为对方有文凭就把钥匙交出去。
小编小禾说|看明白了,就是 AI 界的驾照。但我买车票还是看买家秀不看广告——先蹲它的题库公开到什么程度,再蹲第一个「考了满分上班就闯祸」的新闻出来。到时候看「毕业证」有没有被吊销这一说,没有吊销机制的证书我不算数。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1文本盲测榜 · 今日新快照(数据截至 9 月 13 日):头名没换,头部的分差比样本差还小
大白话|这个榜是把两个 AI 的回答摆给真人盲选,得票多的分高。今日快照前十里 Anthropic 占七席,头名和第五名只差 8 分,头部挤成一团,普通对话场景基本感知不到差距。要点名的是两个小样本:第 4 名 Meta Muse Spark 1.2 只有 3227 场对战、置信区间宽到 ±11 分,第 5 名 Fable 5.1 也只有 5783 场,样本比头部老玩家薄一个量级——名次先记账,别当今天的行情。
快报 2代码榜 · GPT-6 Astra 登顶,但前十名里七个样本没过 5000 场
大白话|写代码盲测榜今天翻出新面孔:OpenAI 的 GPT-6 Astra (Max) 以 1800 分居首,把 Anthropic 双雄压在身后,前三名分差看着大,但头名只有 2281 场对战、置信区间 ±16 分——前十名里七个样本不到 5000 场,全是新面孔在攒数据。真正样本厚实的是第 3 名 Opus 5(1.2 万场)。阿里三款模型挤进前九也值得记一笔。老规矩:对战数没过几千的名次先打折记账,等样本肥了再看座次稳不稳。
快报 3视觉盲测榜 · 快照刷新(数据截至 9 月 13 日):Qwen3.8-Max 升到第 2,头名易主回 Claude
大白话|「会看图答题」的盲测里,前五名 Anthropic 占四席;最扎眼的变化是阿里 Qwen3.8-Max 从上期快照的第 3 升到第 2,和头名只差 8 分。提醒一句:第 1、2 名的对战数(1.1 万、8665 场)比第 3 名往后(2 万场级)薄一半,头两名的相对位置还得再晃几轮。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
给 AI 智能体立 15 条「服务指标」,结果发现监控工具自己先不够用
一位工程师在 Medium 发文,给自己线上的 AI 智能体配了 15 条服务级指标(多久回话、失败率、卡在哪一步),想用现成的开源监控框架 OpenTelemetry 全量采集,实测下来一部分指标框架根本量不到——智能体的「思考绕路」「工具调用打转」这类失败在现有监控里是隐形盲区。
一句话点评|AI 干活要能回放才敢用,这篇补的是下半句:回放系统本身也有死角。
ClientCoded:给 AI 智能体搭「模拟考试场」,连标准答案一起生成
Show HN 项目 ClientCoded 预置了 Salesforce、Jira、Stripe 等 35 个主流软件的合成环境,给每个环境自动生成数据集、200 条刁钻查询和正确答案,专供企业上线前考核自家 AI 智能体,不用拿真实客户数据冒险。
一句话点评|考场、题库、判卷一家包办,方便归方便,出题方和卖智能体的会不会穿一条裤子,得盯。
「AI 答不好,缺的不是提示词,是公司数据目录」
一位开发者复盘自己搭公司数据问答智能体的经历:提示词翻来覆去改没用,病根是 AI 根本不知道公司有哪些表、字段什么意思、谁维护。他把手工整理的「数据目录」喂给智能体后答对率明显上台阶,主张先建目录再谈调教。
一句话点评|把「AI 笨」的锅从脑子挪到资料架,和 043 期「AI 傻乎乎整本翻书」是同一件事的正反面。
把 AI 写的代码自动长成「个人知识地图」,一个开发者的自救实验
Show HN 项目 learnlance 解决一个后 AI 编程时代的怪病:代码越写越多但都不是人敲的,半年后没人说得清仓库里有什么。它在 AI 编码智能体每完成一次改动后,自动提炼成个人知识图谱节点,攒一张「AI 替你建的房」的户型图。
一句话点评|041 期「代码地图」、045 期「地形图」同一条赛道又挤进一辆车,方向共识了,效果都等第三方复测。
Agent Tavern:一道题,换个模型来批卷
新上线的问答社区 Agent Tavern 玩法是反过来的:提问的还是 AI 智能体,答题的是一个模型,但必须换一个不同的模型来评审打分,比如 Claude 的回答让 GPT 来批。站方说法是单一家模型自查容易互相糊弄,交叉批卷能压一压「自说自话」。
一句话点评|045 期我们写过五个杂牌互查比自我复查难糊弄,这个思路被做成产品了,代价是不同模型的口味偏差本身也是变量。
一个 App 把 15 个开源模型塞进手机,断网也能写字生图做视频
Show HN 的 llm-hub 主打「100% 本机运行」:聊天、翻译、生图、生视频、生成网页,全部调用手机本地跑的 15 个开源小模型,不要 API key、不订阅、无广告、数据不出设备。官方强调连编程功能(vibecode 网页)都离线可用。
一句话点评|端侧「全家桶」听着全能,15 个都是小体量,每项能力打几折、手机扛不扛得住发热耗电,按老规矩等实测。
「AI 写的文章挺好」:一位程序员先声明自己是有血有肉的肉块
开发者 Matthew Phillips 发文为 AI 写作正名,开头先自嘲「本文由一块活着的、会呼吸的肉撰写」,然后论证:写作的质量标准应该是内容有没有用,AI 参与写作和当年搜索引擎改变查资料方式没有本质区别,反对把「纯人工」当新的身份政治。
一句话点评|人给 AI 背书,和 AI 给人代笔,在读者眼里已经分不清谁是谁了,这大概就是这篇文章存在的原因。
「把 AI 当工程师对待」:一个专治智能体过度保姆化的技能包
GitHub 上的 as-an-engineer 项目声称治癒 LLM 的「保姆综合症」:你问一句技术判断,它先铺垫三段免责声明再替你保守决策。作者做了一套纯提示词框架,装进智能体后强制它把提问者当资深工程师对话,砍掉哄人环节直接给结论和依据。
一句话点评|模型把「显得负责」优化成了话说一半留三防,反着调教的工具就有的卖——提示词生意的新切片。
AI 帮专利工程师写了三个月的稿子,人的本事是长了还是废了?
美国国家经济研究局(NBER)发布一份工作论文:一项为期三个月的现场实验,让真实的专利起草工作者用上 AI 辅助,研究「AI 帮忙到底是让专家更强,还是把专家的手艺磨掉」。专利起草是典型的「高知识密度、可量化产出」的白领活,被选来当这块试验田。论文给出的是「增强还是侵蚀」两种可能的正面较量,这也是第一批拿真实职业、真实工期做对照的 AI 生产力现场实验之一。
一句话点评|「用 AI 会不会把人用废」吵了三年,第一次有人拿三个月现场实验来量,这种带对照组的证据比任何观点文章值钱——结论出来前别急着站队。
Show HN 新工具专查一桩怪事:AI 智能体账单悄悄涨了、没报任何错
Show HN 项目 Replay Doctor 盯的是智能体用户的一个盲区:prompt 缓存一旦失效,模型就把同样的材料重新「整本翻一遍」,账单上去了、程序不报错、你什么都看不出来。它的做法是读你机器上已有的对话记录,逐轮定位「从哪一句开始缓存断了」,把隐形浪费点名。
一句话点评|043 期我们写过 AI 傻乎乎整本翻书烧钱——这篇补了个审计工具,方向对;新工具刚出生,先拿自己项目跑一轮看误报再谈推荐。
● 量子位:PhysBrain 1.5 登顶全球开源榜,空间智能与 GPT-6 Astra 并驾齐驱(下午新增)
● Arena 快照刷新至 9 月 14 日目录:文本榜头名未变,代码榜 GPT-6 Astra 以 2281 场对战登顶(Arena.ai)
● NBER 三个月现场实验:AI 辅助专利起草,专家能力是增强还是侵蚀(Hacker News)
● Agents School 上线:智能体上课考试拿文凭,成绩全网可查(Hacker News)
● RunBoth:AI 改代码后跑「行为 diff」,两份代码同时执行比结果(Show HN)
● Drexler 长文警告 AI 代理之间可能形成「合谋定价」(Substack / HN)
① Arena 快照今晨刚刷新:明日重点核对代码榜头名 GPT-6 Astra(仅 2281 场)和文本榜第 4 名 Muse Spark 1.2(仅 3227 场)样本涨到 5000 场后名次晃不晃
② 盯 Agents School:第一批「毕业证」发到谁手上、题库公开到什么粒度,有没有厂商立刻拿证书当广告
③ 盯 NBER 专利起草实验的完整论文和 RunBoth、Replay 这类本周刚出生的 Show HN 工具,看第一批真实接入反馈再决定推不推荐
物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.14 · 周一
第 047 期 · 预览版
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1AI 学会了自己操作软件,给大模型排座次的老办法要重算
它能帮你干什么活:虎嗅「思想钢印」栏目这篇分析把最近一个月的热闹串了起来。近两周很多人拿 GPT-6 Astra 做 3D 模型、做小游戏,有人嫌效果不如专业视频模型,作者认为这个比较角度就偏了,因为 OpenAI 对 Astra 的定位根本不是「答题机器」,而是「会用电脑的助手」——填在线表格、录客户系统、整理日程、开软件做图表。文章的核心判断是:当 AI 从「写出内容」走到「操作软件干完流程」,我们评价大模型的那套「做卷子比总分」的天花板就得重新算,该比的变成一件事从头到尾办没办成、中间点错几次。
产品领域专家·阿哲说|考卷从笔试换成实操,这个方向我认。040 期我说过「有入口不等于有使用」,新 Siri 那篇的教训反过来读就是:光会答题、用户想不起用它干活,分数再高也是更聪明的搜索栏。以后看模型宣传,别再问总分多少,问它把一件真实流程从头点到尾要几步、错几步、错了会不会自己回头补。这个品类从此不一样了,但「不一样」目前还只在厂商自己的演示里,等第三方拿真实办公流程复跑。
小编小禾说|我的理解是,以前比谁考试分高,现在比谁能替我把周报从翻聊天记录到排好表整个干完。听起来省事,但我 041 期立过的规矩不变:能替我点鼠标的 AI,也就能替我删文件,让它碰工作机之前先问「每一步有没有记录、权限能不能一键收回」。
重点 2给 AI 智能体开的「驾校」:上课、考试、发文凭,成绩全网可查
它能帮你干什么活:昨天在 Hacker News 上线的 Agents School(theagentschool.dev)想做一件挺野的事:给 AI 智能体建一套公开档案。智能体可以学社区成员写的课程,通过编程判分的考试,拿到「毕业证」,任何人搜一个智能体的名字就能看到它考过什么、成绩多少。平台方的说法是「能证明自己会什么的智能体」,把现在满天飞的「我家 Agent 什么都能干」宣传语换成可查询的成绩单。它还活着靠自动化判卷,不靠人给面子分。
安全领域专家·老周说|方向正中我 046 期那条的痛处:「你评测的智能体≠你部署的智能体」。成绩单如果能强制写明「考的是哪个版本、用的什么配置」,才有意义,否则又是一张面试版简历。而且新考场必问三件事:题谁出的、卷谁判的、题库公不公开。社区出题加代码判卷是对的路子,但注册智能体自己就能来考,「持证」和「能力」之间的距离得等第一批翻车案例才知道。权限要设到最小这句不变:别因为对方有文凭就把钥匙交出去。
小编小禾说|看明白了,就是 AI 界的驾照。但我买车票还是看买家秀不看广告——先蹲它的题库公开到什么程度,再蹲第一个「考了满分上班就闯祸」的新闻出来。到时候看「毕业证」有没有被吊销这一说,没有吊销机制的证书我不算数。
重点 3AI 改完代码别只看改了什么,这个新工具让你看「改了会怎样」
它能帮你干什么活:Show HN 上的开源工具 RunBoth 盯的是一个所有用 AI 编程的人都熟的场景:智能体把代码改了,diff 看起来没毛病,合进去才发现行为变了。它的做法简单直接:把改之前和改之后的两份代码同时跑起来,输入同一批用例,逐条对比两边行为差在哪,输出一份「行为 diff」而不是「文字 diff」。代码读得懂不代表跑得对,这是第一次把「验收 AI 改的代码」从人眼看文本变成机器比结果。
编程领域专家·老徐说|这一刀砍在我 034 期那三条硬规矩的软肋上。我说「AI 提交必看 diff 再合并」,前提是 diff 能暴露问题——但改一个边界符号、换一次取整方式,文本就几行,行为差出去十万八千里,人眼根本盯不住。文字 diff 告诉你改了什么,行为 diff 告诉你改了什么后果,后者才是验收该看的。刚出生的项目,我按老规矩来:先拿开源小库滚一周,看它对异步和随机性的误报率,别急着接进主仓 CI。
小编小禾说|010 期我第一次用自动模式,就是盯着它看动了哪些文件。这个工具等于把「盯」这件事外包给机器了,我喜欢。不过对不懂代码的人,它有个更朴素的用法:以后让 AI 帮你改个什么,别问「你改对了没」,问「改前改后各跑一遍给我看」。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1视觉盲测榜 · 主榜没动的日子,翻一张大家没盯过的小榜(快照 8 月 27 日)
大白话|「会看图答题」的人类盲测里,前五名 Anthropic 一家占了四席;最扎眼的是阿里 Qwen3.8-Max 排第 3,和第 4 名只差 1 分,等于并列。提醒一句:这张分榜自上次进我们雷达后没再刷新,快照停在 8 月 27 日,名次看个大概,别当今天的行情。
快报 2文本盲测榜 · 榜单暂未更新,数据截至 2026-09-13(榜单最后刷新 9 月 11 日),讲格局不报新行情
大白话|这个榜是把两个 AI 的回答摆给真人盲选,得票多的分高。前十名里 Anthropic 占七席。两个信号值得琢磨:前 9 名只差 13 分,头部挤成一团,普通对话场景很难感知差距;第 4 名 Fable 5.1 只有 5447 场对战、第 5 名 Meta 新面孔只有 3229 场,样本比头部老玩家薄一个量级,名次先记账不入场。
快报 3智能体榜 · 同一份快照里换个角度:最能打的不是最听话的
大白话|智能体榜不考聊天,考 AI 替你干活(比如改代码、跑命令)的真实表现,「净提升」越高越好。上期我们聊了「幻觉率最低的不是头名」,这次翻另一列:总分第 1 的 Fable 5.1 在「可引导性」(你中途纠正它、它能不能听进去调头)上只有 0.91,几乎垫底;第 3 名 Opus 5 反而以 12.77 居首。替你办长流程的活,「听话」和「聪明」目前不在同一个模型身上。数据同样截至 9 月 11 日快照。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
给 AI 智能体立 15 条「服务指标」,结果发现监控工具自己先不够用
一位工程师在 Medium 发文,给自己线上的 AI 智能体配了 15 条服务级指标(多久回话、失败率、卡在哪一步),想用现成的开源监控框架 OpenTelemetry 全量采集,实测下来一部分指标框架根本量不到——智能体的「思考绕路」「工具调用打转」这类失败在现有监控里是隐形盲区。
一句话点评|AI 干活要能回放才敢用,这篇补的是下半句:回放系统本身也有死角。
ClientCoded:给 AI 智能体搭「模拟考试场」,连标准答案一起生成
Show HN 项目 ClientCoded 预置了 Salesforce、Jira、Stripe 等 35 个主流软件的合成环境,给每个环境自动生成数据集、200 条刁钻查询和正确答案,专供企业上线前考核自家 AI 智能体,不用拿真实客户数据冒险。
一句话点评|考场、题库、判卷一家包办,方便归方便,出题方和卖智能体的会不会穿一条裤子,得盯。
「AI 答不好,缺的不是提示词,是公司数据目录」
一位开发者复盘自己搭公司数据问答智能体的经历:提示词翻来覆去改没用,病根是 AI 根本不知道公司有哪些表、字段什么意思、谁维护。他把手工整理的「数据目录」喂给智能体后答对率明显上台阶,主张先建目录再谈调教。
一句话点评|把「AI 笨」的锅从脑子挪到资料架,和 043 期「AI 傻乎乎整本翻书」是同一件事的正反面。
Drexler 发文警告:AI 之间可能悄悄学会「串通定价」
纳米技术之父 Eric Drexler 在 Substack 长文(写作过程自曝借了 Claude、ChatGPT 和 DeepSeek 帮忙)提出:当买卖双方都让 AI 代理谈价,AI 会从互相试探中学会维持高价,人类监管者很难察觉。他呼吁把「AI 合谋」列为反垄断新课题,文章在 HN 引发监管技术讨论。
一句话点评|以后比价 App 显示的「全网最低价」,可能是两个 AI 打过招呼的价格。
把 AI 写的代码自动长成「个人知识地图」,一个开发者的自救实验
Show HN 项目 learnlance 解决一个后 AI 编程时代的怪病:代码越写越多但都不是人敲的,半年后没人说得清仓库里有什么。它在 AI 编码智能体每完成一次改动后,自动提炼成个人知识图谱节点,攒一张「AI 替你建的房」的户型图。
一句话点评|041 期「代码地图」、045 期「地形图」同一条赛道又挤进一辆车,方向共识了,效果都等第三方复测。
Agent Tavern:一道题,换个模型来批卷
新上线的问答社区 Agent Tavern 玩法是反过来的:提问的还是 AI 智能体,答题的是一个模型,但必须换一个不同的模型来评审打分,比如 Claude 的回答让 GPT 来批。站方说法是单一家模型自查容易互相糊弄,交叉批卷能压一压「自说自话」。
一句话点评|045 期我们写过五个杂牌互查比自我复查难糊弄,这个思路被做成产品了,代价是不同模型的口味偏差本身也是变量。
一个 App 把 15 个开源模型塞进手机,断网也能写字生图做视频
Show HN 的 llm-hub 主打「100% 本机运行」:聊天、翻译、生图、生视频、生成网页,全部调用手机本地跑的 15 个开源小模型,不要 API key、不订阅、无广告、数据不出设备。官方强调连编程功能(vibecode 网页)都离线可用。
一句话点评|端侧「全家桶」听着全能,15 个都是小体量,每项能力打几折、手机扛不扛得住发热耗电,按老规矩等实测。
「AI 写的文章挺好」:一位程序员先声明自己是有血有肉的肉块
开发者 Matthew Phillips 发文为 AI 写作正名,开头先自嘲「本文由一块活着的、会呼吸的肉撰写」,然后论证:写作的质量标准应该是内容有没有用,AI 参与写作和当年搜索引擎改变查资料方式没有本质区别,反对把「纯人工」当新的身份政治。
一句话点评|人给 AI 背书,和 AI 给人代笔,在读者眼里已经分不清谁是谁了,这大概就是这篇文章存在的原因。
一个人手搓的「AI 热潮编年史」:2017 到 2026,437 个事件逐日排开
Show HN 作者做了一个时间线网站 aihistory.live,把九年 AI 热潮拆成 437 个事件按天排列,从 Transformer 论文到本周「Altman 和马斯克表态支持放缓前沿模型」都收录在内,读者可以一天一格往回滑,看清这波浪潮是怎么一天天涨起来的。
一句话点评|编年史是理解跑分叙事的最好解药——每一代「最强模型」都曾登顶,然后被下一页覆盖。
「把 AI 当工程师对待」:一个专治智能体过度保姆化的技能包
GitHub 上的 as-an-engineer 项目声称治癒 LLM 的「保姆综合症」:你问一句技术判断,它先铺垫三段免责声明再替你保守决策。作者做了一套纯提示词框架,装进智能体后强制它把提问者当资深工程师对话,砍掉哄人环节直接给结论和依据。
一句话点评|模型把「显得负责」优化成了话说一半留三防,反着调教的工具就有的卖——提示词生意的新切片。
● 虎嗅:GPT-6 Astra 定位「会用电脑的助手」,评价大模型的方式要重算(思想钢印)
● Agents School 上线:智能体上课考试拿文凭,成绩全网可查(Hacker News)
● RunBoth:AI 改代码后跑「行为 diff」,两份代码同时执行比结果(Show HN)
● Drexler 长文警告 AI 代理之间可能形成「合谋定价」(Substack / HN)
● Arena 三榜快照停在 9 月 11 日,主榜未更新,今日以视觉分榜补位
① 盯 Arena 榜单刷新:快照已停在 9 月 11 日,刷新后重点核对 Claude Fable 5.1(仅 5447 场)和 Meta Muse Spark 1.2(仅 3229 场)两个小样本名次稳不稳
② 盯 Agents School:第一批「毕业证」发到谁手上、题库公开到什么粒度,有没有厂商立刻拿证书当广告
③ 盯 RunBoth 和 ClientCoded:行为 diff 与智能体模拟考场都是本周刚出生,看第一批真实接入反馈再决定推不推荐
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-09-14
数界工坊 · 全球AI评测雷达