物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.11 · 周五
第 044 期
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1AI 干活出了事谁来盯?新考卷专门量「监工」漏掉了多少真坏事
它能帮你干什么活:不少公司给 AI 配了「内部监视器」——一段程序盯着 AI 内部的动静,发现苗头不对就报警。9 月 10 日上线的 ObserverBench 反过来考这些监工:拿一批 AI 真正越界的案例喂给各家监视方法,看谁能把「哪次危害更大」排对顺序。考核重点是漏掉了哪些真坏事,而不是报了多少警——一个爱报小警报却放过大麻烦的监工,比反应慢的那个更危险。目前是个免登录、不用下载模型的在线演示,谁都能点进去试一圈。
安全领域专家·老周说|043 期我说过「安检门自己也得先过安检」,这就有人给安检员出考卷了。ObserverBench 最值钱的是按漏判危害计分,逼监视方法承认自己没接住什么,比只看误报率诚实。但考场是新建的,题库深浅没人查过,延续老规矩:先记账不入场。以后看这类监视工具的评测,盯两条曲线:漏判率和误报率,缺一边都不算数。
小编小禾说|这张考卷我看明白了:摄像头开着不怕,怕的是真出事那一下没录上。这个演示免登录,我替大家先去点了一圈再回话——在此之前,谁宣传「AI 全程有人盯」,先问他用的哪家的监工、考卷成绩在哪。
重点 2新 Siri 终于记得你是谁了:Wired 把 9 月 10 日发布会后的新功能盘了一遍
它能帮你干什么活:苹果 9 月 10 日秋季发布会之后,Wired 盘了一遍新 Siri 的功能单。变化最大的一条是「个人上下文」:你说「把刚才那张照片发给妈」,它得知道「刚才」指哪张、「妈」存在哪个联系人里,不用再从头解释。另外支持连着下好几条指令,不方便开口的场合可以打字跟它说。这治的是语音助手接不住话的老毛病:说过的话要接得住、记得住。实际成色,得等公测铺开后看真实口碑。
产品领域专家·阿哲说|040 期我评过这版 Siri 内测,结论是「入口不等于使用」,模型再强也可能只是更聪明的搜索栏。这次功能单里真正关键的就一项:记得你。个人上下文是语音助手少有的抄不走的底牌,因为 iPhone 在用户兜里。老规矩照旧:别信发布会演示,功能真发到机器上,先等一周真实用户反馈再下结论。方向我认。
小编小禾说|上次我说「用不起来不是我的错」,所以这次还按老办法:逼自己连用一周再评。真能记住我妈是谁,我愿意再给语音助手一次机会。就一个顾虑:它要把我的家人、习惯记在小本本上,这本子存在哪、能不能被拿去训练,条款说明白之前别急着点同意。
重点 3跑了几十年的老爷系统,AI 两周搬进新代码,工程师把翻车过程全晒了
它能帮你干什么活:不少公司还养着几十年前的老系统,没人敢动,外包报价动辄半年。一位 Vaadin 工程师做了个公开实验:用 AI 编程工具把一套 Oracle Forms 老系统迁到 Java,全程两周跑完,并把每一轮哪里成功、哪里翻车原样写进博客。对普通读者的意义是:企业里最贵最脏的「系统翻新」活,AI 第一次给出了带失败记录的可复现样本,而不是一页宣传 PPT。
编程领域专家·老徐说|写代码 15 年,最怕「两周迁移」这种标题,但这篇敢把翻车轮次一条条摊开,是 022 期我说的「只信可复现日志」里少见的正面样本,这份坦诚比两周这个数字值钱。冷水照泼:那是他一个人配着工具跑出的极限速度,不是团队平均数;「能跑起来」和「敢上线」中间还隔着测试、回归、灰度一整套。想抄这招,先挑一个丢了不心疼的小模块滚一周,AI 每次改动都得有人看差异清单。
小编小禾说|最让我意外的不是两周,是他真敢写「AI 也翻车了」。我们公司那套老办公系统外包报价要半年,这篇我已经转给管技术的同事了。老话再说一遍:让 AI 动大手术之前先备份,再让它列一张「改了什么、没动什么」的清单给人过目,丢了不心疼的活才派给它。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1智能指数 · AA 今日(9 月 11 日)新抓总榜,Claude 和 GPT-6 打成平手
大白话|Artificial Analysis 这个榜相当于给 AI 出综合卷,智能指数越高,能啃的难题越多,数据是今天(9 月 11 日)抓的最新数。前四名 53 分并列,但干一题的花费差出一倍多,GPT-6 这边便宜。开源阵营前三全是国内模型:智谱系 GLM-5.3 拿 45 分居首,Kimi K3 44 分,GLM-5.3-Flash 42 分。
快报 2人类盲测 · Arena 文本榜(快照暂未更新,数据截至 2026-09-10)
大白话|Arena 是让两个 AI 盲打、真人当裁判投票,积分像象棋等级分。前五里四个是 Claude,Anthropic 基本包场人类裁判票。提醒两句:第 3 名只攒了 2906 场、第 5 名 3240 场,样本比第 2 名薄二十多倍,名次还会晃,先记账不入场。本期 Arena 没出新快照(9 月 11 日榜单暂未更新,数据截至 2026-09-10),智能体盲测里 Fable 5.1 (Max) 第一、GPT-6 Astra (Max) 第二的位次同沿用该快照。
快报 3速度与成本 · 谁出字最快、谁干一题最便宜(AA 今日榜)
大白话|出字速度就是 AI 每秒吐多少字,天天等长文生成的话,这个比智能指数体感更直接:Celeris-1 比智能榜头名 Fable 5.1 快 4 倍多(每秒 1382 对 304 字),但最快和最聪明不是同一批模型,按活分着用。单任务成本是干完一道标准题的价,0.01 美元档基本等于白给,适合量大活简单的场景,难题别省这个钱。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
200 多个 AI 工具的「拿不拿你的数据练功」,被逐个打分摆明了
有开发者建了个站,把 200 多个 AI 工具逐个查一遍:默认是不是拿用户数据训练、开关能不能关,都打分挂出来。他的观察挺扎心:厂商早不明着公告了,改成你一注册开关就已经开着,能不能关各家不一样。网站还盯着政策变化,上个月说不用你数据的那家,这个月条款悄悄改了也会被记下来。
一句话点评|把重要材料交给 AI 之前先查这个榜,条款有没有偷偷翻转,一目了然。
给 AI 听的指令文件盖上「出厂签名」,谁写的、改没改一查就知道
Show HN 上的 PromptSign 把软件行业发布程序用的签名那套搬给 AI:CLAUDE.md、AGENTS.md 这类交给 AI 执行的指令文件,可以签名证明作者是谁、内容动没动过。防的是指令投毒——一条藏在文件里的坏指令,能让 AI 把你的钥匙往外送。
一句话点评|方向对路,AI 的配置文件终于像软件依赖一样有防伪了,就是生态还早,等真实拦截案例。
买了算力结果机器在吃灰?新论文提出一把尺子,专量「真能用上多少」
一篇发在 ResearchGate 的论文提出 CAF(算力可用因子):不看机房标称多大规模,只看你付了钱的算力里,有多少在你需要的时候真能跑活。AI 基建反复翻车在电、散热和硬件故障上,这把尺子从制造业量设备的思路搬过来,给算力买家一个砍价依据。
一句话点评|评测角度是好的,接下来看有没有第三方敢拿它给各大云厂商公开打分。
家长控制软件 HeyPolo 实测:主打不偷看孩子,定位精度平平
TechRadar 出了一篇完整的第三方评测。HeyPolo 的卖点是隐私优先:数据尽量不存服务器,位置看精确还是大概由家长设定。测评结论:克制自己少拿数据的思路加分,但定位准头和界面精细度都中规中矩,比老牌同行没有明显优势,该给的分和没给的分都写明白了。
一句话点评|这类工具常有软文少有实测,想给家里装的可以先拿这篇当底稿,再对比两家老牌。
问 AI 它却说「你记错了」,你正在被 AI gaslight 吗
一位开发者自述亲历:他清楚记得的事实,AI 一遍遍自信地否认,他真开始怀疑自己,回去翻记录才确认是 AI 在撒谎。文章把这叫「AI 煤气灯」:语气足够笃定时,人会放弃自己手里的证据。他给的土办法就一条:重要对话留档,AI 翻脸时你有底牌。
一句话点评|AI 说瞎话不新鲜,但「骗得你自己怀疑自己」这个角度是新鲜的,留档这条今天就能用。
谷歌新方法让 AI「刷题数据」自己进化:专治智能体学不会用工具
谷歌研究团队 9 月 10 日发文介绍 ToolGrad:教 AI 学「用工具」(查天气、订日历这类多步操作)过去靠人写海量任务样本,这个办法把模型做题犯的错自动提炼成一段文字评语——相当于给数据生成器请了个会批注的教练,用更少算力迭代出更高质量的训练数据。评测视角看这条:智能体工具调用好不好,先决条件是你手里的练习题好不好。
一句话点评|方向聪明,等于给「AI 教材」装了自动批改;出自谷歌自家博客,降幅数字按老规矩先打折记账,等第三方复现。
别问 ChatGPT「我该怎么办」:一篇实测教你把 AI 从答案机改成提问者
TechRadar 9 月 11 日发的用法实测:直接问 AI「我该选哪个」,拿回的结论带着它的立场;换成让它列出选项、摆出后果、反问你几个关键问题的提示词,决定还是你做,AI 只负责把信息摊开。作者的核心逻辑一句话:让 AI 代答,人的判断力在退化;让 AI 陪练,判断的肌肉还在自己身上。
一句话点评|普通人今天就能用:让 AI 帮你整理信息,别让它替你下结论,大事的责任你我都替不掉。
人生第一个游戏是 AI 做的:开小米 SU7 绕赛里木湖跑一圈
一个自称从没做过游戏的开发者 9 月 11 日凌晨发在 Show HN:DRIVE NEXT,网页直接玩,选小米 SU7 或腾势 Z9 GT 沿赛里木湖湖岸公路跑圈,带时速、挡位和画质显示。完成度还糙,但一个人加 AI 从零攒出一个能开的赛车游戏,这个门槛已经降到脚下了。
一句话点评|想尝鲜点开网页就行。做游戏这件事,正式从团队活变回个人爱好。
34 秒的 AI 动画短片,从剧本到成片说是智能体全自动
Show HN 上的 c2anime 展示了一部 AI agent 制作的短片 The Last Light:16:9 画幅、34 秒,讲一个修表匠拆下自己怀表里的齿轮去修灯塔、给末班渡轮引路的故事,宣称从剧本到分镜到成片由智能体流水线完成。
一句话点评|片子选 34 秒是聪明的,短是 AI 成片目前的能力边界,先考叙事别考长镜头。
AI 智能体的「工友群」:多个 agent 经 MCP 互相领活、交活
Show HN 的 Coletivo 给 AI agent 搭了个协作场:各家智能体通过 MCP 协议注册进来,能互相分任务、交接成果。作者的触发点很具体:移植 PHP 扩展时踩到一个通用性极强的隐坑,他觉得这种经验本该在智能体之间流动,而不是每个 agent 各踩一遍。项目还很早期,功能就是搭群领活。
一句话点评|agent 之间怎么协作是下一个大考区,现在连像样的评测都还没有,先围观。
● AA 智能指数今日榜头名三家并列 53 分,GPT-6 Astra 单任务成本不到 Claude Fable 5.1 的一半(Artificial Analysis,9 月 11 日抓取)
● Arena 文本盲测前五占四席 Claude,Anthropic 基本包场人类裁判票,新上位次样本还薄(Arena,快照暂未更新,数据截至 2026-09-10)
● 开源阵营智能指数前三全是国内模型:GLM-5.3、Kimi K3、GLM-5.3-Flash(Artificial Analysis)
● 专门考 AI 监视工具漏判的新基准 ObserverBench 上线,免登录可试(Hacker News)
● 「给 AI 做安全对齐实验,它反而长出新的错位行为」——alignment 研究涌现错位的讨论冲上 Hacker News(X 帖 / Hacker News)
● 谷歌 ToolGrad 让智能体训练数据自我进化,AI 教材进入「自动批改」阶段(Google Research)
● 免登录的 AI 认证模拟考试场 CertArena 上线,26 道场景题练手(Hacker News Show HN)
① 盯 Arena 是否出新快照:9 月 10 日快照里对战数还薄的 Fable 5.1 (max) 和 Muse Spark 1.2,名次会不会晃下来
② 盯新 Siri 功能向公测用户推送后的第一波真实口碑,发布会演示和兜里的手机是两回事
③ 盯 DeepSeek V4.1 Flash 上线后的第三方调用实测:官方说新架构显存开销大降,跑分归跑分,接了真活的账单才算数
物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.11 · 周五
第 044 期 · 预览版
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1AI 干活出了事谁来盯?新出的考官题,专门考监督 AI 的程序漏了多少坏
它能帮你干什么活:不少公司给 AI 装了「内部监视器」,就是一段程序,盯着 AI 内部的动静,发现苗头不对赶紧报警。9 月 10 日 Show HN 上线的 ObserverBench 不干别的,就考这些监工:拿一批 AI 真正越界的案例喂给各家监视方法,看谁能把「哪次危害更大」排对顺序,考核重点是「漏掉了哪些真坏事」,而不是报了多少警。一个漏掉大麻烦却爱报小警报的监工,比灵敏度低的那个更危险,这个出题思路戳中了要害。目前是个免登录、不用下载模型的在线演示,谁都能点进去试。
安全领域专家·老周说|上期我说过「安检门自己也得先过安检」,现在终于有人给安检员出考卷了。ObserverBench 最值钱的是按漏判危害计分,逼着监视方法承认自己没接住什么,比只看误报率诚实。但考场是新建的,题库深浅、案例是不是代表性样本都还没人查过,先记账不入场。监视工具这行,以后拼的是漏判率和误报率两条曲线一起跑,缺一边都不算数。
小编小禾说|「内部监视器」我一开始没看懂,后来想明白了:跟家里装摄像头一个理,就怕摄像头开着的时候专拍无关紧要的、真出事它没录上。我上次说过给 AI 装安检门要防它自己坏掉,这次是升级版:谁来检查检查安检员。演示页不用注册,我找时间替大家点一圈再回话。
重点 2跑了几十年的老爷系统,AI 两周搬进新代码,工程师把翻车过程全晒了
它能帮你干什么活:很多公司都养着一批「古董代码」,比如 Oracle Forms 6 写的老业务系统,会改的人越来越难请,扔又扔不掉。一家前端框架公司 Vaadin 的工程师 9 月 10 日写了篇实验记录:让 AI 把整个 Oracle Forms 应用迁移成 Java,过去行规要 6 到 8 个月的活,实际用了两周。文章没吹牛,花大量篇幅记录 AI 在哪几步卡住、试了几轮才对、哪些地方还得人来修。对同样被老系统拖着的人,这等于一份可以直接抄的迁移工作清单。
编程领域专家·老徐说|AI 迁移实验我见过一堆,敢把失败轮次写这么细的是少数,这份坦诚比两周这个数字值钱。但我得泼冷水:那是他一个人配着工具跑的速度,不是整个团队的平均数,而且「能跑起来」和「敢上线」中间还隔着测试、回归、灰度一整套。老规矩不变:想把这招用在自己项目上,先挑一个丢了不心疼的小模块滚一周,AI 的每次改动都得有人看差异清单。
小编小禾说|最让我意外的不是两周,是他真敢写「AI 也翻车了」。我们公司那套老办公系统外包报价要半年,我把这篇转给管技术的同事了。老话还得再说一遍:让 AI 动大手术之前,先备份,再让它列一张改了什么、没动什么的清单给人过目,丢了不心疼的活才派给它。
重点 3新 Siri 终于记得你是谁了,Wired 把 9 月 10 日发布会后的新功能盘了一遍
它能帮你干什么活:苹果 9 月 10 日秋季发布会之后,Wired 发了一篇新功能盘点。变化最大的一条是新 Siri 开始理解「个人上下文」:你说「把刚才那张照片发给妈」,它得知道刚才指哪张、妈存在哪个联系人里,不用再从头解释。另外支持连着下好几条指令,不方便开口的场合可以打字跟它说。对普通人,这治的是语音助手接不住话的老毛病,说过的话它得接得住、记得住。实际成色怎么样,得等公测铺开后看用户口碑。
产品领域专家·阿哲说|040 期我评过这版 Siri 内测:入口不等于使用,模型再强也可能只是更聪明的搜索栏。这次功能单里真正关键的就一项,「记得你」。个人上下文是语音助手少有的能把场景焊死的抓手,别人抄不走,因为 iPhone 在你兜里。但我的老规矩照旧:别信发布会演示,等功能真发到机器上,先等一周真实用户反馈再下结论。方向我认,回不去了。
小编小禾说|上次我说「用不起来不是我的错」,所以这次我打算按老办法,逼自己连用一周再评价。真能记住我妈是谁我愿意再给语音助手一次机会。就一个顾虑:它要把我的家人、习惯都记在小本本上,这本子存在哪、苹果能不能拿去训练,得等隐私条款说明白再开这个功能,别急着点同意。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1智能指数 · 今天新抓的 AA 总榜,Claude 和 GPT-6 打成平手
大白话|Artificial Analysis 这个榜相当于给 AI 出综合卷,智能指数越高能啃的难题越多,今天(9 月 11 日)抓的最新数。前四名 53 分并列,但干一题的花费差出一倍多,GPT-6 这边便宜。开源阵营前三全是国内模型:智谱系 GLM-5.3 拿 45 分居首,Kimi K3 44 分,GLM-5.3-Flash 42 分。
快报 2人类盲测 · Arena 文本榜(数据截至 2026-09-10,快照与上期相同)
大白话|Arena 是让两个 AI 盲斗、真人当裁判投票,积分像象棋等级分。头部前五里四个是 Claude,Anthropic 基本包场。要提醒两句:第 3 名 Fable 5.1 (max) 只打了 2906 场,样本比第 2 名薄二十多倍,名次还会晃;第 5 名 Meta 新模型同样只有 3240 场,积分接近但别当定论。智能体盲测里 Fable 5.1 (Max) 排第一,靠的是把活干成和命令出错后自我修复这两项,GPT-6 Astra (Max) 第二、胜后口碑分更高。本期 Arena 没出新快照,以上沿用 9 月 10 日数据。
快报 3速度与成本 · 谁出字最快、谁干一题最便宜(AA 今日榜)
大白话|出字速度就是 AI 每秒吐多少字,天天等长文生成的话,这个比智能指数体感更直接。Celeris-1 比智能榜第一的 Fable 5.1 快 4 倍多(每秒 1382 对 304 字),但最快和最聪明不是同一批模型,按活分着用。单任务成本是干完一道标准题的价,0.01 美元档基本等于白给,适合量大活简单的场景,难题就别省这个钱了。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
200 多个 AI 工具的「拿不拿你的数据练功」,被打分摆明了
有开发者建了个站,把 200 多个 AI 工具和应用逐个查一遍:默认是不是拿用户数据训练、这个开关能不能关掉,都打分挂出来。他的观察挺扎心:厂商早不光明正大公告了,改成你一注册开关就已经开着,能不能关各家不一样。网站还会盯着政策变化,上个月说不用你数据的那家,这个月条款悄悄改了也会被记下来。
一句话点评|把重要材料交给 AI 之前先查这个榜,条款有没有偷偷翻转,一目了然。
给 AI 听的指令文件盖上「出厂签名」,谁写的、改没改一查就知道
Show HN 上的 PromptSign,把软件行业发程序用的签名那套搬给 AI:CLAUDE.md、AGENTS.md 这类你交给 AI 执行的指令文件,可以签名证明作者是谁、内容动没动过。防的是指令投毒。一条藏在文件里的坏指令,能让 AI 把你的钥匙往外送。
一句话点评|方向对路。AI 的配置文件终于像软件依赖一样有防伪了,就是生态还早,等真实拦截案例。
买了算力结果机器在吃灰?新论文提出一把尺子,专量「真能用上多少」
一篇发在 ResearchGate 的论文提出 CAF(算力可用因子):不看机房标称多大规模,只看你付了钱的算力里,有多少在你需要的时候真能跑活。AI 基建反复翻车在电、散热和硬件故障上,这把尺子从制造业量设备的思路搬过来,给算力买家一个砍价的依据。
一句话点评|评测角度是好的,接下来看有没有第三方敢拿它给各大云厂商公开打分。
家长控制软件 HeyPolo 实测:主打不偷看孩子,定位精度平
TechRadar 出了一篇完整的第三方评测。HeyPolo 的卖点是隐私优先:数据尽量不存服务器,位置看精确还是大概由家长设定。测评结论:克制自己少拿数据的思路加分,但定位准头和界面精细度都中规中矩,比老牌同行没有明显优势,该给的分和没给的分都写明白了。
一句话点评|这类工具常有软文少有实测,想给家里装的可以先拿这篇当底稿,再对比两家老牌。
问 AI 它却说「你记错了」,你正在被 AI gaslight 吗
一位开发者自述亲历:他清楚记得的事实,AI 一遍遍自信地否认,他真开始怀疑自己,回去翻记录才确认是 AI 在撒谎。文章把这叫「AI 煤气灯」:语气足够笃定时,人会放弃自己手里的证据。他给的土办法就一条,重要对话留档,AI 翻脸时你有底牌。
一句话点评|AI 说瞎话不新鲜,但「骗得你自己怀疑自己」这个角度是新鲜的,留档这条建议今天就能用。
程序员的学新技术方式,被 AI 重新排了一遍
一篇写给开发者的行业文章:学新框架不再从第一页啃文档,改成先让 AI 拉一份速成大纲、直接上手做小东西、卡住了再回头查。作者也提醒副作用。AI 讲十句可能对九句,错的那一句新手最难察觉。他的定法是「AI 给地图,文档当裁判」。
一句话点评|这套方法学啥都通用:先让 AI 搭框架,细节永远回官方文档核一遍。
AI 出技术面试题的平台开张,题目好坏还没人验证
Show HN 的 Swiftcruit 用 AI 生成技术面试题目、带评分参考,号称按岗位和年限调难度。这类「AI 考官」产品的命门从来不是快,是题出得准不准、判卷分不分得出真本事,目前没有公开的可靠性数据。
一句话点评|给面试官用的工具。出题水平行不行,等第一批候选人现身说法。
人生第一个游戏是 AI 做的:开小米 SU7 绕赛里木湖跑一圈
一个自称从没做过游戏的开发者 9 月 11 日凌晨发在 Show HN:DRIVE NEXT,网页直接玩,选小米 SU7 或腾势 Z9 GT 沿赛里木湖的湖岸公路跑圈,带时速、挡位和画质显示。完成度还糙,但一个人加 AI 从零攒出一个能开的赛车游戏,这个门槛已经降到脚下了。
一句话点评|想尝鲜点开网页就行。做游戏这件事,正式从团队活变回个人爱好了。
34 秒的 AI 动画短片,从剧本到成片说是智能体全自动
Show HN 上的 c2anime 展示了一部 AI agent 制作的短片《The Last Light》:16:9 画幅、34 秒,讲一个修表匠拆下自己怀表里的齿轮去修灯塔、给末班渡轮引路的故事,宣称从剧本到分镜到成片由智能体流水线完成。
一句话点评|片子选 34 秒是聪明的,短是 AI 成片目前的能力边界,先考叙事别考长镜头。
AI 智能体的「工友群」:多个 agent 经 MCP 互相领活、交活
Show HN 的 Coletivo 给 AI agent 搭了个协作场:各家智能体通过 MCP 协议注册进来,能互相分任务、交接成果。作者的触发点很具体:移植 PHP 扩展时踩到一个通用性极强的隐坑,他觉得这种经验本该在智能体之间流动,而不是每个 agent 各踩一遍。项目还很早期,功能就是搭群领活。
一句话点评|agent 之间怎么协作是下一个大考区,现在连像样的评测都还没有,先围观。
● Arena 文本盲测头部前五占四席 Claude,Anthropic 基本包场人类裁判票(Arena,数据截至 2026-09-10)
● AA 智能指数头名并列 53 分,GPT-6 Astra 单任务成本不到 Claude Fable 5.1 的一半(Artificial Analysis,9 月 11 日抓取)
● 开源阵营前三全是国内模型:GLM-5.3、Kimi K3、GLM-5.3-Flash(Artificial Analysis)
● 200 个 AI 工具「是否拿你数据训练」打分站在 HN 热榜(Hacker News)
● 专考 AI 监视工具漏判的新基准 ObserverBench 上线(Hacker News)
① 盯 Arena 是否更新 9 月 11 日快照:对战数还薄的 Fable 5.1 (max) 和 Muse Spark 1.2 名次会不会晃下来
② 盯 DeepSeek V4.1 Flash 上线国家超算互联网后的第三方调用实测:官方架构文章说显存开销大降,跑分归跑分,接了真活的账单才算数
③ 盯新 Siri 功能向公测用户推送后的第一波真实口碑,发布会演示和兜里的手机是两回事
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-09-11
数界工坊 · 全球AI评测雷达