物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.20 · 周日
第 053 期
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1权威机构给「桌面AI打工人」排了个座次:个人端和企业端第一是同一个
它能帮你干什么活:想知道让AI替你干活该选哪家,有了份第三方成绩单。9月20日,全球咨询机构沙利文发布《2026年全球桌面AI智能体市场研究报告》,腾讯WorkBuddy同时拿下中国个人端桌面智能体榜单和企业级榜单两个第一。此前这类产品评测多为厂商自宣或媒体单测,机构横评口径相对统一,适合当选购参考的「底稿」。
产品领域专家·阿哲说|双榜第一要拆开看:个人端拼的是「谁愿意天天打开」,企业端拼的是「谁敢接内部系统」。同一产品两头都拿第一,说明它在易用性和管控能力上没明显短板——但看榜先问它数的是什么人:是月活、日活还是付费席位,口径不说清,第一就只是营销词。
小编小禾说|我这周正好拿WorkBuddy整理会议纪要,从元宝传过去确实顺手。不过说实话,桌面智能体这东西「榜单第一」和「我每天都想起来用它」是两码事,名次当参考,最终还得拿自己的活儿试一试。
重点 2人人都在聊的「安静模型」Jev,有人替你做了一遍上手实测
它能帮你干什么活:帮你判断这个刷屏新模型值不值得你换掉现在的AI。9月15日发布后,AI圈讨论度最高的不是GPT、Claude或Gemini的新版本,而是一个几乎不说话的模型Jev,它很快被接入Vercel的AI网关,Vercel还公布了上线24小时内的调用数据。硅星人的实测结论很直白:没那么强,但足够给有点乏味的AI圈带来新刺激。
编程领域专家·老徐说|「几乎不说话」这类极简交互是个真方向:工程师要的是它把活干完,不是陪聊。但看实测稿要盯两点——它测的是不是你能用上的那个版本,以及「新刺激」有没有落到具体任务成绩上。热度是热度,成绩是成绩,分开记账,这是我们从033期以来一直立的规矩。
小编小禾说|我试着让它改一段旧脚本,它确实话少,一次给结果不啰嗦。但碰到需要追问细节的活儿就有点使不上劲,像对一个不爱解释的实习生:结果能用,过程问不出来。
重点 3智驾最难的不是「开走」是「停下」:幽灵刹车正在变成投诉重灾区
它能帮你干什么活:帮你理解为什么你的「自动驾驶」会突然踩刹车,以及该不该信它。果壳这篇稿子统计了车主们的真实遭遇:路况开阔、阳光明媚,车机蓝线平稳延伸,车却毫无征兆地一脚急刹。文章一句话点破——智驾发展到今天,最难的不是教车辆怎么开走,而是教车辆怎么停下。误刹车投诉正在积累,本质是感知系统的误报问题:把阴影、路牌、塑料袋都当成了障碍。
安全领域专家·老周说|误刹车比漏刹车更值得警惕,因为它在消耗用户的信任:被急刹过三次的司机,真需要刹车时会晚踩。这不是偶发,是边界不清——厂商宣传话术到了「全程接管」,系统实际能力只到「需要你看路」,中间的落差全让车主用惊吓买单。
小编小禾说|群里开智驾的朋友,晒急刹截图的明显比晒自动驾驶里程的多。我的感受是:现在各家宣传页写的「自动」,都还得翻译成「你在监督下的自动」。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1Arena 文本盲测榜 TOP5(快照 2026-09-20,榜单数据截至 9 月 13 日)
大白话|这是真人当裁判、看不到模型名字的盲测:前十里 Anthropic 一家占了七席。注意第4名的 Meta muse-spark-1.2 只打了3227场、误差不小,名次随时可能换位,别把它和七万场对战的老选手画等号。
快报 2Arena 智能体实测榜 TOP5(数据截至 9 月 15 日)
大白话|这个榜考的是AI替你干真活:改代码、跑命令、从报错里爬出来。前十 Anthropic 占六席,OpenAI 的 GPT 6 Astra 是名次最高的非 Anthropic 选手。细节里藏门道:第3名 Opus 5 (High) 的「可引导性」11.04 远高于榜首的 3.88——第一名不一定最好哄,选智能体模型时这项和成功率同样重要。
快报 3Arena 代码榜 TOP5(数据截至 9 月 11 日)
大白话|写代码这个最卷的赛道头部咬得很紧:第3到第5名分差只有13分,千问3.8 Max 和 Kimi K3 两个国产模型挤进前五。提醒一句:榜首只打了2281场、第4名2262场,都是小样本,隔一周再回来看名次才算站得住。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
GPU 集群「集体拉闸」难题:有团队把电流尖峰压在了软件层
VoltGrid 论文(Zenodo 公开):数千张 GPU 同时进入高负载会在毫秒级把供电电流拉出尖峰,越训越大越容易触发机房断电保护。这套方案用微秒级的集体调度干预,把训练集群的电流波动「削峰填谷」压在软件层解决。
一句话点评|算力评测以后不只比快、比省,还得比「电用得多平稳」——电网接入排队越来越长的当下,这是实打实的部署硬指标。
先别急着夸你的编程AI,这份「本地账单」可能让你重新评估
Show HN 工具 codex-stats:读取你机器上各家编程AI助手的本地会话记录,统计 token 消耗、失败重试、重复报错,生成用量洞察报告,数据不出本机。
一句话点评|评AI编程值不值,最硬的证据是自己的使用账单;它只读本地不上传,这个姿态在同类工具里加分。
给 AI 一键生成的 App 做免费安检:查你的数据库是不是在裸奔
用 Lovable、Bolt、Base44 这类工具几分钟搭出来的应用,很多都留着一张谁都能读的 Supabase 数据表。这个免费扫描器贴上网址,几十秒出结果。
一句话点评|AI 应用时代的基础设施就该这样:生成越快,安检越不能省。上线前先扫一遍,比事后上新闻强。
「60个人给AI当裁判」的颜值模型:样本量才是这题的考点
Show HN 项目 faceanalysisai:用60人对数千张人脸照片的打分数据训练模型,宣称评分对齐人类共同偏好。
一句话点评|看到「符合人类偏好」的榜先问一句:裁判是谁、有几个人。60人的共识是这60人的共识——这毛病不止这一个模型有,从盲测榜到内容审核榜都一样。
AI写的字自动「去AI味」再粘贴:一场没有终点的猫鼠测评
Show HN 工具 PasteZero:macOS 剪贴板管理器,粘贴前自动清洗文本里的 AI 痕迹(模板句式、破折号腔调),可选粘贴原文或净化版。
一句话点评|写的人想洗掉AI味、检测器想抓AI味,两边能力互相追着涨——所以任何「AI检测准确率」的宣传都请打折看。
在 AI 动手改代码之前,先让它看清这次会「炸」到哪
Show HN 项目 CXGRD:给代码库画「爆炸半径」地图,AI 编程工具写第一行之前,先知道这次改动会波及哪些模块。
一句话点评|和043期介绍的插件安检门一个思路:事前画地图,比事后讲道理靠谱。用AI改老项目的团队值得试。
终端 AI 助手大战又添选手:主打「原生、快、能走 SSH」
Show HN 项目 aty:又一个住在终端里的AI助手,重点是把响应做快、体验做「原生」,支持在 SSH 等交互式会话里直接使用。
一句话点评|同类工具爆发期,普通人选型记两条:兼不兼容自己常用的 shell,会话内容会不会偷偷回传云端。
「全球首个个人机器人」今天开卖,上手内容先替你看了
虎嗅发布启元 T1 机器人上手内容;同系列启元 Q1 今日在2026启元机器人全球产品发布会上公布售价:19999元起,探索版26999元,稚晖君团队打造。
一句话点评|上手内容是宣传片不是评测。个人机器人到底值不值,请追问三件事:续航多久、真能替你干哪件家务、坏了换零件多少钱。
「删除我的数据」按钮是摆设?用户实测谷歌 AI Studio 没真删,报漏洞还被秒封号
一位开发者发文称:在 Google AI Studio 点了删除数据,实际数据仍在后台可查;他按流程向谷歌漏洞赏金计划(VRP)提交报告,60秒内账号被自动封禁。谷歌暂未回应。
一句话点评|延续我们反复讲的「言行要审计」:产品的删除承诺必须有第三方可验证的证据链,用户自测+赏金计划秒封号,等于把审计入口也焊死了。
核显玩家好消息:英特尔第三代酷睿 Ultra 能开微软的 NPU「游戏超分」了
微软9月16日宣布 Auto SR 超分辨率技术向第三代酷睿 Ultra 处理器开放:让核显的GPU跑游戏、NPU专职做画面放大补帧,实测同画质下帧率明显提升。
一句话点评|核显轻薄本的游戏性能评测以后要多一条轴:吃不吃 NPU 分担。同一台机器,开关这项功能差出一档帧数,评测不写清就是耍流氓。
● 路透特稿:「改变AI走向的十天」,GPT-6 Astra 前后的密集窗口期(Reuters)
● 谷歌高管:亚洲 AI 普及速度被低估,两年走完云计算十多年的路(日经亚洲)
● KDE 三十周年,有人顺手提了个 AI 原生桌面方案(The Register)
● Anthropic 双线曝光:Opus 5.2 灰测未完、Fable 5.2 线索又起(新智元)
● 「全球首个个人机器人」启元 Q1 今日开卖,19999 元起(IT之家)
● 开发者长文 Pure Code:AI 把代码写完之后,程序员还剩下什么(HN热帖)
① 盯 Opus 5.2 / Fable 5.2 灰测线索:一旦正式发布,第一时间对照本期 Arena 盲测榜,看头部席位怎么重排
② 沙利文桌面智能体报告细节持续放出:重点核对双榜第一的统计口径——数的是活跃用户还是付费席位
③ Arena 代码 / 视觉榜若刷新快照,回看 Qwen3.8 Max、Kimi K3 这两个小样本名次是否站得住
④ 智元与长隆的具身智能主题乐园 9 月 24 日开园:人形机器人的「实景考核」能交什么成绩单
物界前沿评测
GLOBAL AI REVIEW RADAR
2026.09.20 · 周日
第 053 期 · 预览版
重点更新 3 条 · 双专家点评 | 榜单快报 4 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1研究机构开了一份新账单:AI 的风险正在从屏幕里伸到屏幕外
它能帮你干什么活:让你知道现在判断「这个 AI 靠不靠谱」,考察项多了实打实的一栏。AI 公司 Micro1 在 9 月 18 日发布研究报告,标题直译是「AI 模型现在会在物理世界引入安全风险」。过去我们说 AI 出错,最多是答案不对、链接是编的;现在模型开始驱动浏览器、调用接口、操作设备,出错的代价从「看错一句话」变成「做错一件事」,退款退错对象、订单下错地址、设备指令发错对象,这类事正式进入了 AI 安全研究的科目表。报告全文公开可查,它给的不是一句口号,是把物理世界风险摆到台面上单独评估的起点。
安全领域专家·老周说|方向我认。能力从屏幕里伸到屏幕外,安全评估还只盯着「说错话」就是刻舟求剑。我 8 月 7 日说过「智能体越界不是偶发,是边界不清的结构性问题」,这份报告算研究机构第一次把这句话写成独立课题。但照例泼点冷水:报告出自卖 AI 工程师智能体的公司,「物理风险」的尺子怎么定、案例怎么选,全是自家流程。谁定义风险、风险清单能不能公开复测,比标题吓人程度重要得多。
小编小禾说|这条读着后背发凉,因为我家扫地机、智能插座都是「会动手的 AI」。老规矩不变:能给钱、能改东西、能开关设备的 AI,权限能开多小开多小,重要操作留人工确认那一步。
重点 2有人把「管住 AI 员工」写成三张可执行的表格,开源免费
它能帮你干什么活:如果你已经在让 AI 替你发邮件、改文件、跑流程,这份开源项目给的是一套照着抄就能用的「家规」。开发者在 GitHub 放出三个 AI 智能体治理模式,全部 MIT 协议免费:一张决策表(什么情况 AI 可以自己做主、什么情况必须停下来问人)、一个完整示例(把规则套进真实场景走一遍给你看)、外加一份微软 Agent 365 的落地模板。它治的是大多数团队此刻的真实窘境:AI 已经上岗了,权限清单还写在产品经理的脑子里。把「谁说了算、哪步要人点头」落成白纸黑字、机器能执行的表格,这一步比喊「重视安全」实在。
产品领域专家·阿哲说|我讲过「入口即模型」,这套东西是下一句:智能体时代,「权限即产品」。治理从 PPT 走进决策表,说明企业用户真的开始给 AI 发工牌了;这个品类逻辑一旦立住,「有没有治理模板」会变成选型硬指标。不过三个模式都出自一个人的仓库,没有第三方采用案例,也没做过对抗测试。表格写得再顺,得看它拦不拦得住真越界的模型。先收藏,别直接当自家制度。
小编小禾说|这套表格普通人也用得上:照着问自家用的 AI 工具三个问题。它现在能替我干哪些事?哪几件要我先点头?我能不能一键把权限收回来?答不上来的工具,越顺手越要留神。这题我从 8 月答到今天,总算有人把题目印出来了。
重点 3AI 编程账单第一次有了「流水审计」:它白跑的重试,现在能查出来了
它能帮你干什么活:用 Claude Code、Codex 这类编程智能体的人,多半都被账单咬过,任务看着跑了一晚上,钱烧了,活没干完。Show HN 上的新工具 AgentMeasure 专治这笔糊涂账:它直接读取你机器上已有的 Codex 运行日志和 Claude Code 会话记录,在本地找出「反复失败又反复重试」的环节,像体检报告一样列出哪一步在原地打转,再按你的订阅费折算出一份结算单:这个月 AI 干了多少有效活、多少力气花在重复摔跤上。全程数据不出本机,开源。给 AI 配月租的人,第一次有了「按账验收」的抓手。
编程领域专家·老徐说|我 8 月 22 日说过「AI 产量上去了,验证这关必须跟上」,9 月 10 日又补一句浪费的阅读量也得管。这东西就是这条线上下一步该长的工具:读现成日志、不碰代码,接入成本为零,思路对路。但两个软肋摆在明处:一是解析第三方工具的日志格式,Codex 和 Claude Code 一更新它可能就哑火,维护性存疑;二是「有效工作对重复失败」的判定标准是它自己定的,结算单数字先别当报销依据。Show HN 刚出生一天的样机,先拿自己项目跑一周再说。
小编小禾说|我不写代码,但这思路给所有用 AI 包月的人:打开你的账单看一眼,月费里有多少花在「它没干成事」上?以前只能凭感觉,原来技术上真能查。工具我蹲到有小白版教程再推荐,先教会大家看自家账单这一招。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1综合智力榜:两家并列第一,同分不同价(Artificial Analysis · 实时取数 2026-09-20)
大白话|玩法:出一套 161 个模型同考的综合卷(数学、写作、编程、推理都涵盖),算一个智力指数。今天的新数:Anthropic 和 OpenAI 并列 53 分领跑,但同分不同价,GPT-6 Astra 干同样的活账单明显更薄。开源阵营头名是智谱 GLM-5.3(45 分),Kimi K3 以 44 分紧随,月之暗面、阿里、阶跃星辰都在前十附近。聪明、省钱、开源,目前还是三种不同的冠军。
快报 2文本盲测榜头部:Anthropic 前十占七席(Arena · 快照 2026-09-19,榜单暂未更新)
大白话|玩法:同一个问题让两个 AI 各答一版,真人盲选谁好,选的次数攒成盲测分(类似棋手等级分,越高越强)。这张榜今天没刷新,数据截至 2026-09-19。前十里 Anthropic 占七席;第 1 到第 4 名只差 6 分,约等于分不出高下。第 4 名 Meta 只打了 3,227 场、不到榜一零头,名次先记账。
快报 3编程盲测榜:冠军样本最薄,中国三家挤进前十(Arena · 快照 2026-09-19)
大白话|读法:头名领先第二名 42 分看着悬殊,但它只打了 2,281 场、正负能晃 16 分,是前五里样本最薄的,冠军椅要坐热还得攒场次。真正扎眼的是中国阵营:阿里一家在前十坐了三把椅子(第 4、第 6、第 9),Kimi K3 以 1674 分贴住它们,五分之差约等于打平。编程榜过去是 Anthropic 和 OpenAI 的双人转,今天开始要算四家的账了。
快报 4智能体实干榜六维成绩(Arena · 快照 2026-09-15,取数 2026-09-19)
大白话|这张榜不考聊天,考 AI 替人干活:给真实任务(配环境、修东西、跑命令),从六个维度记分,比如「办成事率」(真把活干完的比例)、「报错自救」(命令跑挂了能不能自己爬起来)、「工具幻觉率」(调用工具时凭空捏造参数/地址的比例,越低越好)。榜首 Anthropic 办成事率 19.8 分听着不高,因为考题是真任务、判得狠。有意思的是全前十工具幻觉率都压在 0.37 上下,唯独第 6 名 Claude Opus 4.8 做到 0.12、几乎不瞎调工具,但名次反而被办成事率拖住。第 8 名 Kimi K3 背后是 10.8 万场对局、全榜最厚的样本,中国选手里唯一挤进这张榜前十的。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
编程智能体谁在真干活?智能体实干榜今天第一次讲清「报错自救」这件事
Arena 智能体榜把「命令跑挂了 AI 能不能自己修复继续干」当成六个记分维度之一:榜首 Claude Fable 5.1 (Max) 自救分 12.6,第 2 名 GPT-6 Astra 只有 7.3,第 7 名 GPT 5.6 Sol 是 4.3。真人用编程智能体的体感差距就在这:一次跑挂没出事,挂三次它三次都不会自己爬起来,任务就烂尾了。数据截至 2026-09-15 快照。
一句话点评|长跑智能体的真实水平不在第一句回答,在翻车后的第二十七分钟。
工具幻觉率最低的不是榜一:Claude Opus 4.8 全十名里几乎不瞎调工具
「工具幻觉」是智能体最阴的毛病:让它查一个接口,它编一个不存在的接口名就调过去,报错还看不出哪步是假的。Arena 智能体榜把这项单独记分,前十里普遍在 0.37 上下,Claude Opus 4.8 (High) 以 0.12 断崖领先,Sonnet 5 是 0.18;但 Opus 4.8 的综合名次只排第 6,被「办成事率」拖了后腿。榜上的另一面是:这项指标的置信区间普遍很窄,说明它比总分稳定,先学会看它不吃亏。数据截至 2026-09-15 快照。
一句话点评|选型口诀更新:总分看它多能干,幻觉率看它编不编,两个一起看才不会被演示视频骗。
看图能力头部打平了:视觉盲测榜前三只差 9 分,第二名是中国模型
认图、读表、看截图这类「给 AI 看图」的考试,Arena 视觉榜第 1 名 Claude Fable 5 是 1310 分,第 2 名阿里 Qwen3.8 Max 1302 分,第 3 名 1301 分,前三名的差距约等于裁判手滑。前十里 Anthropic 占六席、Meta 三席、阿里一席;第 6 名 Meta Muse Spark 1.3 样本才 1,804 场,先记账。对普通用户的翻译:拿 AI 识别照片、读发票、看图表,头部几家今天真的分不出高下,挑便宜的用就行。数据截至 2026-09-19 快照(页面标注最后更新 9 月 13 日)。
一句话点评|「看图」已经卷成白菜价的头部能力,差价不如换成问两句实测。
出字最快榜今天易主:冠军每秒 1,567 个字,比第二名快三倍多
Artificial Analysis 速度榜(实时取数 2026-09-20):Celeris-1 以每秒约 1,567 个字排第一,第二名 Mercury 2 每秒 414.5 个,谷歌 Gemini 2.5 Flash-Lite 每秒 413 个排第三。翻译:让它写一段 500 字的周报,冠军 0.3 秒吐完,亚军要 1.2 秒。但注意,速度冠军的智力分数没进头部梯队,「快到什么程度开始变笨」目前没人给公开对照答案。
一句话点评|急性子有口福了,但先拿抄写归类这类粗活试它,别一上来就派想问题的活。
开源权重榜:智谱 GLM-5.3 守擂,Kimi K3 第二,前三全是中国模型
Artificial Analysis 开源权重阵营(实时取数 2026-09-20):GLM-5.3 (max) 45 分居首,Kimi K3 (max) 44 分第二,GLM-5.3-Flash 42 分第三,阿里的 Qwen3.8 Max 45 分与榜首同分、被归进开源最强之一。这四款都能把权重下载回自己机器上跑,对在意数据不出门的小团队,这份榜单就是选型起点。分数与闭源榜首(53 分)还差 8 分左右,翻译:省心的活开源够用了,最难的那档还没追上。
一句话点评|开源头名和全场头名差 8 分、价格差着量级,这 8 分值不值钱看你干什么活。
编程榜冠军 1800 分只打了 2,281 场:本周五张榜里样本最薄的「第一」
把今天能拿到的五张榜(Arena 文本、编程、视觉、智能体加 AA 智力)放在一起数样本:编程榜头名 GPT-6 Astra (Max) 只有 2,281 场对战、正负 16 分浮动,文本榜第 4 名 Meta 3,227 场、视觉榜第 6 名 Meta 1,804 场,三款「新王」的底座都不到老将们万场级样本的三分之一。反过来读:老牌模型名次含金量还在,新上榜的漂亮名次都先记一笔账,等场次过 5,000 再当真。数据截至 2026-09-19 快照。
一句话点评|榜单新闻里最该看的数字不是名次,是括号里那个对战场次。
Meta 的 Muse Spark 一口气在文本榜坐了五把椅子:1.1 到 1.3 全挤进头部
Arena 文本盲测榜前 11 名里,Meta 的 Muse Spark 系列出现了 1.2 (xHigh)、1.3-max、1.1 三个版本(第 4、第 8、第 11 名),分数 1500 上下挤成一团;编程榜 1.3-max 排第 8,视觉榜 1.3-max 和 1.2 又占第 6、第 9。一家把同一血脉的多个档位同时铺上多张榜,说明押注很重;但除 1.1 外样本普遍偏薄,头部「分不出高下」里有水分。数据截至 2026-09-19 快照。
一句话点评|新系列铺榜是标准动作,哪家先攒够万场样本哪家的名次才算站稳。
Kimi K3 是智能体榜上样本最厚的选手:10.8 万场对局,中国模型独一份
Arena 智能体实干榜前十里,月之暗面 Kimi K3 (Max) 以 108,615 场对局排样本第一,比第二名多近三倍;名次第 8,「办成事率」11.9 分排第五,比它前面的 Anthropic 双旗舰低一档但远高过后面的 OpenAI 机型。「用的人最多」和「干活最成」同时出现在一款中国开源模型身上,是这张榜今天最值得记的事实。数据截至 2026-09-15 快照。
一句话点评|样本厚意味着名次晃得慢,等下周快照再看它挪没挪。
五张榜对一遍账:「聪明、快、省钱、开源」今天由四个不同的模型领跑
今天同期取数的榜单凑齐了:AA 智力榜 Anthropic 与 OpenAI 并列 53 分;AA 速度榜 Celeris-1 每秒约 1,567 字;开源组智谱 GLM-5.3 45 分;Arena 编程榜头名 GPT-6 Astra 1800 分;Arena 智能体榜办成事率冠军 Claude Fable 5.1 (Max) 19.8 分。五个第一没有一个是同一个模型。翻译:今天没有任何一款 AI 在所有维度都赢,「哪个最强」这个问题本身过时了,「哪个最配你这件活」才是能问出答案的问法。智力/速度/开源数据实时于 2026-09-20,Arena 快照截至 2026-09-19。
一句话点评|选型先问活再问榜,是这期五张表叠在一起最直白的教训。
来源:Artificial Analysis + Arena 多榜交叉(数据截至 2026-09-19 / AA 榜实时于 09-20)(2026-09-20)
一家西语系厂商上架「AI 边界防护」服务:宣传零落盘取证,先当广告看
Hacker News 上出现 Unblock AI Shield 的自荐页:主打「无侵入边界加固 + 内存驻留取证」,话术是拒绝天价咨询和纯纸面报告、直接部署自主防护。页面自述为主,没有公开客户案例、没有可验证的防护效果数据,落地页还挂在免费托管域名上。放进来是给读者练手感:AI 安全产品越来越多,见一家先查三样,有没有第三方测试、有没有可下载报告、有没有具名客户。
一句话点评|安全生意自己发广告不构成证据,三样都没有就先按宣传页处理。
● AA 智力榜今日刷新:Claude Fable 5.1 与 GPT-6 Astra 并列 53 分、同分不同价(Artificial Analysis · 2026-09-20 取数)
● 编程榜中国三家进前十:阿里 Qwen3.8 占三席、Kimi K3 贴住第四(Arena · 截至 2026-09-19)
● 视觉榜前三名只差 9 分:Qwen3.8 Max 1302 分居次(Arena · 截至 2026-09-19)
● 智能体实干榜:Kimi K3 10.8 万场样本全榜最厚,Claude Opus 4.8 工具幻觉率 0.12 最低(Arena · 截至 2026-09-15)
● Micro1 报告把「AI 在物理世界出事」立成独立研究科目,全文公开(Micro1 / HN)
● 「管住 AI 员工」的开源决策表上架 GitHub:MIT 协议,三个治理模板(HN)
① 盯 Arena 官方是否真正刷新快照:这次抓取停在 9 月 19 日、页面自报更新更早(9 月 11 至 15 日),重点看编程榜冠军 GPT-6 Astra 的对战场次涨没涨过 5,000 场,样本厚了冠军椅才算坐热
② 盯 Meta Muse Spark 系列的场次积累:三个版本同时铺榜但样本最薄,明天看它涨场次的速度和名次是否还贴着头部
③ 盯 Micro1「物理世界安全风险」报告有没有第三方跟进复测或点名反驳:一家卖智能体的公司自己出的风险清单,扛住同行拆台之前只算提案
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-09-20
数界工坊 · 全球AI评测雷达