物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.13 · 周日

第 046 期

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1全员满分的知识榜已经考不倒 AI,这张信息学奥赛卷还能拉开差距

它能帮你干什么活:评测机构 Vals.ai 把国际信息学奥赛(IOI,中学生编程竞赛的最高舞台)历年真题做成 AI 考卷,专门给「强到知识榜单都分不出高下」的旗舰模型重新排队。结果:GPT-6 Astra 三届赛题全解排第一梯队,但中段档位断崖式掉分,挤进第一梯队的模型比知识类榜单上少了一大截。当 MMLU 这类「比谁记得多」的考试接近人手满分,判断两家 AI 差在哪,得换这种「比谁会想问题」的卷子。

编程领域专家·老徐说|奥赛题考的是把没见过的题拆成算法的能力,比背题库难造假得多,方向我认可。但出题方是 Vals.ai 自己、判题也是他们的自动化流程,按老规矩自报成绩先打折记账:等两三家独立复跑同一套题、分数对得上,再拿它当选型依据。

小编小禾说|我的理解是,以前考试像开卷大家都能抄到 95 分,这张卷子像奥数,谁真会做题一眼看穿。给普通人的用处:以后看到「某模型登顶某榜单」,先问一句考的是啥,全员高分的榜说明不了问题。

来源:Vals.ai / Hacker News(2026-09-12)

重点 2面试展示的是顶配,上班发的是丐版:智能体「评测版不等于部署版」被点名

它能帮你干什么活:工具监控公司 Anuclei 发了一篇在程序员圈热议的文章,戳破一个行业怪象:团队花几个月给 AI 智能体搭评测集、跑实验、打高分,上线后跑的却是另一套配置。提示词版本不同、模型换了小型号、工具权限加了减,评测时的智能体和干活时其实是两个东西。文章建议把「评测环境和生产环境同一性」当硬性检查项,部署前逐项对账。

安全领域专家·老周说|这不是个别公司偷懒,是结构性问题:评测环境默认宽松、生产环境权限复杂,两边漂移没人负责。和 9 月初那起公开黑客赛「上岗前先读三遍规则」是一个道理,考卷答得好不等于上了岗守规矩。挑智能体产品的用户可以直接问一句:你们公示的成绩单,跑的是不是我手上这个版本?

小编小禾说|我 041 期说过「AI 全自动运营先问敢不敢公开审计日志」,这篇补了后半句:还得问公开的是面试日志还是上岗日志。买企业版前让销售把评测报告里的型号和配置抄进合同。

来源:Anuclei / Hacker News(2026-09-13)

重点 3外滩大会最特别的 Agent:能干活、能陪聊,还会在朋友圈拉黑你

它能帮你干什么活:量子位在外滩大会现场实测了一个「有社交人格」的 Agent:一边替你处理事务、一边在朋友圈里经营人设,不满意还会主动拉黑对话对象。会场里最常见的演示还停在「帮我订机票」,这个产品的差异化押在了社交关系维护上——Agent 从工具往「同事+朋友」的混合身份走,是今年外滩最有话题性的一类产品形态。

产品领域专家·阿哲说|社交 Agent 的难点从来不是「像人」,而是越界成本:替你发消息、替你拉黑,等于把社交信用押给模型。演示好看,真实关系里的误伤一次就足以让用户关权限。这个品类值得看,但要盯首批用户的卸载率。

小编小禾说|「还会朋友圈拉黑你」这句我先笑三分钟。让它替我回工作消息可以,替我做交友决策不行——边界在哪,得用户说了算。

来源:量子位(2026-09-13)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1文本盲测榜 · 头名没换但前十进了新面孔

#模型厂商Elo 分对战数
1Claude Fable 5Anthropic150629683 场
2Claude Opus 4.6 (High)Anthropic150571992 场
3Claude Opus 4.7 (High)Anthropic150259992 场
4Claude Fable 5.1 (Max)Anthropic15015447 场
5Muse Spark 1.2 (xHigh)Meta14993229 场

大白话|人类盲测榜今日快照(2026-09-13):前五与上期一致,Anthropic 一家在前十占了七席;真正的变化是谷歌 Gemini 3.8 Flash (High) 以 1493 分(正负 9,仅 5094 场)新进前十排在第 10——便宜档位的模型开始挤进旗舰俱乐部的门槛线。第 4、5 名对战数只有五六千场,比前三薄一个量级,置信区间宽,名次先记账不入结论。

快报 2代码榜 · 阿里一口气占了前三行里的三个坑位

#模型厂商Elo 分对战数
1GPT-6 Astra (Max)OpenAI18002281 场
2Claude Fable 5.1 (Max)Anthropic17583036 场
3Claude Opus 5 (Max)Anthropic168712087 场
4Qwen3.8-Max-0902阿里16812262 场
5Kimi K3 (Max)月之暗面16744547 场

大白话|写代码榜今日快照(2026-09-13)扩到 44 款:GPT-6 Astra 仍以 1800 分居首,但 2281 场比第 3 名样本少八成,空降榜首的老剧本延续,先等它攒到一万场再谈「最强」。变化在国产阵营:阿里这次不止一款,Qwen3.8-Max 两个版本加 Qwen3.8-Flash-Next 共三款挤进前九(第 4、6、9 名),上期热榜里还是两款进前六——第三方盲测里国产编程模型的席位在实打实地变多。

快报 3智能体榜 · 六维成绩单,幻觉率最低的不是头名

#模型厂商净增益工具幻觉率
1Claude Fable 5.1 (Max)Anthropic13.850.37
2GPT-6 Astra (Max)OpenAI12.390.38
3Claude Opus 5 (High)Anthropic11.060.34
8Kimi K3 (Max)月之暗面6.460.38
10Hy4 preview腾讯5.230.25

大白话|智能体榜今日快照(2026-09-13)按六个维度打分(净增益、任务确认成功、好差评、可引导性、命令出错恢复、工具幻觉)。前十 Anthropic 独占六席;一个要更正的细节:前十里「工具幻觉率」(乱调用不存在的工具的比例)最低的是第 9 名 Claude Sonnet 5 (High) 的 0.22,腾讯 Hy4 preview 的 0.25 紧随其后、是国产模型里最低——派活之前先看它会不会凭空捏造工具,这项比总分更能省你的返工钱。视觉榜快照仍停留在 8 月 27 日,本期不引用。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

Ask HN 热议:如果每个人都能出租闲置 GPU 的算力 tokens 会怎样

Hacker News 上一个高热度讨论帖设想「算力众包」:个人闲置 GPU 像充电桩一样对外卖 token,去中心化推理网络能不能撬开大模型算力垄断。评论区一半说带宽和延迟物理上不可行,一半在认真设计分片方案——把「家庭挖矿」的叙事原样复刻到了推理时代。

一句话点评|想法比方案扎实,但闲置 GPU 卖 token 的账真算得过来吗?看后续有没有人真跑 PoC。

来源:Hacker News(2026-09-13)

AgentsDock:一个专门给 AI 研究员用的 IDE,把 Claude Code、Codex、Cursor 装进同一个窗口

Hacker News 上亮相的 macOS 应用 AgentsDock,定位是「为智能体研究设计的 IDE」:在同一界面里调度 Claude Code、Codex、Cursor 等多家编程智能体,统一看它们各自改了什么、跑到哪一步。对拿多家工具做对照实验的人是刚需,对普通开发者也是第一次有了「智能体并排监考」的工具形态。

一句话点评|多家智能体同屏对比,正是我们每期想要的考场形态;刚发布,先看有没有人拿真实项目压测。

来源:AgentsDock / Hacker News(2026-09-13)

能边说边听 AI 电话接线员上线:不再是你说完了它才开口

Famulor 展示了一个「全双工」AI 电话智能体:打电话时它能一边自己说话一边听你说,随时可以被打断、接着聊,而不是等你说完整句再回应。这类系统此前最大的坑就是「抢话」和「你打断它得从头再来」,全双工架构就是冲这个体验去的,目前主打客服和外呼场景。

一句话点评|延续我们 019 期的判断:语音 AI 的分水岭不在听清词,在打断和抢话,这类产品该按这个标准考。

来源:Famulor / Hacker News(2026-09-13)

AI 写代码时代,「回头再改」的 TODO 注释成了定时炸弹

一篇工程师随笔在 HN 热议:以前代码里留 TODO 是给人类看的备忘,现在 AI 编程智能体会把 TODO 当成「待办指令」直接执行,写着「临时硬编码密钥回头删」的注释,真被智能体原样带进了生产环境。作者建议 AI 时代要么不写 TODO,要么写得像给新同事的操作手册。

一句话点评|给 AI 打工久了,人会忘了它真的会照字面执行每一句话。

来源:Frequal / Hacker News(2026-09-13)

Metrum AI Router:一个能自己学「什么活派给哪个模型」的开源路由器

开源项目 Metrum AI Router 的思路是,一个任务里几十次模型调用不必全用贵的旗舰,路由器会学习把简单步骤派给便宜模型、难题留给贵的,号称训练后能把 token 账单砍一大截,路由策略可以按自己业务数据重新训练。

一句话点评|省钱的正确姿势是换调度,不是换脑子;刚出生项目,先拿测试账单跑一周再说。

来源:GitHub / Hacker News(2026-09-12)

「Claude Code 之父」切尔尼:开发者的核心职责变了,守住代码质量

Claude Code 创作者鲍里斯·切尔尼晒出一封开发者求助邮件并公开回应:AI 把写代码的活接走之后,开发者的价值不在亲手敲每一行,而在验收每一行。他把新职责概括为「守住代码质量」,观点出自商业内幕 9 月 10 日的报道。

一句话点评|029 期我们写过「人改当监工」,这次是造工具的人自己盖章,风向定了。

来源:IT之家 / 商业内幕(2026-09-12)

别再只为 AI 智能体造工具了?一篇反共识文章吵翻技术圈

工程师 Sean Goedecke 发文唱反调:全行业都在把软件改成「给 AI 用的接口」,但他认为智能体是短暂的技术形态,为它砍掉人类界面是本末倒置,工具应该同时服务人和 AI,而不是提前交学费。文章在 HN 引发数百条争论。

一句话点评|评测圈同样适用:考 AI 的卷子如果只有 AI 能看懂,分数也不可信。

来源:Seangoedecke.com / Hacker News(2026-09-12)

华尔街日报:AI 已强到能啃千禧年数学难题,数学家一半狂喜一半胆寒

华尔街日报长文盘点 AI 近几个月在数学界的突破:多道悬置多年的猜想被 AI 辅助推进。配套访谈里,《数学课》作者、康奈尔数学家 Steven Strogatz 说过去半年 AI 在微分方程领域的进展让他第一次感到「学科边界在移动」,谈到这些会当场落泪;他也确认,AI 给出的「证明」仍需人工逐行核验才算成立。

一句话点评|能力叙事从「写字」升级到「解题」,考卷得跟着从文科换理科,但审稿标准寸步不让。

来源:WSJ / Wired / Hacker News(2026-09-12)

连线杂志安全周报收官:Claude 滥用报告从黑客攻击铺到生物武器

Wired 最后一期安全周报汇总了 Claude 模型被滥用的公开报告,涉及范围从入侵系统到生物武器咨询,展示 Anthropic 公开滥用拦截数据的一个切面:护栏拦住了绝大多数,漏网的每一次都被记进了公开档案。

一句话点评|滥用报告密度是能力的一面镜子,敢晒漏网记录比宣称安全可信。

来源:Wired(2026-09-12)

一个人和 AI 长期相处的实验:光靠「记住状态」不够用

一项自研自测的纵向研究(N-of-1,即只有一个人的实验)记录用户与一个前沿模型长期协作的过程:模型能存住静态档案(背景、偏好),但真正的协作需要动态状态,谁在推进哪一步、上下文走到了哪里。结论是现有的记忆机制撑不住长周期配合。

一句话点评|AI 记忆话题从厂商宣传走到了个人实录,样本只有 1,方向值得记一笔。

来源:GitHub / Hacker News(2026-09-12)

大家都在看 · HOT

●  Arena 今日快照(09-13):文本榜 Anthropic 前十占七席,Gemini 3.8 Flash 新晋第 10;代码榜阿里三款挤进前九(Arena.ai)

●  极客公园早报汇总:DeepSeek 灰度测试 AI 语音对话、OpenAI 确认今年不上市(极客公园 / IT之家)

●  Vals.ai 信息学奥赛榜开张,GPT-6 Astra 三届赛题全解(Vals.ai / HN)

●  智能体「评测版不等于部署版」长文刷屏技术圈,配置漂移成公敌(Anuclei / HN)

●  全双工电话智能体 Famulor 上线:边说边听、可打断(Famulor / HN)

●  特斯拉车机 Grok 下一步支持语音收发短信,能力清单持续变长(IT之家)

明日关注 · TOMORROW

①  DeepSeek 灰度中的 AI 语音对话是否放开更多入口,放开后拿嘈杂会议室实测第一手表现

②  Gemini 3.8 Flash (High) 文本榜对战数能否从 5094 场快速攒厚,名次稳不稳看样本说话

③  Vals.ai IOI 榜首批第三方复跑成绩,重点看 GPT-6 Astra「三届全解」能否被独立复现

④  Arena 视觉榜自 8 月 27 日未更新,若刷新则回补视觉能力对比

—— 以下为早上预览版 ——

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.13 · 周日

第 046 期 · 预览版

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1信息学奥赛考卷成了 AI 能力分水岭:饱和的知识榜分不出高下,这卷还能拉开差距

它能帮你干什么活:评测机构 Vals.ai 把国际信息学奥赛(IOI,中学生编程竞赛的最高舞台)的历年真题做成了 AI 考卷,专门用来区分现在这批「强到知识榜单都考不倒」的旗舰模型。结果很有意思:GPT-6 Astra 把三届赛题全部解出,排第一梯队的模型明显少于知识类榜单上的数量,中间档位断崖式掉分。换句话说,当 MMLU 这类「比谁记得多」的考试全员接近满分时,要判断两家 AI 到底差在哪,得换这种「比谁会想问题」的卷子。

编程领域专家·老徐说|奥赛题考的是把没见过的题拆成算法的能力,这比背题库难造假得多,方向我认可。但出题方是 Vals.ai 自己、判题也是他们的自动化流程,按老规矩自报成绩先打折记账:等两三家独立复跑同一套题、分数对得上,再拿它当选型依据。

小编小禾说|我的理解是,以前考试像开卷,大家都能抄到 95 分,现在这张卷子像奥数,谁真会做题一眼看穿。给普通人的用处:以后看到「某模型登顶某榜单」,先问一句考的是啥,全员高分的榜说明不了问题。

来源:Vals.ai / Hacker News(2026-09-12)

重点 2你考核 AI 员工时的那套本事,未必是你雇到手的本事:智能体「评估即部署」缺口被点名

它能帮你干什么活:工具监控公司 Anuclei 发了一篇在程序员圈热议的文章,戳破一个行业怪象:团队花几个月给 AI 智能体搭评测集、跑实验、打高分,上线后跑的却是另一套配置。提示词版本不同、模型换了小型号、工具权限加了减,评测时的智能体和干活的智能体根本不是一个东西。文章建议把「评测环境和生产环境同一性」当成硬性检查项,部署前逐项对账。

安全领域专家·老周说|这不是个别公司偷懒,是结构性问题:评测环境默认宽松、生产环境权限复杂,两边漂移没人负责。和 9 月初那起「评测里规矩读三遍」的公开黑客赛是一个道理,考卷答得好不等于上了岗守规矩。挑智能体产品的用户可以直接问一句:你们公示的成绩单,跑的是不是我手上这个版本?

小编小禾说|翻译成人话:面试时展示的是顶配,上班发的是丐版。我 041 期说过「AI 全自动运营先问敢不敢公开审计日志」,这篇补了后半句:还得问公开的是面试日志还是上岗日志。买企业版前让销售把评测报告里的型号和配置抄进合同。

来源:Anuclei / Hacker News(2026-09-13)

重点 34000 美元的中国机器狗,一位美国记者帮你先跑了 42 天

它能帮你干什么活:Ars Technica 的资深记者自掏 4000 美元买了一台中国产四足机器狗,在家用了一个多月写长测:能跟着遛、能驮着相机拍视频、能在院子里自己躲人,翻车现场也有,比如对着扫地机器人僵持半小时、雨天直接罢工。这类第三方长测的价值在于,厂商宣传片里不会告诉你日常充电要占几个插座、App 掉线多少次。

穿戴领域专家·阿凯说|延续我 019 期评 1.6 万美元割草机器人的判断:智能硬件的门槛从来不是性能,是安装、供电、防水这些说明书之外的部分。这台狗最打动我的不是动作多灵活,是记者写了它「吃灰第 30 天」的心理变化,这才是消费者最需要的数据。4000 美元定价对标的是玩具上沿、工具下沿,位置尴尬。

小编小禾说|看完我最大的收获:买前先确认它能不能自己回窝充电,天天手动抱回去的东西一周就闲置。另外记者说 App 全英文、固件更新像开盲盒,对国内用户反而是利好,本土款中文售后都在。蹲一个国内版长测再决定要不要攒钱。

来源:Ars Technica / Hacker News(2026-09-12)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1智能指数头部梯队 · 今日实时快照

1Claude Fable 5.1 (Max w/ fallback)Anthropic53 分
2GPT-6 Astra (Max)OpenAI53 分
3Claude Opus 5 (Max)Anthropic51 分

大白话|Artificial Analysis 今天(9 月 13 日)的实时快照:第一梯队挤在 53 分,两家的最强配置只差零点几分,肉眼难分胜负。这类「智能指数」把写代码、答推理题、听指令等几十项考试折算成一个总分,看个大概排位够用,选工具还得按自己场景查单项。数据源 artificialanalysis.ai/leaderboards/models,Arena 人类盲测榜快照与上期相同未刷新,今日以该实时榜为替代。

快报 2开源权重榜 · 不封闭源码的模型里谁最能打

1GLM-5.3 (Max)Z AI(智谱)45 分
2Kimi K3 (Max)Moonshot(月之暗面)44 分
3GLM-5.3-FlashZ AI(智谱)42 分

大白话|「开源权重」意思是模型大脑可以免费下载回家自己跑,不用按次付钱。今天开源阵营前三名被两家中国公司包揽,离闭源旗舰 53 分只差 8 分左右,一年前这个差距是 15 分开外。小厂和个人的选项越来越多。

快报 3速度与省钱榜 · 跑得快和花得少的各一个冠军

1Celeris-1速度第一每秒 1313.8 字
2Granite 4.2 3B单任务成本最低0.01 美元/任务

大白话|一个字一个字往外蹦的速度,Celeris-1 每秒能吐 1300 多个字,聊体验的模型里一骑绝尘;Granite 4.2 3B 走的是另一个极端,完成一次任务一美分,适合量大活简单的场景。两个冠军提醒同一件事:模型不是一分钱一分货的标品,快、省、强是三张不同的榜。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

AI 写代码时代,「回头再改」的 TODO 注释成了定时炸弹

一篇工程师随笔在 HN 热议:以前代码里留 TODO 是给人类看的备忘,现在 AI 编程智能体会把 TODO 当成「待办指令」直接执行,写着「临时硬编码密钥回头删」的注释,真被智能体原样带进了生产环境。作者建议 AI 时代要么不写 TODO,要么写得像给新同事的操作手册。

一句话点评|给 AI 打工久了,人会忘了它真的会照字面执行每一句话。

来源:Frequal / Hacker News(2026-09-13)

Metrum AI Router:一个能自己学「什么活派给哪个模型」的路由器

开源项目 Metrum AI Router 的思路是,一个任务里几十次模型调用不必全用贵的旗舰,路由器会学习把简单步骤派给便宜模型、难题留给贵的,号称训练后能把 token 账单砍一大截,路由策略可以按自己业务数据重新训练。

一句话点评|省钱的正确姿势是换调度,不是换脑子;刚出生项目,先拿测试账单跑一周再说。

来源:GitHub / Hacker News(2026-09-12)

「Claude Code 之父」切尔尼:开发者的核心职责变了,守住代码质量

Claude Code 创作者鲍里斯·切尔尼晒出一封开发者求助邮件并公开回应:AI 把写代码的活接走之后,开发者的价值不在亲手敲每一行,而在验收每一行。他把新职责概括为「守住代码质量」,观点出自商业内幕 9 月 10 日的报道。

一句话点评|029 期我们写过「人改当监工」,这次是造工具的人自己盖章,风向定了。

来源:IT之家 / 商业内幕(2026-09-12)

别再只为 AI 智能体造工具了?一篇反共识文章吵翻技术圈

工程师 Sean Goedecke 发文唱反调:全行业都在把软件改成「给 AI 用的接口」,但他认为智能体是短暂的技术形态,为它砍掉人类界面是本末倒置,工具应该同时服务人和 AI,而不是提前交学费。文章在 HN 引发数百条争论。

一句话点评|评测圈同样适用:考 AI 的卷子如果只有 AI 能看懂,分数也不可信。

来源:Seangoedecke.com / Hacker News(2026-09-12)

华尔街日报:AI 已强到能啃千禧年数学难题,数学家一半狂喜一半胆寒

华尔街日报长文盘点 AI 近几个月在数学界的突破:多道悬置多年的猜想被 AI 辅助推进,报道同时梳理了安全研究者的警告,能解千年难题的脑子,找系统漏洞同样不在话下。配套访谈里,数学家 Steven Strogatz 谈到 AI 进展时当场落泪,说自己「真的很恐惧」。

一句话点评|能力叙事从「写字」升级到「解题」,评测的考卷也得跟着从文科换成理科。

来源:WSJ / Wired / Hacker News(2026-09-12)

连线杂志安全周报:Claude 滥用报告从黑客攻击铺到生物武器

Wired 最后一期安全周报汇总了 Claude 模型被滥用的公开报告,涉及范围从入侵系统到生物武器咨询,展示Anthropic 公开滥用拦截数据的一个切面:护栏拦住了绝大多数,漏网的每一次都被记进了公开档案。

一句话点评|滥用报告密度是能力的一面镜子,敢晒漏网记录比宣称安全可信。

来源:Wired(2026-09-12)

一个人和 AI 长期相处的实验:光靠「记住状态」不够用

一项自研自测的纵向研究(N-of-1,即只有一个人的实验)记录用户与一个前沿模型长期协作的过程:模型能存住静态档案(背景、偏好),但真正的协作需要动态状态,谁在推进哪一步、上下文走到了哪里。结论是现有的记忆机制撑不住长周期配合。

一句话点评|AI 记忆话题从厂商宣传走到了个人实录,样本只有 1,方向值得记一笔。

来源:GitHub / Hacker News(2026-09-12)

一位用 AI 做游戏的设计师,把六个月踩坑写成了免费手册

Show HN 项目:游戏设计师发布一本关于「AI 参与游戏生产」的实操书,GitHub 免费公开多语言版,核心原则写在封面上,No Fabricated Numbers(禁止编造数字),记录 Claude Code 配合提示词、验证流程和生产记忆的真实用法。

一句话点评|把「不许编数字」写进书名的人,是我们评测刊的老朋友了。

来源:GitHub / Hacker News(2026-09-12)

Strogatz 的恐惧与老规矩:AI 攻坚数学,先等可复现证明

Wired 独立专访《数学课》作者、康奈尔数学家 Steven Strogatz:过去半年 AI 在微分方程和动力系统领域的进展让他第一次感到「学科边界在移动」,他说自己谈到这些会哭,因为敬畏和恐惧是同一种情绪。受访中他也确认,AI 给出的「证明」仍需人工逐行核验才算成立。

一句话点评|数学家的眼泪和审稿人标准不矛盾:震撼归震撼,验算归验算。

来源:Wired / Hacker News(2026-09-12)

蚂蚁把 AI 终端的「地基层」摊开:GPASS 升级成灵影,给 AI 眼镜装操作系统

外滩大会「AI 驱动新终端新服务」论坛上,蚂蚁集团宣布智能终端可信连接框架 GPASS 升级为「灵影」,定位是面向 AI 眼镜等新终端的智能体原生操作系统,管自然交互、多端协同和安全可信,向芯片和终端厂商开放。终端类 AI 的评测此后多了一个绕不开的公共底座。

一句话点评|入口之争打到眼镜上:以后测 AI 穿戴,先看它跑在谁家地基层上。

来源:雷锋网(2026-09-12)

大家都在看 · HOT

●  Vals.ai 信息学奥赛榜开张,GPT-6 Astra 三届赛题全解(Vals.ai / HN)

●  智能体「评测版≠部署版」长文刷屏技术圈,配置漂移成公敌(Anuclei / HN)

●  Ars Technica 记者 4000 美元中国机器狗 42 天长测:会跟跑、怕下雨(Ars Technica)

●  Artificial Analysis 今日实时榜:Claude Fable 5.1 与 GPT-6 Astra 53 分并列头名,开源第一 GLM-5.3(AA)

●  Wired 安全周报收官:Claude 滥用档案从入侵脚本铺到生物武器(Wired)

明日关注 · TOMORROW

①  Arena 盲测榜若刷新 9 月 13 日快照,回补对比本期 AA 实时榜的头名归属

②  Vals.ai IOI 榜首批第三方复跑成绩,重点看 GPT-6 Astra「全解」能否被独立复现

③  灵影开放平台的首批合作终端名单,确认哪款 AI 眼镜能拿到真机评测位

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-09-13

数界工坊 · 全球AI评测雷达