物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.07 · 周一

第 040 期

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 8 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1Arena 第36周盲测周榜发布:国产模型扎堆冲进前端开发榜,阿里 Wan 3.0 杀进视频榜前三

它能帮你干什么活:想知道这周写网页、做视频该用哪个模型,看细分榜比看总榜有用。Arena(arena.ai)平台 9 月 7 日发布 2026 年第 36 周(8 月 31 日至 9 月 6 日)AI 大模型盲测排名:头部格局仍以海外模型为主,但一批国产模型在前端开发细分榜扎堆入榜,阿里视频生成模型 Wan 3.0 冲进视频榜前三。总榜决定「谁整体强」,细分榜才回答「我这件具体的活谁干得好」。

产品领域专家·阿哲说|细分榜扎堆入榜比总分榜冒尖更值得记:说明国产模型不是撞对了一道题,而是在同一个工种类目上成建制地能打。9 月 4 日我就记过 Wan 3.0 图生视频盲测第 3、距榜首仅 16 分,这周周榜正式把它钉进前三,低价挤进来的门不会再自己关上。老规矩照旧:新上榜名次会晃,先记账不入成本,等它连稳两周再说换不换。

小编小禾说|037 期我拿自家猫的照片试过图生视频,普通人确实分不清第一和第三名。现在 Wan 3.0 冲进前三还更便宜,那更要蹲它的免费入口了:反正效果我看不出差别,谁免费我用谁,这条选稿标准对普通人永远成立。

来源:IT之家(2026-09-07)

重点 2报馆点名「这段音频是 AI 合成的」,随后自己承认拿不出证据

它能帮你干什么活:下次刷到热门语音,别跟着喊「AI 合成」,先问一句检测报告在哪。9 月 7 日 Hacker News 热榜:《华盛顿邮报》指控知名主播 Piker 的一段音频是 AI 生成,却在文中承认没有证据。8 月 27 日我们报道过同一家报馆的文字检测器实验:读者自己正常写的文字照样被判「有 AI 味」。这一次它从「误判文字」升级成了「指控声音还自认无凭」。

安全领域专家·老周说|028 期我对文字检测器说过,它只能当提示、不能当判决书;换成语音,门槛只会更高:误报率披露、多工具交叉验证、原始录音溯源,一个都不能少。真正要警惕的不是这一次误指控,而是「权威媒体加无证据标签」成为公共定性惯例——那之后任何对你不利的真实语音都可以被说成合成,说谎成本归零。

小编小禾说|028 期我亲手玩过这家报馆的检测器,知道自己正常写也会被标 AI 味。现在它直接在版面上点名别人的声音是假的,又承认没证据。普通人记一条就够:没有检测报告的「AI 合成」指控,一律当猜测看,别转发。

来源:Hacker News / X(2026-09-07)

重点 3独立开发者拿编程智能体「装修」每月游戏之夜:先改老游戏,别从零造新的

它能帮你干什么活:想知道 AI 写代码到底省不省事先看真实用户怎么用。独立开发者 mmazzarolo 的实录:靠编程智能体写掉大部分代码,和认识二十年的朋友把每月游戏之夜改成自改老游戏、自造本地对战小游戏的实验场——一个离谱点子二十分钟就能改成能玩的版本。他同时坦白:打磨成品仍然费血汗,AI 真正压低的是「试一个点子」的成本。

编程领域专家·老徐说|这个样本比厂商 demo 值钱,因为验证的人就是玩家本身。两条可以直接抄:一是改现有代码库而不是从零起项目,边界清楚、输出可验证,考场得是自己认得的;二是 AI 的真实生产力在压缩试错成本,不在替代工程师。024 期我说产量上去了验证这关必须跟上,这篇文章里验证环节就是当场开一局,闭环短到家——普通团队学不了形,学得了这个思路。

小编小禾说|我不动代码也看懂了:以前想玩个冷门玩法只能等大厂出,现在有点子就能先试试。但他原话承认做精致还得下血汗,所以别指望 AI 一夜做出能卖钱的游戏——先做出来给朋友玩,这一步的门槛真的被踩平了。

来源:Hacker News / mmazzarolo.com(2026-09-05)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1Arena 文本盲测 Elo 榜 · 快照 2026-09-07(榜单 9 月 2 日更新)

#模型厂商Elo 分
1Claude Fable 5Anthropic1507
2Claude Opus 4.6 (high)Anthropic1505
3Claude Fable 5.1 (max)Anthropic1504
4Claude Opus 4.7 (high)Anthropic1502
5Muse Spark 1.2 (xHigh)Meta1499

大白话|Elo 就是下棋等级分:同一道题匿名分给两个模型回答,真人投票谁写得好,赢了涨分输了掉分。前五名 Anthropic 一家占了四席,Meta 的 Muse Spark 1.2 排第 5 是唯一的外人。两个细节:第 3 名 Claude Fable 5.1 (max) 只有 2906 场对战、分数波动区间正负 11 分,比老将们的区间宽出一倍,名次还没坐稳;第 2 名 Opus 4.6 (high) 攒了 7.2 万场投票,是头部里底子最实的。

快报 2Arena 编程盲测 Elo 榜 · 快照 2026-09-07(榜单 9 月 5 日更新)

#模型厂商Elo 分
1GPT-6 Astra (max)OpenAI1797
2Claude Fable 5.1 (max)Anthropic1762
3Claude Opus 5 (max)Anthropic1688
4Qwen3.8-Max (0902)阿里巴巴1686
5Kimi K3 (max)月之暗面1674

大白话|真人同题匿名投票比谁代码写得好。9 月 3 日刚发布的 GPT-6 Astra 以 1797 分守住榜首,甩开第二名 35 分——但它只有 1199 场对战样本,不到第三名的九分之一,新王椅子还晃。国产这边值得记:阿里 Qwen3.8-Max 两个版本分列第 4、第 6,月之暗面 Kimi K3 第 5,第 4 到第 6 名被国产连排占住。

快报 3Arena 智能体干活榜 + 视觉理解榜 · 快照 2026-09-07

大白话|智能体榜不考聊天,考「把活办成」:让 AI 真去执行任务,按办成率、工具调用是否瞎编、命令出错后能否自己恢复来打分。前十里 Anthropic 占六席,OpenAI 的 GPT-5.6 Sol 排第 5,国产只有两家进前十——月之暗面 Kimi K3 第 7、腾讯 Hy4 preview 第 10。视觉理解榜(看图答题)8 月 27 日刚更新:Claude Fable 5 以 1313 分居首,阿里 Qwen3.8-Max 1300 分排第 3,离第 2 名只差 1 分。

板块精选 · SELECTED

8 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

换上大模型的新 Siri,编辑用了一个夏天又放回角落:AI 变强了,习惯没变

苹果在 iOS 27 测试版里给 Siri 换上大模型:能索引手机里的短信、照片和日程。Wired 编辑 9 月 6 日发回访文:七月初认定它是「万能工具」,一个月后使用量慢慢回落,还是回去手动刷软件,手机天天打开的仍是另一家聊天应用。分析师意见分裂:有人赌 iPhone 用户信任默认软件,有人测试后反而用得更多。

一句话点评|语音助手的分水岭不在模型多强,在有没有把你绕不开的场景焊死在开口上;工具用不用得起来,由一周后的使用频率说了算,不由发布会说了算。

来源:Wired(2026-09-06)

「模型疲劳」开始流行:厂商发新版本越来越快,用户跟不动了

CNBC 9 月 6 日报道一种行业新情绪:Anthropic 刚更新完 Fable 和 Mythos 系列,Meta、谷歌连着推增强版,OpenAI 又发布了 GPT-6 Astra——实验室发布新版本的节奏越来越密,开发者和普通用户都开始「跟不动」,版本名字记不全、刚学会一个又出新的。

一句话点评|对普通用户这反而是好消息:不用追着版本跑,等新工具攒够第三方评测、名次稳了再换,让他们打去。

来源:CNBC(2026-09-06)

微博 CEO 亲测华为 ADS 5.0:「完全不输特斯拉 FSD V14」

IT之家 9 月 7 日消息,微博 CEO 王高飞发文,以 10 年电动车老用户身份分享周末连开智界 R7 四五次、约 100 公里的体验:上车后摄像头自动调好座椅、方向盘和后视镜是第一个惊喜,辅助驾驶让日常通勤省了不少精力,他评价这套 ADS 5.0「完全不输特斯拉 FSD V14」。

一句话点评|名人亲测和厂商数据一样都是一方面之词:智驾真实水平要看同路况第三方实测对拍,但真人里程反馈值得听,别当下单依据。

来源:IT之家(2026-09-07)

母婴 AI 智能体登上 Nature Medicine:一个模型同时预测孕产和新生儿结局

9 月 7 日 Hacker News 收录的论文:Mother-Child AI agent 把孕期与婴儿结局预测从「一次只盯一个指标」升级为多任务联合预测,现有模型往往依赖昂贵检查或影像,这个智能体试图用更常规的产检数据把多个风险一起算出来。

一句话点评|模型能力发布登上顶刊,说明评测标准在升级——从「分数高」到「真能便宜又准地办成事」;离进诊所还早,先等更多机构复现。

来源:Hacker News / Nature Medicine(2026-09-07)

多个大模型共用一本「特征词典」:给 AI 做横评的人动了新脑筋

arXiv 论文 SharedSAE 登上 9 月 7 日 Hacker News:研究者训练出一本跨语言模型共享的特征词典——不同家的模型可以用同一套可解释特征来「标注」,意味着以后比较两家模型的内部行为,可能不再各说各话。

一句话点评|统一「体检指标表」是评测界的地基级工作,横向比较终于可能有共同语言;还是学术阶段,先等它做成公开工具。

来源:arXiv / Hacker News(2026-09-07)

给 AI 智能体上的「决策治理运行库」公开测试,接口冻结进 v0.70

PV-PP Runtime API 把「AI 下一步该执行哪个动作」的判断独立成一个运行库:496 个回归测试全过才冻结接口,并明确分工——运行库负责选择动作,宿主应用掌握真实世界的最终决定权,选择本身不改世界状态。

一句话点评|「AI 提方案、环境说了算」符合最小权限思路;个人项目公开测试、没有第三方基准,先当方法论看。

来源:Hacker News / PV-PP(2026-09-07)

免注册在线 AI 修图站托管热门模型「Nano Banana 2」:免费等于慢队列加仅限个人

PicEditor 9 月 6 日登上 Show HN:不用注册,上传照片一句话改图或文生图,最高支持 4K 输出;免费用户走普通队列速度较慢,付费才有高优先级队列和商用授权。注意它是第三方托管该模型,不是谷歌官方站点。

一句话点评|免费工具先看授权条款再动手,商用图片尤其要看清楚——这条 8 月 8 日就写过,今天照样成立。

来源:Hacker News / PicEditor(2026-09-06)

AI 视频去物上了「逐帧跟踪」:点一下运动员,后续画面全程抹除

Show HN 项目 Object Remover:在视频里给球员、logo、路人画个框,绿色遮罩逐帧锁定目标,之后模型把它从每一帧里抹掉。移动目标跟踪一直是视频修补里最难的一环,静态擦除早就普及了。

一句话点评|擦移动物体和擦静止物体效果差距大,先拿自己拍的视频对拍,别看演示页就付费。

来源:Hacker News / Object Remover(2026-09-06)

大家都在看 · HOT

●  Arena 第36周盲测周榜发布:国产模型扎堆入榜前端开发细分榜,阿里 Wan 3.0 冲进视频榜前三(IT之家,09-07)

●  Arena 文本盲测 Elo 榜 Claude Fable 5 以 1507 分居首,前五 Anthropic 占四席;第 3 名 Fable 5.1 (max) 仅 2906 场投票、区间正负 11 分还没坐稳(Arena 快照 09-07)

●  GPT-6 Astra 9 月 3 日发布后连守 Arena 编程榜榜首,Elo 1797 领先 35 分,但仅 1199 场对战样本,新王椅子还晃(Arena 快照 09-07)

●  Arena 智能体干活榜前十 Anthropic 占六席,前十里仅有的国产是 Kimi K3(第 7)与腾讯 Hy4 preview(第 10)(快照 09-07)

●  阿里 Qwen3.8-Max 以 1300 分守住 Arena 视觉盲测第 3,距第 2 名仅 1 分(视觉榜 8 月 27 日刷新)

●  微博 CEO 王高飞亲测智界 R7 约 100 公里:「华为 ADS 5.0 完全不输特斯拉 FSD V14」——名人实测,听归听,下单前看第三方对拍(IT之家,09-07)

明日关注 · TOMORROW

①  Arena 编程榜 GPT-6 Astra 样本只有 1199 场,盯它投票攒够后第 1 还坐不坐得住;文本榜第 3 名 Fable 5.1 (max) 波动区间正负 11 分,样本过五千再看是否真进第一梯队

②  第 36 周周榜里扎堆入榜的国产模型(含 Wan 3.0)下周名次是延续还是回落,检验细分榜突破是不是一次性事件

③  GPT-6 Astra 尚未出现在 Artificial Analysis 智能指数上,等它进榜后和 Claude Fable 5.1 (max) 的 66 分正面对一次分差

—— 以下为早上预览版 ——

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.07 · 周一

第 040 期 · 预览版

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 6 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1被寄予厚望的新 Siri,编辑用了一个夏天又放回角落:AI 助手赢不了旧习惯

它能帮你干什么活:苹果在 iOS 27 测试版里把 Siri 换上了大模型 brains:它能索引你手机里的短信、照片和日程,翻出三年前的旧消息一句话搞定,答案质量也明显超过老版本。Wired 编辑 9 月 6 日发来回访:他七月初上手时认定这是「万能工具」,结果一个月后使用量慢慢回落,又回到手动刷 Instagram 和查店的旧习惯,还坦白手机上天天打开的是另一家聊天应用 Claude。分析师意见分裂:有人说 iPhone 用户反正信任苹果的默认软件、隐私换留存够用,也有测试者说自己反而用得更多了。

产品领域专家·阿哲说|「入口即模型」的经典反例:有入口不等于有使用。苹果的底牌是系统级入口免费、本地内容可搜,这些外部聊天应用拿不到。但这位编辑的回落暴露了真正的分水岭:语音助手如果没有把你绕不开的场景焊死在开口上,模型再强也只能当更聪明的搜索栏。8 月 7 日我说过语音助手品类从此和大模型绑定、回不去了,现在补一句:方向回不去,用户回得去。候补名单机制和隐私信任才是苹果真正的产品。

小编小禾说|我看懂了,就是 AI 变强了、人没改习惯。类似功能我在旧手机上试过去搜三年前的短信,它真搜到了,但我用了两次还是回去手动翻。以前 Siri 不聪明所以我不开口,现在聪明了但我想不到要问它。普通人的建议就一条:逼自己连用一周,用不起来不是你的错,是它还没长在你需求的路上。

来源:Wired(2026-09-06)

重点 2报馆点名说「这段音频是 AI 合成的」,然后自己承认没有证据

它能帮你干什么活:9 月 7 日 Hacker News 热榜:《华盛顿邮报》指控知名主播 Piker 的一段音频是 AI 生成,却在文中承认拿不出证据。AI 声音检测的可靠性长期存疑:8 月 27 日我们报道过同一家报馆的文字检测器互动实验,读者自己正常写的文字照样被判「有 AI 味」。这次它从「误判别人」升级成了「指控别人还自认无凭」。对普通人的意义很直接:判断一段音频是不是 AI 合成,需要鉴定级别的证据链,检测工具只能当线索,不能当判决书。

安全领域专家·老周说|「边界不清」这个结构性问题的媒体版:从「检测器认为可能」到「确认是 AI 伪造」中间隔着整条取证链,报馆一步跨过去了。028 期我对文字检测器说过,它只能当提示、不能当判决书,换成语音标准只会更高:误报率披露、多工具交叉验证、原始录音溯源,一个都不能少。真正要警惕的不是这一次误指控,而是「权威媒体加无证据标签」成为公共定性惯例,那之后任何不利的真实语音都可以被说成合成,说谎成本归零。

小编小禾说|028 期我玩过这家报馆的文字检测器,学会「自己正常写也会被标 AI 味」。现在它升级成直接在版面上点名别人的声音是 AI 做的,自己又承认没证据。对普通人的教训:以后刷到热门语音,别跟着喊「AI 合成」,先问一句检测报告在哪。没有报告,就都当猜测看。

来源:Hacker News / X(2026-09-07)

重点 3独立开发者用 AI 把游戏之夜改了个遍:先让智能体改老游戏,别造新的

它能帮你干什么活:9 月 5 日发布、7 日凌晨登上 Hacker News 热榜的博主实录:这位开发者靠编程智能体写掉大部分代码,和认识二十年的朋友把每月游戏之夜改成了自改老游戏、自造本地对战小游戏的实验场。十年前的选择是别人做好什么你玩什么,现在一个离谱点子二十分钟就能改成能玩的版本,他说打磨成品仍然费血汗,AI 真正压低的是「试一个点子」的成本。

编程领域专家·老徐说|这个样本比厂商 demo 值钱:真实用户用编程智能体干的是自己判断得了对错的小活。两个工程细节值得抄作业:一是改现有游戏而不是从零起项目,代码边界清楚、输出可验证,正合我 028 期说的那条,考试环境再小也得是自己认得的考场;二是二十分钟验证一个点子,AI 的真实生产力在压缩试错成本,不在替代工程师。024 期我说产量上去了验证这关必须跟上,这篇文章里验证环节就是游戏之夜当场开一局,闭环短到家,普通团队学不了形、学得了这个思路。

小编小禾说|看完有点想组局。我不写代码,但听懂了一个逻辑:以前想玩个什么冷门玩法得等大厂出,现在有点子就能先试试。不过他原话也承认,把东西做精致还是得下血汗,AI 只是把「试一试」的门槛踩平了。所以别指望一夜做出能卖钱的游戏,先做出来给朋友玩。

来源:Hacker News / mmazzarolo.com(2026-09-06)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1Artificial Analysis 智能指数 · 实时抓取(数据截至 2026-09-07,本期替代 Arena 旧快照的主榜)

#模型厂商智能指数
1Claude Fable 5.1 (max)Anthropic66
2Claude Opus 5 (max)Anthropic63
3Muse Spark 1.3 (max)Meta62
4GPT-5.6 Sol (max)OpenAI61
5Grok 4.6 (high)xAI61
6Kimi K3 (max)月之暗面60
7GLM-5.3 (max)智谱60

大白话|这个指数像 AI 的高考总分,考数学、编程、阅读理解一揽子综合题,60 分以上已经是第一梯队。头部十三席全是 100 万 tokens 上下文(一次能塞进一整本书还多)。今天 Arena 人类盲测榜快照和上期相同没更新,本期主榜换成这张 9 月 7 日实时抓的。注意两件事:Anthropic 一家占了前八里五席;9 月 3 日刚发布的 GPT-6 Astra 还没进这张榜,成绩单得再等几天。

快报 2Arena 编程盲测 Elo 榜 · 快照 09-06(09-05 刷新,本期首次入刊)

#模型厂商Elo 分
1GPT-6 Astra (max)OpenAI1797
2Claude Fable 5.1 (max)Anthropic1762
3Claude Opus 5 (max)Anthropic1688
4Qwen3.8-Max (0902)阿里巴巴1686
5Kimi K3 (max)月之暗面1674

大白话|Elo 就是下棋等级分:真人同一道题匿名分给两个模型写代码,投票谁写得好,赢了涨分输了掉分。9 月 3 日才发布的 GPT-6 Astra 四天空降榜首,甩开第二名 35 分,头名优势明显。老规矩:刚上榜的新名次样本还薄,先看它稳不稳得住,别急着为这一个分换掉手里的工具。阿里 Qwen3.8-Max 和 Kimi K3 守住第 4、5,国产模型在编程榜上仍是第二梯队排头。

快报 3同一梯队,差价 5 倍:AA 榜单里的钱包与速度(2026-09-07)

#模型厂商价格
1GLM-5.3 (max)智谱$0.68/任务
2Kimi K3 (max)月之暗面$0.84/任务
3Grok 4.6 (high)xAI$0.94/任务
4GPT-5.6 Sol (max)OpenAI$0.95/任务
5Claude Fable 5.1 (max)Anthropic$3.69/任务

大白话|「价格」是完成一道标准任务的平均花费。同样 60 到 66 分的头部梯队,最便宜和最贵差 5 倍还多:GLM-5.3 每任务 $0.68,Fable 5.1 要 $3.69,而后者输出还只有 66 tok/s(每秒吐出的字数级单位,越高回话越快)。速度这边,Muse Spark 1.3 (xhigh) 跑到 182 tok/s 是主流模型最快,全场最快被 Celeris-1、Mercury 2 这类专用加速模型拿走。结论很朴素:不追求最后 5 分智力时,中档价位的活干得一样多。

板块精选 · SELECTED

6 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

免注册在线 AI 修图站上线,托管热门模型「Nano Banana 2」

9 月 6 日登上 Show HN 的 PicEditor:不用注册,上传照片用一句话改图或文生图,最高支持 4K 输出。免费用户走普通队列速度较慢,付费才有高优先级队列和商用授权。注意它是第三方托管该模型,不是谷歌官方站点。

一句话点评|免费等于慢队列加仅限个人使用,商用图片先把授权条款看清楚再用。

来源:Hacker News / PicEditor(2026-09-06)

AI 视频去除物体上了「逐帧跟踪」:点一下运动员,后续画面全程抹除

Show HN 项目 Object Remover:在视频里给球员、logo、路人画个框,绿色遮罩逐帧锁定目标,之后模型把它从每一帧里抹掉。移动目标跟踪是视频修补里最难的一环,静态擦除早已普及。

一句话点评|擦移动物体和擦静止物体的效果差距大,先拿自己拍的视频对拍,别看演示页就付费。

来源:Hacker News / Object Remover(2026-09-06)

给 AI 智能体上的「决策治理运行库」公开测试,接口冻结进 v0.70

PV-PP Runtime API 把「AI 下一步该执行哪个动作」的判断独立成一个运行库:496 个回归测试全过才冻结接口,并明确「运行库负责选择动作、宿主应用掌握真实世界的最终决定权」,选择本身不改世界状态。

一句话点评|「AI 提方案、环境说了算」符合最小权限思路,但这是个人项目公开测试,没有第三方基准,先当方法论看。

来源:Hacker News / PV-PP(2026-09-07)

资深工程师用六种情绪给 AI 写体检单,文末强调文字全部亲手写

博主 beza1e1 发布《How I feel about AI》,对 AI 逐条列了惊讶、恐惧、厌恶、悲伤、愤怒、开心六种情绪和各自理由,比如惊讶于「没有规划算法却能涌现规划」,愤怒于开放网络被爬虫冲垮。文末自注:每个字都是自己打的,只让 Mistral 做了审校。

一句话点评|AI 参与程度主动公开标注,这种坦诚样本本身就是内容可信度的地基。

来源:Hacker News / beza1e1(2026-09-06)

Springer 新书章:AI 对齐的前提就有问题,因为人类价值观本身在漂移

刚出版的开放获取章节《迈向与生成式 AI 的共生社会》抛出证据:GPT-4 发布后几个月里,它爱用的短语「delve into」全球搜索热度明显上扬,说明生成式 AI 已经在改写人类的语言习惯。作者主张用双向动态适应替代单向 AI 对齐。

一句话点评|拿 Google Trends 数据论证 AI 反塑人类语言,角度新;属于理论研究,还没有落到评测实践。

来源:Hacker News / Springer(2026-09-07)

「高级 AI 建站提示词」售卖页登热榜,页面自封「官方」

MotionSites AI 推销所谓「官方高级」AI 建站提示词包,整页是「解锁你的 AI 设计超能力」式营销话术,页面看不到任何第三方面测数据和开发者信息。

一句话点评|「官方」自称、无实测、无出处,买 AI 工具前先找第三方真实使用记录,没有就当广告。

来源:Hacker News / MotionSites(2026-09-07)

大家都在看 · HOT

●  Claude Fable 5.1 (max) 66 分登顶 Artificial Analysis 智能指数,头部梯队上下文长度清一色 100 万 tokens(Artificial Analysis,09-07 实时)

●  GPT-6 Astra 于 9 月 3 日发布后四天空降 Arena 编程盲测榜首,Elo 1797、领先 35 分(Arena 快照 09-06)

●  头部梯队单任务最便宜的是 GLM-5.3 的 $0.68,Kimi K3 以 $0.84 紧随其后,两家同分不同价(Artificial Analysis)

●  Muse Spark 1.3 (xhigh) 输出速度 182 tok/s,主流模型第一(Artificial Analysis)

●  Arena 智能体干活榜前十 Anthropic 占七席,Kimi K3 是前十里唯一的国产开源模型(快照 09-06)

明日关注 · TOMORROW

①  GPT-6 Astra 还没出现在 Artificial Analysis 智能指数上,等它进榜后和 Claude Fable 5.1 的分差见真章

②  Arena 智能体榜 9 月 5 日刚刷新,盯 Claude Fable 5.1 (Max) 的领先在新增投票后扩大还是收窄

③  iOS 27 正式版进入倒计时,Siri AI 是否按候补名单机制放量,是这轮语音入口之战的关键节点

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-09-07

数界工坊 · 全球AI评测雷达