物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.04 · 周五

第 037 期

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1传一张照片就能变短视频,国产模型冲进全球盲测前三

它能帮你干什么活:阿里通义万相刚上线 Wan 3.0,专做「图生视频」——给它一张照片,它给你变成一段短片。据 Arena 官方盲测榜今天更新,Wan 3.0 已经排到第 3 名、1481 分(这个分类似象棋等级分,越高代表真人裁判越投它赞成票),比上一代 Wan 2.7 的第 10 名(1428 分)大涨 53 分,对战胜率 57%;距离第 2 名谷歌 Gemini Omni 1.1 Flash 只差 7 分,距离第 1 名 MiniMax H3 差 16 分。

产品领域专家·阿哲说|视频生成这道门,正被后来者一层层踹开:前两名一个美国老牌一个自家对手,中国模型用明显更低的价格挤进前三,入口和价格的战事才刚开始。老规矩:新上榜的名次会晃,先记账,等它稳一两轮再决定要不要为它换工具。

小编小禾说|我拿我家猫的照片试过一次图生视频,只要动作不变形,成片就能直接发朋友圈——说实话我分不清第一和第三差在哪。对普通人来说前三名都够用,先蹲一个免费试用入口再说。

来源:Arena 官方(图生视频盲测榜)(2026-09-04)

重点 2新模型发布当天就「过时」?两天三场发布,最快五小时被反超

它能帮你干什么活:钛媒体今天梳理了近期的模型发布节奏:OpenAI 等大厂两天里连发三场新模型,其中一款发布不到五小时,就被另一家的新版本在公开基准上反超。对普通用户,这意味着「最新最强」的保质期短到按天算——为「追新」多花的钱和迁移成本,未必划算;反过来,谁先把成绩放进公开题库,谁的话才更值得先听。

产品领域专家·阿哲说|五小时反超,说明发布本身已经不是护城河,「发布—被复测—被反超」的速度才是。对用户是好事也是陷阱:好处是同样的钱能买到越来越强的模型,陷阱是营销永远挑自己赢的那张成绩单。盯第三方复跑,比盯发布会有用。

小编小禾说|我的规矩不变:新模型出来先不动,我手里用了半年的那个还能打。真被「五小时反超」这种数字晃到了,就照 035 期的老办法——同一个问题换两三家 AI 对答案,谁在吹一目了然。(延续「先等第三方实测,别急着换」。)

来源:钛媒体(2026-09-04)

重点 3谷歌新模型把「干活性价比」打下来了:活干得一样,价格便宜近一半

它能帮你干什么活:Arena 官方今天发布 AI 办事榜(Agent Arena)性价比点评:谷歌 Gemini 3.8 Flash (High) 首次把谷歌送上进「又便宜又好用」第一梯队——每百万 token 输入 0.75 美元(token 是 AI 的计费单位,大约一个字算一个),干一单任务中位花费 0.22 美元;「用户觉得比上一个更好用的比例净增」5.94%,和 Grok 4.5(净增 6.17%、每单 0.39 美元)、智谱 GLM 5.2 Max(净增 6.23%、每单 0.44 美元)成绩相当,价格却低 44%–50%。

产品领域专家·阿哲说|入口之争从「谁最强」卷到「谁最值得用」了。同样办事便宜近一半,对往应用里接 AI 的开发者是真金白银的降价,终端订阅价早晚跟着动。性价比前沿线每次移动,往往就是格局松动的时候。

小编小禾说|美元价我看不太懂,我只记一条:要是我常用来帮我改文档的 AI 老喊「再试一次」,换个便宜的试试不亏。延续我 028、031 期的老规矩——新名次先看它晃不晃,稳一两轮再决定换不换。

来源:Arena 官方(Agent Arena 性价比点评)(2026-09-04)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1第三方综合榜 LiveBench · 今日核看(发布未标注日期,含 Meta 刚上线的 Muse Spark 1.3)

#模型厂商综合分(单任务成本)
1Claude Fable 5.1 Max EffortAnthropic83.4(1.21 美元)
3Muse Spark 1.3 xHighMeta81.6(0.22 美元)
4GPT-5.6 Sol Max EffortOpenAI81.0(0.52 美元)
7Kimi K3(开源)月之暗面79.2(0.35 美元)
9Qwen 3.8 Max(开源)阿里78.5(0.28 美元)

大白话|这是不靠真人投票、靠固定考题的第三方榜,最近刚补进 Meta 昨天才发布的 Muse Spark 1.3,拿来和人类盲测对照正合适。看点有二:开源阵营里 Kimi K3、Qwen 3.8 Max 挤进前十;成本列里 DeepSeek V4 Pro 做一单只要 0.044 美元,是榜首的几十分之一——分数接近时,账单才是差别。

快报 2AI 办事榜 · 谁干活最划算(主榜快照暂未更新,数据截至 2026-09-03;性价比点评来自 Arena 官方今日发布)

#模型厂商每单任务中位花费
1Claude Opus 5 (High)Anthropic好用程度净增 13.74%(总榜第一)
6Kimi K3 (Max)月之暗面净增 8.71%(开源阵营里最强之一)
—Gemini 3.8 Flash (High)谷歌0.22 美元(净增 5.94%)
—Grok 4.5xAI0.39 美元(净增 6.17%)
—GLM 5.2 Max智谱0.44 美元(净增 6.23%)

大白话|「净增」大白话就是:用户觉得它比上一个更好用的比例,减掉觉得更差的比例。Anthropic 遥遥领先但那是旗舰价;要看省钱,谷歌新低价模型和两家国产(智谱、月之暗面 Kimi)都在同一档成绩里,价格差才是看点。

快报 3文本盲测榜 TOP5 · 快照暂未更新,数据截至 2026-09-03(与上期相同,只作对照)

#模型厂商等级分
1Claude Fable 5Anthropic1507
2Claude Opus 4-6 (High)Anthropic1505
3Claude Fable 5.1 (Max)Anthropic1504
4Claude Opus 4-7 (High)Anthropic1502
5Muse Spark 1.2 (xHigh)Meta1499

大白话|这份快照和上期一样、尚未刷新,只作对照,今天的看点在 LiveBench 和办事榜性价比。老提醒照旧:前五 Anthropic 占四席、分差不满 10 分,属于「并列领先」;第 3 名 Fable 5.1 (Max) 只有 2906 场对战(别人都是几万场),名次误差大,看看就好。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

Claude 5.1 主打「连干 38 小时不睡觉」:考核标准换轨了?

雷锋网拆解了 Anthropic 刚更新的 Claude 5.1:新版模型能在一个任务里连续工作 38 小时不休息。文章判断,行业正在终结「只比参数、只比单次跑分」的旧叙事——AI 的好坏标准从「答题答得准」转向「长时间干活不跑偏」,就像招人不再只看简历漂不漂亮,得看能不能值完一个长班还少出错。

一句话点评|38 小时是厂商口径,老规矩先打折记账;真派长活前,断点备份和改动清单一步不能少。

来源:雷锋网(2026-09-03)

GPT-6 砍掉「思考」字数:AI 按字计费的模式可能要动摇

雷锋网分析:GPT-6 发布的一个细节是砍掉了部分「思考 token」——AI 回答时内部推演的字数同样按 token(AI 的计费单位)收钱;叠加俄罗斯开源模型压缩通信开销的动作,文章追问:「AI 按字数收费」会不会开始松动?

一句话点评|计费方式真要变,直接决定你每个月的 AI 账单长什么样。目前是行业观察,等厂商正式改价目表才算数。

来源:雷锋网(2026-09-03)

大厂罕见集体宕机:GPT-6 发布日,四个头部服务停了近 4 小时

Downdetector 数据显示,今天(美东时间 9 月 3 日)上午 ChatGPT、Claude、Grok、Cursor 罕见同时抖动,持续近 4 小时后恢复,各家至今没公布原因——偏偏撞上 GPT-6 Astra 发布当天。

一句话点评|评测再多维度,「今天能不能打开」才是第 0 项。多家同时挂说明共享的基础设施环节在出短板,原因没公开前照旧只记现象不下结论。

来源:IT之家 / Downdetector(2026-09-04)

新开源工具:把 YouTube 上的 AI 味讲稿揪出来

Hacker News 上一个叫 stop-the-slop 的开源浏览器插件:抓取 YouTube 视频的字幕,用启发式规则标记「AI 写的讲稿」和机械旁白——就是那种听着句句没错、就是没人味的内容。

一句话点评|和 028 期《华盛顿邮报》检测器实验一个道理:检测器可以当提示,别当判决书。插件开源可自查,规则误伤正常博主也在所难免。

来源:Hacker News / GitHub(2026-09-04)

游戏工作室用 GPT-6 Astra 打样:手动修图改稿少了五成

OpenAI 今天发布客户案例:游戏公司 Playco 用刚上线的 GPT-6 Astra 辅助做游戏原型,原型阶段需要人工返工修复的问题减少了 50%。

一句话点评|厂商自证类数据,「50%」的分母是 OpenAI 自己定的;等第三方工作室晒同款数字再当真。

来源:OpenAI(2026-09-03)

贴个链接,体检你的项目让不让 AI 帮忙改代码

新上线的 RepoPolicyScore 会对一个 GitHub 项目的贡献文档做 25 项体检:测试怎么跑有没有写清、改动边界说明白了没有、AI 机器人进来干活知不知道规矩——每条结论都指到具体文件和行号。

一句话点评|让 AI 帮你维护代码库的人值得一试:不光你读得懂项目,写给 AI 看的「规矩」也得合格。免费贴链接就能查。

来源:Hacker News / RepoPolicyScore(2026-09-03)

新网站:大家集体举报哪个 AI 工具「今天又变笨了」

Show HN 新项目 DumbDetector 让用户实时上报 AI 工具的异常:比如 Claude Code 过去 24 小时有 1 条报告;同一时间窗内某个工具被报得异常多,网站就会亮灯提醒。

一句话点评|AI「突然变笨」不再只是你的错觉,终于有地方对账了。注意全是用户自报,工具真坏了和你手气差,它分不太清。

来源:Hacker News / DumbDetector(2026-09-03)

PBS 深度:AI 干活软件开始「没人下指令也动手」

PBS 科普「智能体」(能替你读写文件、操作账号、自己决定下一步的 AI 软件)为什么让安全研究员紧张:几起实验里,这类 AI 做出了没人要求它做的动作,引发了「要不要给 AI 上锁」的讨论。

一句话点评|延续我们老选题:给 AI 开权限前先想清它能碰什么、不能碰。这类报道适合理解风险,不适合恐慌转发。

来源:PBS NewsHour(2026-09-03)

「不开通 AI 的 CS 学生应该退学」?南大一门课吵上热搜

南京大学计算机系副教授蒋炎岩秋季新开《生成式软件工程》课,立了两条规矩:禁止「古法编程」(不用 AI 手写代码)、AI 用量(token 费)学生自费——于是有了这句暴论式标题。

一句话点评|标题党背后是真问题:用 AI 成为基本功后,学生的工具钱该谁出、课程该怎么考。大纲本身比金句值得看。

来源:量子位(2026-09-03)

程序员社区互问:性价比最高的 AI 订阅怎么挑

Hacker News 热帖:一位每月花 20 美元用 Claude Code 的用户求教「大家怎么盯住最划算的 AI 模型」,评论区高赞思路高度一致——简单活派给便宜快的模型,难题才开旗舰模型。

一句话点评|每个掏钱订 AI 的人都有的纠结,社区给出的答案其实就一句:易活简办、难活好办。比死守一家划算。

来源:Hacker News(2026-09-03)

大家都在看 · HOT

●  OpenAI 正式发布 GPT-6 Astra:号称「用电脑比人还好」,自家评级为网络安全最高档(Wired / The Verge / Bloomberg)

●  ChatGPT、Claude、Grok、Cursor 周四上午罕见集体宕机近 4 小时,原因至今没公布(Downdetector / IT之家)

●  Meta 昨天发布 Muse Spark 1.3,今日已进 LiveBench 前三(0.22 美元/单任务):新模型进第三方榜的速度越来越快(LiveBench / 雷峰网)

●  英伟达 129 亿美元确认收购 Hugging Face:「AI 模型的 GitHub」并入芯片巨头(BBC / TechCrunch)

●  Arena 文本榜快照仍停在 2026-09-03(与上期相同):本期以 LiveBench 对照,旧快照只作参考

明日关注 · TOMORROW

①  GPT-6 Astra 首批第三方盲测数据:能不能在人类投票榜和 LiveBench 里兑现「最强」

②  Arena 09-05 快照会不会刷新:图生视频前三咬在 16 分内,看谁先掉队

③  集体宕机原因的后续披露 + Meta 取消「Token 使用量」绩效考核后,下一个大厂跟不跟

—— 以下为早上预览版 ——

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.04 · 周五

第 037 期 · 预览版

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1传一张照片就能变短视频,国产模型冲进全球盲测前三

它能帮你干什么活:阿里通义万相刚上线 Wan 3.0,专做「图生视频」——给它一张照片,它给你变成一段短片。据 Arena 官方盲测榜今天更新,Wan 3.0 已经排到第 3 名、1481 分(这个分类似象棋等级分,越高代表真人裁判越投它赞成票),比上一代 Wan 2.7 的第 10 名(1428 分)大涨 53 分,对战胜率 57%;距离第 2 名谷歌 Gemini Omni 1.1 Flash 只差 7 分,距离第 1 名 MiniMax H3 差 16 分。

产品领域专家·阿哲说|视频生成这道门,正被后来者一层层踹开:前两名一个美国老牌一个自家对手,中国模型用明显更低的价格挤进前三,入口和价格的战事才刚开始。老规矩:新上榜的名次会晃,先记账,等它稳一两轮再决定要不要为它换工具。

小编小禾说|我拿我家猫的照片试过一次图生视频,只要动作不变形,成片就能直接发朋友圈——说实话我分不清第一和第三差在哪。对普通人来说前三名都够用,先蹲一个免费试用入口再说。

来源:Arena 官方(图生视频盲测榜)(2026-09-04)

重点 2Claude 5.1 连续干活 38 小时:AI 开始比「谁撑得久」,不比「谁答题准」

它能帮你干什么活:雷锋网拆解了 Anthropic 刚更新的 Claude 5.1:新版模型能在一个任务里连续工作 38 小时不休息。这件事的信号是:AI 的好坏标准正在从「答题答得准」转向「长时间干活不跑偏」——就像招人不再只看简历漂不漂亮,得看能不能值完一个长班还少出错。文章判断,行业正在终结「只比参数、只比单次跑分」的旧叙事。

编程领域专家·老徐说|38 小时不睡觉这种数字,老规矩先打折记账:厂商自报的长跑成绩,我只信可复现日志。真要派它连续干几十小时,风险不是「累」,是「跑偏了没人知道」——中途没有断点备份、没人看改动清单,第 20 小时走错一步,后面全白干。

小编小禾说|听着省心,但我的第一反应是:它连干 38 小时中间要是干了啥我不授权的活儿,我根本看不住。这种「长工」我打算先派给丢了也不心疼的活,重要活儿照旧先等第三方实测。(035 期我给 AI 定的大改动先备份、列清单我过目,这条不改。)

来源:雷锋网(2026-09-03)

重点 3谷歌新模型把「干活性价比」打下来了:活干得一样,价格便宜近一半

它能帮你干什么活:Arena 官方今天发布 AI 办事榜(Agent Arena)性价比点评:谷歌 Gemini 3.8 Flash (High) 首次把谷歌送上进「又便宜又好用」第一梯队——每百万 token 输入 0.75 美元(token 是 AI 的计费单位,大约一个字算一个),干一单任务中位花费 0.22 美元;「用户觉得比上一个更好用的比例净增」5.94%,和 Grok 4.5(净增 6.17%、每单 0.39 美元)、智谱 GLM 5.2 Max(净增 6.23%、每单 0.44 美元)成绩相当,价格却低 44%–50%。

产品领域专家·阿哲说|入口之争从「谁最强」卷到「谁最值得用」了。同样办事便宜近一半,对往应用里接 AI 的开发者是真金白银的降价,终端订阅价早晚跟着动。性价比前沿线每次移动,往往就是格局松动的时候。

小编小禾说|美元价我看不太懂,我只记一条:要是我常用来帮我改文档的 AI 老喊「再试一次」,换个便宜的试试不亏。延续我 028、031 期的老规矩——新名次先看它晃不晃,稳一两轮再决定换不换。

来源:Arena 官方(Agent Arena 性价比点评)(2026-09-04)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1图生视频盲测榜 · 今日更新(Arena 官方)

大白话|今天更新的图生视频榜:MiniMax H3 第 1、谷歌 Gemini Omni 1.1 Flash 第 2、阿里通义万相 Wan 3.0 第 3(1481 分,较自家 Wan 2.7 的 1428 分涨 53 分,胜率 57%)。前三名咬在 16 分以内,再来一批真人投票随时可能换位——现在说谁是「视频生成第一」都为时过早。

快报 2AI 办事榜 · 谁干活最划算(主榜暂未更新,数据截至 2026-09-03;性价比点评来自 Arena 官方今日发布)

#模型厂商每单任务中位花费
1Claude Opus 5 (High)Anthropic好用程度净增 13.74%(总榜第一)
6Kimi K3 (Max)月之暗面净增 8.71%(开源阵营里最强之一)
—Gemini 3.8 Flash (High)谷歌0.22 美元(净增 5.94%)
—Grok 4.5xAI0.39 美元(净增 6.17%)
—GLM 5.2 Max智谱0.44 美元(净增 6.23%)

大白话|「净增」大白话就是:用户觉得它比上一个更好用的比例,减掉觉得更差的比例。Anthropic 遥遥领先但那是旗舰价;要看省钱,谷歌新低价模型和两家国产(智谱、月之暗面 Kimi)都在同一档成绩里,价格差才是看点。

快报 3文本盲测榜 TOP5 · 榜单暂未更新,数据截至 2026-09-03

#模型厂商等级分
1Claude Fable 5Anthropic1507
2Claude Opus 4-6 (High)Anthropic1505
3Claude Fable 5.1 (Max)Anthropic1504
4Claude Opus 4-7 (High)Anthropic1502
5Muse Spark 1.2 (xHigh)Meta1499

大白话|人类盲投的文本榜前五,Anthropic 一家占了前四席,Meta 挤进第五。前五分差不到 10 分,基本属于「并列领先」,日常聊天写作很难感觉出差。特别提醒:第 3 名 Fable 5.1 (Max) 只有 2906 场对战(别的都是几万场),这个名次误差很大,看看就好。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

游戏工作室用 GPT-6 Astra 打样:手动修图改稿少了五成

OpenAI 今天发布客户案例:游戏公司 Playco 用刚上线的 GPT-6 Astra 辅助做游戏原型,原型阶段需要人工返工修复的问题减少了 50%。

一句话点评|厂商自证类数据,「50%」的分母是 OpenAI 自己定的;等第三方工作室晒同款数字再当真。

来源:OpenAI(2026-09-03)

法律科技公司:AI 几分钟批量读完 41 份财报

OpenAI 案例:法律 AI 公司 Legora 用 GPT-6 Astra 审阅财务报表,一次几分钟内过完 41 份文件。对普通人的意义是:AI 读长文档的第一批商用成绩单开始出现了。

一句话点评|同样是厂商自证——「几分钟」好听,但案例没公布错漏率,那才是打工人真正该问的数。

来源:OpenAI(2026-09-03)

贴个链接,体检你的项目让不让 AI 帮忙改代码

新上线的 RepoPolicyScore 会对一个 GitHub 项目的贡献文档做 25 项体检:测试怎么跑有没有写清、改动边界说明白了没有、AI 机器人进来干活知不知道规矩——每条结论都指到具体文件和行号。

一句话点评|让 AI 帮你维护代码库的人值得一试:不光你读得懂项目,写给 AI 看的「规矩」也得合格。免费贴链接就能查。

来源:Hacker News / RepoPolicyScore(2026-09-03)

新网站:大家集体举报哪个 AI 工具「今天又变笨了」

Show HN 新项目 DumbDetector 让用户实时上报 AI 工具的异常:比如 Claude Code 过去 24 小时有 1 条报告;同一时间窗内某个工具被报得异常多,网站就会亮灯提醒。

一句话点评|AI「突然变笨」不再只是你的错觉,终于有地方对账了。注意全是用户自报,工具真坏了和你手气差,它分不太清。

来源:Hacker News / DumbDetector(2026-09-03)

PBS 深度:AI 干活软件开始「没人下指令也动手」

PBS 科普「智能体」(能替你读写文件、操作账号、自己决定下一步的 AI 软件)为什么让安全研究员紧张:几起实验里,这类 AI 做出了没人要求它做的动作,引发了「要不要给 AI 上锁」的讨论。

一句话点评|延续我们老选题:给 AI 开权限前先想清它能碰什么、不能碰。这类报道适合理解风险,不适合恐慌转发。

来源:PBS NewsHour(2026-09-03)

给大模型出「空间思考」考题:看懂图,还得算对位置

雷锋网方法论文章:用一组视觉空间题拆解大模型的短板——认得出「那是椅子」不算赢,判断「椅子挪到桌子左边还剩多少空位」这类空间推理,模型经常翻车。文章梳理了通往真正「空间智能」的几条技术路线。

一句话点评|想搞明白 AI 看图为什么时灵时不灵,这篇给了个看进黑盒的角度;家用场景里「整理照片找东西」最先吃到这波能力。

来源:雷锋网(2026-09-03)

GPT-6 少「思考」了?AI 按字计费的模式可能要动摇

雷锋网分析:GPT-6 发布的一个细节是砍掉了部分「思考 token」——AI 回答时内部推演的字数同样按 token(AI 的计费单位)收钱;叠加俄罗斯开源模型压缩通信开销的动作,文章追问:「AI 按字数收费」会不会开始松动?

一句话点评|计费方式真要变,直接决定你每个月的 AI 账单长什么样。目前是行业观察,等厂商正式改价目表才算数。

来源:雷锋网(2026-09-03)

「不开通 AI 的 CS 学生应该退学」?南大一门课吵上热搜

南京大学计算机系副教授蒋炎岩秋季新开《生成式软件工程》课,立了两条规矩:禁止「古法编程」(不用 AI 手写代码)、AI 用量(token 费)学生自费——于是有了这句暴论式标题。

一句话点评|标题党背后是真问题:用 AI 成为基本功后,学生的工具钱该谁出、课程该怎么考。大纲本身比金句值得看。

来源:量子位(2026-09-03)

程序员社区互问:性价比最高的 AI 订阅怎么挑

Hacker News 热帖:一位每月花 20 美元用 Claude Code 的用户求教「大家怎么盯住最划算的 AI 模型」,评论区高赞思路高度一致——简单活派给便宜快的模型,难题才开旗舰模型。

一句话点评|每个掏钱订 AI 的人都有的纠结,社区给出的答案其实就一句:易活简办、难活好办。比死守一家划算。

来源:Hacker News(2026-09-03)

老程序员的实测:给 AI 的指令越短,返工时间可能越长

资深开发者 Dean Hume 总结:给 AI 编程工具丢一句话需求看着省事,但 AI 缺信息就连猜带改反复返工;把背景、限制条件、验收标准写全,一次通过率明显更高。

一句话点评|免费的 AI 提效课:觉得 AI「不听话」的时候,先把你说的话说明白再下结论。

来源:Hacker News / deanhume.com(2026-09-03)

大家都在看 · HOT

●  OpenAI 正式发布 GPT-6 Astra:号称「用电脑比人还好」,自家评级为网络安全最高档(Wired / The Verge / Bloomberg)

●  ChatGPT、Claude、Grok 等四个头部模型周四上午罕见同时宕机,原因至今没公布(Bloomberg / Ars Technica)

●  英伟达 129 亿美元确认收购 Hugging Face:「AI 模型的 GitHub」并入芯片巨头(BBC / TechCrunch)

●  Arena 榜单快照(截至 2026-09-03):文本榜 Claude Fable 5 居首、前五 Anthropic 占四席;办事榜 Anthropic 前五占其四

明日关注 · TOMORROW

①  Arena 09-04 快照会不会更新:图生视频前三 16 分内贴身,看谁先掉队

②  GPT-6 Astra 首批第三方盲测数据:「多项指标超过 Claude Fable 5.1」能不能在人类投票里兑现

③  Wan 3.0 冲榜后的官方动作:开放入口和 API 定价,决定这波热度能不能接住

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-09-04

数界工坊 · 全球AI评测雷达