物界前沿评测
GLOBAL AI REVIEW RADAR
2026.08.25 · 周二
第 027 期
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1AI 写代码写到停不下来:八成开发者承认上瘾,效率背后藏着一本难念的经
它能帮你干什么活:AI 编程助手现在不只是帮你补代码,而是很多人一天工作的起点——打开电脑先让 AI 起个头。ZDNET 8 月 25 日公布的开发者调查显示,80% 的受访程序员承认 AI 写代码「比想象中更容易上瘾」,一边觉得离不开,一边担心自己越来越不会独立写。这不是科幻片:代码产量确实上去了,但讨论里也在追问——当 AI 把「写」包办,人的「审」还跟不跟得上?
编程领域专家·老徐说|80% 这个数字我不意外,工具太好用的时候,人会不自觉地躺进舒适区。我的态度一直很明确:AI 写代码的效率是真的,但「会写」和「能维护」是两码事——AI 生成的坑往往要过几周才爆出来。别急着全自动,关键改动自己过一遍,测试跑起来,先等第三方实测再放开手脚。
小编小禾说|我一个不懂代码的人看到这个数据反而松了口气——原来连程序员都被 AI 惯坏了。这就像我以前用智能助手偷懒,省下的时间最后都花在改错上。工具好用是好用,但真出大事还得靠人把关,这条我信。
重点 2谷歌中端新秀一夜上榜三张 Arena 大榜:实惠型号的干活本事,正在追平最贵的那几款
它能帮你干什么活:Arena 是普通人也能看懂的 AI 盲测榜——全网用户匿名投票打分,谁强谁弱不让厂商自己说了算。8 月 24 日,谷歌中端型号 Gemini 3.7 Flash 一口气挤进三张榜:考「AI 能不能替你干活」的智能体榜第 20 名(比上一代跳升 15 位),做网页的榜单从第 19 名冲到第 8 名,聊天盲测榜第 9 名拿下 1490 分,和 Claude Sonnet 4.6、GPT-5.6 Terra 这些别人家旗舰站进了同一区间。对普通人来说意思是:挑 AI 工具,真不用非买最贵的。
产品领域专家·阿哲说|我一直记着一笔账:入口即模型,价格即门槛。中端型号三榜齐上,说明「平价 AI」不是阉割版,而是厂商在拿中端走量、拿旗舰立牌坊。对用户是好事——竞争越狠,便宜好用的东西就越多。别急着把主力工具换过去,先在它开放的入口里试几天,觉得顺手再说。
小编小禾说|我这种小白看榜单只有一个感觉:以前「AI 很厉害」是贵价专属,现在谷歌一个中端型号就跟旗舰站一排了。等它正式开放,我先让它帮我做个自我介绍网页试试水——但老规矩,先看大家实测再决定要不要长期用。
重点 3一个不肯露脸的 AI 模型,一天吃掉 4 万亿 token:好用是真的,但你的数据流去哪了?
它能帮你干什么活:token 是 AI 的数数单位,你问一句、它回一段,都按 token 算量。8 月 24 日,一个身份还没官宣的匿名模型 Ox Alpha(中文圈给它起外号叫「牛来」)悄悄上线,当天调用量冲到全球第一、刷新单日历史纪录——光前五大编程入口一天就喂给它超 4 万亿 token,终结了 DeepSeek 连续 56 天的霸榜。它一次能装下约 104.8 万 token(相当于十几万字)的上下文,能读图、看视频,预览期免费。能力是真的强,可它到底是谁家的,至今没人说得清。
安全领域专家·老周说|我盯的不是它多能打,而是「不透明」。开发者把代码、数据、账号往一个查不到底细的模型里喂,等于把钥匙交给陌生人——能力越强,越要想清楚它碰过什么、留了什么。这不是说它一定有问题,而是在身份官宣、隐私条款落地之前,重要项目的数据别急着全量喂进去。权限要设到最小,这条对谁都适用。
小编小禾说|我学乖了:上次那么热闹的神秘模型最后被扒出是限免噱头,这回我就盯两件事——4 万亿 token 这种用量数据做不了假,免费窗口能开多久才是我们普通人的事。老周老师提醒得对,我这种连账号密码都常忘的人,更不该稀里糊涂把家底交给一个连名字都不报的 AI。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1榜单快报 1 · 智能体榜:Claude 家族包揽前三,国产 Kimi 冲进前六
大白话|智能体榜考的不是聊天,是「AI 能不能替你干活」——拆任务、调工具、出错自己爬回来。8 月 24 日更新的最新一版里,Claude 家族包揽前三、前十占七席;国产的 Kimi K3 Max 冲到第 6,是国产模型在这张榜上的最高名次。
快报 2榜单快报 2 · 用量榜:神秘新模型一夜登顶
大白话|用量榜是开发者拿真金白银投的票:谁被用得多,谁才是真被需要。一个连名字都不肯报的匿名模型,8 月 24 日上线第一天就把 DeepSeek 守了 56 天的第一拿走,还顺手刷新单日纪录——这件事本身就是当天最硬的模型评测数据。
快报 3榜单快报 3 · 做网页 + 聊天榜:谷歌中端哪都能打
大白话|谷歌中端型号一口气挤进三张榜——干活的、做网页的、聊天的都开始认它。以前「中端追平旗舰」得打问号,这次 1490 分加多个分类前十摆在那里:挑 AI 工具,不用只盯着最贵那几款了。数据取自 Arena 官方 8 月 24 日公告。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
一份 ACL 论文的反直觉发现:专病专用的医疗 AI,可能还不如通用大模型靠谱
雷锋网 8 月 25 日介绍一篇 ACL 论文:研究者拿通用大模型和医疗专用模型在真实医疗任务上对比,得出两个反直觉发现——通用模型在某些场景下反而更懂医疗。医疗是 AI 落地最谨慎的领域之一,这条结论直接动摇了「专用一定更优」的默认认知。
一句话点评|买医疗 AI 服务前先问一句「底子是谁家的通用模型」,通用底子加专业调教,可能是更稳的组合。
AI 写代码越猛,代码库越难维护:越来越多的工程师开始头疼「遗产」
LeadDev 8 月 25 日发布观察:AI 编程时代,代码可维护性急剧下滑。工程师们发现,AI 让代码产量上去了,但留下的技术债也在堆积——别人看不懂、不敢改的代码越来越多,团队接手时直呼头疼。
一句话点评|AI 负责写,人负责懂;写得太快没人懂,等于给团队埋雷。
抽查 2475 家企业的「AI 搜得到吗」,88% 不合格:你的品牌在 AI 眼里可能不存在
一位开发者 8 月 25 日在 Hacker News 公开自己的审计结果:给 2475 家企业的网站做「AI 搜索就绪度」体检,88% 不合格——AI 回答问题时根本找不到它们。AI 搜索正在成为新的流量入口,企业官网却大多还没准备好。
一句话点评|以后「用户在 AI 里搜得到你吗」会像「百度排第几」一样重要,查漏补缺得趁早。
不联网也能聊天的 AI 人格:一个离线大模型加象棋引擎的「数字人」长这样
Hacker News 8 月 25 日热帖:一名开发者用本地大模型加象棋引擎,做了个完全离线的 AI 人格「Abby Steele」——不联网也能陪你聊天、下棋。端侧模型跑在你自己设备上,数据不出门,隐私问题天然少一截。
一句话点评|断网还能用的 AI 是刚需,本地跑还自带隐私加成;但有多大本事,得看设备配置够不够。
做网页的考场上,谷歌新秀从第 19 名冲到第 8 名
Arena 官方 8 月 24 日公告:Code Arena WebDev 榜(照着需求把网页搭出来)上,Gemini 3.7 Flash 从第 19 名跃到第 8 名;细分到数据分析(第 7)、模拟/游戏/内容创作(第 8)、参考设计(第 9),也全部挤进前十。
一句话点评|榜单细分到「具体干啥活」,以后给不同活挑工具,直接照表抓药。
聊天盲测榜第 9 名、1490 分:中端型号交出的高分答卷
Text Arena 是纯聊天体验的盲测场。Gemini 3.7 Flash 拿到 1490 分排第 9,比上一代 Gemini 3.6 Flash 分数更高——聊天这一项,也挤进了第一梯队边缘。
一句话点评|陪聊、写文案、查资料这些日常活,中端型号已经够顶。
智能体榜多了一个更狠的指标:「一次办成率」,谷歌新秀单项第 5
Arena 智能体榜的 Confirmed Success 单项,考的是 AI 接下一个长任务后,能不能一次性把整件事办妥、中间不用从头再来。Gemini 3.7 Flash 这项信号提升了 10%,单项排名第 5。
一句话点评|「能不能办成」比「能不能办」更值钱,普通用户要的就是这种不折腾。
匿名模型摸底考试:DeepSWE 约 63 分,整体接近 Claude Opus 4.8
DeepSWE 是专门考 AI 改代码、修 Bug 的实战考试。DeepSWE 官方人员评测后认为,Ox Alpha 得分约 63 分,整体水平接近 Claude Opus 4.8——高性能阵营的门槛。
一句话点评|接近第一梯队,但这还是官方自家口径,第三方复测结果才算数。
身份罗生门:分词器指纹像智谱,研究员暗示谷歌,「牛来」到底是谁
Ox Alpha 身份至今未官宣。社区通过分词器指纹和报错代码推断它属于智谱 GLM 系列,多名谷歌 DeepMind 研究员却发帖暗示它是 Gemini 新版——两边都有支持者。
一句话点评|连马甲都没脱就登顶,说明模型本身比牌子更能打;正式身份出来前,数据别乱喂。
104.8 万 token 的「超长记忆」:基本能装下整部《三体》
上下文窗口是 AI 一次对话能记住多少内容的尺度。Ox Alpha 的 104.8 万 token 大约相当于七八十万汉字,接近《三体》三部曲的体量——喂一整本书进去,它还能记得开头在讲什么。
一句话点评|长文档、长代码、长会议记录是它的主场;但也别真指望它一字不落。
● 英伟达财报前夜:AI 服务器涨价超 15%,云厂商利润率承压(钛媒体 / Bloomberg)
● 字节跳动发布「豆包工作」:Agent 与飞书深度打通(IT之家)
● WikiHow 起诉 OpenAI:指控爬取超 1.1 万篇教程文章训练模型(IT之家 / 路透社)
● 特斯拉中国大陆车型首次接入国产大模型(钛媒体 / 火山引擎)
● 智能戒指 Oura 拟 9 月赴美 IPO,估值瞄准 160 亿美元(IT之家 / Bloomberg)
① 问界 M6 城区辅助驾驶挑战明天 14:00 直播:华为 ADS 5 增强版迎战成都复杂路口(IT之家)
② 英伟达财报临近:分析师称是 AI 股下一根催化剂,15% 服务器涨价的影响一并落地(Bloomberg / Reuters)
③ 字节「豆包工作」上线后的首批反馈:Agent 进企业场景,第一仗打得怎么样(IT之家)
物界前沿评测
GLOBAL AI REVIEW RADAR
2026.08.25 · 周二
第 027 期 · 预览版
重点更新 2 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1谷歌中端新秀 Gemini 3.7 Flash 一夜上榜三张 Arena 大榜:写代码的、做网页的、聊天的都开始认它
它能帮你干什么活:Arena 是一张人类当裁判的 AI 盲测榜——成百上千用户匿名投票打分,谁强谁弱不让厂商自己说了算。昨天(8 月 24 日)谷歌的中端型号 Gemini 3.7 Flash 一口气上了三张榜:在考「AI 能不能替你干活」的智能体榜排第 20 名,比上一代跳升了 15 位,和 Claude Sonnet 4.6、GPT-5.6 Terra 这些别人家旗舰站在同一档;在考「做网页」的榜单从第 19 名冲到第 8 名;聊天盲测榜也挤进第 9 名,拿了 1490 分。它最亮眼的单项是「一次把事情办成」——干长活的时候不半路撂挑子。对普通人来说意思是:不用非买最贵的 AI,实惠型号的干活本事正在追上来。
编程领域专家·老徐说|说|智能体榜考的是长程干活:交代一个项目任务,AI 得自己拆步骤、调工具、出错了自己爬回来。Gemini 3.7 Flash 从 35 名跳到 20 名,还和 Claude Sonnet 4.6、GPT-5.6 Terra 一排,这个「干活稳定性」是真上来了。不过老规矩,榜单分数归榜单分数,真接进项目先拿小任务滚几天。文档写得跟没写一样的话,分数再高我也劝你等等。
小编小禾说|说|我这种不会写代码的人也能看懂这个信号:以前一说 AI 写代码,都是最贵那几款的事。现在谷歌一个中端型号都能三榜齐上,等于说便宜好用的 AI 离我们越来越近。我先记下这个名字,等它开放出来,第一件事就是让它帮我做个简单网页试试水。踩过的坑教会我:别急着换,先看大家实测。
重点 2一个不肯露脸的 AI 模型,一天用掉 4 万亿 token,把 DeepSeek 霸了 56 天的用量榜掀了
它能帮你干什么活:token 是 AI 的数数单位,你问它一句、它回你一段,都按 token 算量。昨天(8 月 24 日)一个身份还没官宣的匿名模型 Ox Alpha——中文圈给它起了个外号叫「牛来」——悄悄上线,结果一天之内调用量冲到全球第一,刷新单日历史纪录:光前五大入口(包括编程圈常用的 Claude Code 这类工具)一天就给它喂了超过 4 万亿 token,直接终结了 DeepSeek 在编程工具里连续 56 天的霸榜。它还是个大胃王:一次能装下约 104.8 万 token 的内容,相当于一口气读完十几万字还能记住开头;能看图、看视频;预览期还免费。它到底是谁家的、免费窗口能开多久,都没官宣——但开发者已经用脚投了票。
产品领域专家·阿哲说|说|又是匿名登顶,我记过一笔账:2025 年 8 月谷歌的 Nano Banana 以「纳米香蕉」代号匿名霸榜图像编辑,靠的是入口和免费,比名字重要。Ox Alpha 连名字都没有,一天就把 56 天的榜掀了,靠的还是那两样:强,加免费。这说明在开发者这个最挑剔的群体里,「谁家出的」越来越不重要,「好不好用、要不要钱」才是硬通货。对用户来说,匿名模型越多、互相卷得越狠,免费好用的东西就越多。别急着站队猜身份,先看免费窗口能开多久。
小编小禾说|说|上次那个神秘模型后来被扒出是限免噱头,我白激动一场,这回学乖了——不猜它是谁,就盯两件事:4 万亿 token 是实打实的用量数据(这个做不了假),免费窗口能开多久(这才是我们普通人的事)。要是它真的一直免费还这么能打,我下个月剪视频、做 PPT 的 AI 助手可能真要考虑换人了。老规矩:先等第三方实测,别急着把主力工具换过去。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1榜单快报 1 · 智能体榜:谷歌新秀一夜跳级
大白话|智能体榜考的不是聊天,是「AI 能不能替你干活」——拆任务、调工具、出错自己兜回来。谷歌这个中端型号一上榜就跳级 15 位,还和 Anthropic、OpenAI 的旗舰并排站,最值钱的单项是「一次办成率」:干长活不半路重来。数据取自 Arena 官方 8/24 公告。
快报 2榜单快报 2 · 做网页 + 聊天榜:哪都能打
大白话|做网页这张榜专考「照着需求把页面搭出来」,谷歌新秀从 19 名一路到 8 名,数据分析、游戏模拟这些细分活也排进分类前十;聊天盲测榜 1490 分挤进第 9。中端型号全面开花,挑 AI 工具时真不用只盯着最贵那几款了。数据取自 Arena 官方 8/24 公告。
快报 3榜单快报 3 · 用量榜:神秘新模型一夜登顶
大白话|用量榜是开发者用真金白银投票的榜:谁被用得多,谁才是真被需要。一个连身份都不肯官宣的模型,上线第一天就把 DeepSeek 守了 56 天的第一拿走,还顺手刷新单日纪录——这件事本身,就是 8 月 24 日最硬的模型评测数据。数据来源:每经 / 快科技 / 新浪财经(8/24 报道)。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
智能体榜多了一个更狠的指标:「一次办成率」,谷歌新秀单项第 5
Arena 智能体榜的 Confirmed Success 单项,考的是 AI 接下一个长任务后,能不能一次性把整件事办妥、中间不用从头再来。Gemini 3.7 Flash 这项信号提升了 10%,单项排名第 5。
一句话点评|「能不能办成」比「能不能办」更值钱,普通用户要的就是这种不折腾。
谷歌中端型号,和 Claude Sonnet 4.6、GPT-5.6 Terra 站进了同一区间
Arena 官方公告提到,Gemini 3.7 Flash 在智能体榜上已和 Anthropic 的 Claude Sonnet 4.6、OpenAI 的 GPT-5.6 Terra (xHigh) 处于同一区间——都是能扛长任务的选手。
一句话点评|中端对旗舰,差距已经小到要拿放大镜看,选工具时价格权重可以再压一点。
做网页的考场上,Gemini 3.7 Flash 从第 19 名冲到第 8 名
Code Arena 的 WebDev 榜考「照着需求把网页做出来」。Gemini 3.7 Flash 从 19 名跃到第 8 名,细分到数据分析(第 7)、模拟/游戏/内容创作(第 8)、参考设计(第 9)几个分类也全部进前十。
一句话点评|榜单细分到「具体干啥活」,以后给不同活挑工具直接照表抓药。
聊天盲测榜第 9 名、1490 分:中端型号的高分答卷
Text Arena 是纯聊天体验的盲测场。Gemini 3.7 Flash 拿到 1490 分排第 9,比上一代 Gemini 3.6 Flash 分数更高——聊天这一项也挤进了第一梯队边缘。
一句话点评|陪聊、写文案、查资料这些日常活,中端型号已经够顶。
Ox Alpha 的规格单:一次装下十几万字,图片视频也能读,预览期免费
匿名模型 Ox Alpha 的公开规格:上下文窗口约 104.8 万 token(AI 一次能记住多少内容的度量,相当于十几万字),最大输出 13.1 万 token,支持文本、图像、视频多模态,预览期不收费。
一句话点评|又能记、又能看、还免费——这三个词放在一起,难怪开发者抢着用。
DeepSeek 连续 56 天霸榜的纪录,被一个来路不明的家伙终结了
在编程工具 OpenCode 的入口里,DeepSeek 已经连续 56 天是调用量第一。Ox Alpha 上线首日就把它顶了下去,成为全球开发者这两天集中使用的新模型。
一句话点评|56 天的纪录说破就破,开发者用脚投票的力度,比任何发布会都实在。
身份罗生门:分词器指纹像智谱,研究员暗示谷歌,「牛来」到底是谁
Ox Alpha 身份至今未官宣。社区通过分词器指纹和报错代码推断它属于智谱 GLM 系列,多名谷歌 DeepMind 研究员却发帖暗示它是 Gemini 新版——两边都有支持者。
一句话点评|连马甲都没脱就登顶,说明模型本身比牌子更能打;坐等官宣。
DeepSWE 摸底考试:约 63 分,整体接近 Claude Opus 4.8
DeepSWE 是一场专门考 AI 改代码、修 Bug 的实战考试。DeepSWE 官方人员评测后认为,Ox Alpha 得分约 63 分,整体水平接近 Claude Opus 4.8——全球高性能阵营的门槛。
一句话点评|接近第一梯队,但这是官方自家口径,第三方复测结果才算数。
连 Stripe 老板都来围观:这个匿名模型「非常令人印象深刻」
在线支付巨头 Stripe 的 CEO Patrick Collison 公开发声,评价 Ox Alpha「非常令人印象深刻」。科技圈大佬集体围观的场面,上一次还是某个匿名模型登顶图像榜的时候。
一句话点评|大佬背书看看就好,好不好用还是自己上手试最实在。
104.8 万 token 的「超长记忆」:基本能装下整部《三体》
上下文窗口是 AI 一次对话能记住多少内容的尺度。104.8 万 token 大约相当于七八十万汉字,接近《三体》三部曲的体量——喂一整本书进去,它还能记得开头在讲什么。
一句话点评|长文档、长代码、长会议记录是它的主场;但也别真指望它一字不落。
● 人形机器人百米跑出 9.58 秒,追平博尔特纪录(The Verge / IT之家)
● AI 开源平台 Hugging Face 传出 130 亿美元收购谈判(TechCrunch)
● 小米连发三款自研芯片,AI 旗舰 SoC 玄戒 O3 首发支持 LPDDR6(IT之家 / Bloomberg)
● 比亚迪仰望 U7 今天办驾驶者大会,预告极限挑战(IT之家)
① 仰望 U7 驾驶者大会今天的「史无前例极限挑战」结果如何,量产车到底扛住了什么
② 燧原科技 9 月 2 日开放申购,国产 GPU 第一梯队打新窗口临近
③ 英伟达财报临近,分析师称可能是 AI 股的下一催化剂(Bloomberg / Ives)
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-08-25
数界工坊 · 全球AI评测雷达