物界前沿评测

GLOBAL AI REVIEW RADAR

2026.08.30 · 周日

第 032 期

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1「A 家额度用光了,B 家的 token 还在闲置」:AI 用量被困在各家产品里

它能帮你干什么活:看懂各家 AI 订阅的额度为什么不能挪着用,别再为「明明还剩却用不了」多掏钱。8 月 30 日一位开发者在 Hacker News 发帖:他同时用一个智能体编程工具和一个部署助手,前者额度见了底,后者账户里还剩大把没用完的 token,两边就是互相搬不动。问题出在计费结构——额度锁死在单个产品里,各家订阅各定各的池子,中间没有一个通用的「额度层」。帖子戳中了不少人,评论区都在晒自己同时养着几份用不完的订阅。

产品领域专家·阿哲说|这是订阅制 AI 的必然摩擦:云计算十年前就明白「资源池化才提得高利用率」,AI 订阅现在走的还是早期「每个产品绑死配额」的老路。跨家通用额度对厂商没好处——额度就是它们的定价杠杆——但对用户是真实成本。抱怨攒多了,要么逼出聚合类中间层工具,要么逼厂商把「额度结转」「跨产品通用」当卖点。入口之争打完全力打配额,这个行当开始进入抠账本阶段。

小编小禾说|代入感太强了:我两个订阅一个用到底、一个还剩大半,就是搬不动。对普通人暂时的办法很土:把每家的额度周期算清楚,别在清零前一天才派活用。等真有人做「额度搬家」的工具我第一个试,现在先把「用不完=白花钱」记进每月账本。

来源:Hacker News(2026-08-30)

重点 2谷歌新模型两天爬了三张榜:聊天第9、写码第8、干活第20——跑得快,样本还薄

它能帮你干什么活:看懂谷歌这版主打便宜快的新模型到底进了什么梯队。Arena 官方账号 8 月 28 日公布 Gemini 3.7 Flash (High) 的最新成绩单:聊天盲测 1490 分、排第 9;写网页代码的 WebDev 分榜从上一代的第 19 跳到第 8;考「能不能替人把事办成」的智能体榜新进第 20。对比前代 Gemini 3.6 Flash 的智能体第 35,属于换代即跃升。价格是另一张牌:限时价读 100 万字约 0.75 美元、写约 3.75 美元。需要说明:Arena 主榜快照仍停在 8 月 26 日、写代码榜快照停在 8 月 21 日,这批名次是官方 8 月 28 日刚宣布的,不是快照里的数。

编程领域专家·老徐说|位次变化是实打实的:前代在写码相关榜单只排到二十名开外,这代直接进前十,谷歌把「快且便宜」这条线做对了。但延续我上期立场:新名次刚上榜一两天、对战样本比榜上老玩家薄一个量级,名次一定会晃,先稳一两轮再当真。厂商自家发布会的成绩单和刚上榜的位次都先记账不入成本,接自己项目前拿真实任务跑一周,看它断在哪一步。

小编小禾说|我延续第 031 期刚立的规矩:新上榜的先看它晃不晃,价格再香也等名次稳两轮再说。对普通人最实用的一句:这模型主打回消息快、价格便宜,拿它写周报试试水可以,重要的活儿先留给用了半年的那家。

来源:Arena 官方账号(LinkedIn)+ 榜单快照 2026-08-26(2026-08-28)

重点 3把 AI「装进自己电脑」到底难不难?Wired 写了份从零开始的实操指南

它能帮你干什么活:判断自己要不要折腾一台「不联网也能用的 AI」。《连线》(Wired)8 月 29 日发了一篇教程:在自己的电脑上跑一个离线聊天 AI,选模型、装软件、配硬件,一步步带。断网可用、隐私留在本机是最大卖点;代价是自家电脑跑得动的基本都是小模型,理解力、知识量跟云端旗舰有肉眼可见的差距。这篇教程在 Hacker News 上也跟着升温,本地部署正在从极客玩具变成有标准流程的事。

穿戴领域专家·阿凯说|本地跑 AI 这条路我从 2026 年 8 月 11 日 Meta 开源 30B 模型那期就开始跟,判断没变:普通显卡能跑开源模型是分水岭,可玩性大增,但小模型和云端旗舰的差距是真的。这篇教程值得收藏的点是它把「什么硬件能跑到什么水平」讲明白了——按自己电脑的配置选档位,别拿轻薄本去挑战 70B 大模型,跑不动的锅不该 AI 背。

小编小禾说|断网能用确实是刚需,但我还是那句第 017 期的老话:就怕本地版偷偷换了个「小脑子」变笨。先照教程在备用机上装一个试试水,主力机暂时不折腾。

来源:Wired(连线)(2026-08-29)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1写代码盲测榜 · 数据截至 2026-08-21(本期新增一组,Arena 快照未更新)

#模型厂商盲测分
1Claude Opus 5 (Max)Anthropic1691
2Kimi K3 (Max)月之暗面1674
3Qwen3.8 Max阿里1669
4Claude Opus 5 (High)Anthropic1663
5Grok 4.6 (High)xAI1629

大白话|人类盲测「谁代码写得好」:第一到第三分差全在 22 分以内、二三名只差 5 分,前三互有胜负很正常。头一次排进本期快报的看点:两家开源选手(Kimi K3、Qwen3.8 Max)挤进前三,把一堆付费闭源模型压在身后。注意这组快照是 8 月 21 日的、比主榜还早五天,看梯队可以,逐名较真不行。

快报 2Arena 主榜快照没动,改盯官方 8 月 28 日新宣布的位次

大白话|Arena 聊天榜快照仍是 8 月 26 日、智能体榜停在 8 月 24 日口径,跟上期同源,不重复照搬。没进过快报的最新动态走官方口径:Gemini 3.7 Flash (High) 8 月 28 日新进智能体榜第 20、聊天榜第 9(1490 分);智能体榜里 Kimi K3 (Max) 排第 6,但「把事办成率」18.24 全榜最高、「听话度」只有 2.31——活干得漂亮,就是不太听指挥。新名次样本薄,等下一份快照验证。

快报 3AI 幻觉案例库 · 一张「反面榜」(本周持续更新)

大白话|一张没有总分的负面清单:有人专门给 AI 编瞎话建了案底库,虚构判例、假引用、编造事实逐条记档,最新收录一条是 8 月 27 日美国佛罗里达一桩诉讼里有人拿 AI 编的材料当证据,8 月 29 日在 Hacker News 被翻出热帖。它不告诉你哪家模型最强,它提醒你所有模型都可能在你最认真的那份报告里埋雷——榜单之外,翻车记录也是一种评测。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

给 AI 写的代码先过一道安检:VibeGuard 开源当「安全检查员」

Copilot、Cursor、Claude 这些 AI 写代码的速度早就超过人眼评审,一个刚开源的工具 VibeGuard 专门给 AI 生成的代码做安全扫描,先标风险再进仓库。

一句话点评|AI 写码时代把评审交给机器预审是刚需,但扫描器自己也是 AI——它标出来的要人确认,它说没事不代表真没事,先等第三方实测检出率。

来源:Hacker News / GitHub(2026-08-30)

把文档、讲义、照片变成考卷:Quizroom 每道题都标出处原句

一个新上线的 AI 出题工具:丢进去任意文档、课程讲义甚至一张照片,几分钟生成一套试题,每道题标注它出自原文哪一句,主打「可核对的考核」。

一句话点评|「每道题可回查原文」是对 AI 出题最要紧的设计;出题质量适不适合正式考试,等老师和学生实测。

来源:Hacker News / Quizroom(2026-08-30)

给 AI 智能体的每个动作发一张「回执」:AgentGate 上线

一个轻量 API 网关:让 AI 智能体代替用户调用 GitHub、Slack 等办公接口,智能体全程看不到账号密钥,每次操作留下一张签名回执,事后可对账。

一句话点评|「智能体不碰钥匙、每一步留凭证」正是把权限设到最小的落地做法;项目刚发布,先看真实部署里回执能不能防住越权。

来源:Hacker News / GitHub(2026-08-30)

给孩子一个能拆开的 AI:Claypot 用积木演示 AI 系统怎么运转

一个面向孩子的积木式 AI 观察台:像搭积木一样拼出 AI 系统的各个环节,直观看到「问一句话进去,中间发生了什么」。

一句话点评|理解 AI 怎么干活的最快方式是拆开看,教育向工具开始认真做「可解释」这一层。

来源:Hacker News / Claypot(2026-08-30)

同一个问题问多家 AI,只留答案一致的:一个减少立场偏差的小工具

一个新上线的小实验工具:把同一个问题同时抛给几家竞争模型,只保留它们答案一致的部分,用「共识区」过滤单一模型的偏差。

一句话点评|「多家模型取交集」是普通用户能上手的最便宜的事实核查法;交集不等于真相,一致之外的分歧部分同样值得看。

来源:Hacker News(2026-08-30)

音乐人转行「侦探」:逐轨排查冒充真人新歌的 AI 歌曲

The Verge 报道:一批 EDM 音乐人组成民间排查队,用听感细节和频谱工具揪出冒名顶替、蹭播放分成的 AI 生成歌曲——生成工具越来越真,靠人耳鉴别已经不够用。

一句话点评|AI 内容鉴别在音乐圈成了猫鼠游戏,鉴别器和造假者都在加速进化,平台规则还没追上。

来源:The Verge(2026-08-29)

有人用 Rust 给 AI 智能体重写了一个浏览器,不带 Chromium 和 V8

一位工程师开源了从头写的无头浏览器:专为 AI 智能体上网干活设计,砍掉 Chromium 和 V8 两个巨型组件,体积和崩溃面都小得多。

一句话点评|「浏览器是给 AI 用的」开始成为独立设计命题——给 AI 定制的基础设施一多,说明这个行当站稳了。

来源:Hacker News / Medium(2026-08-30)

程序员长文复盘:编程之外,第一个真省时间的 AI 用途是买菜

一位开发者试了一圈,得出结论:AI 在写代码之外唯一稳定省时间的事,是规划每周买菜清单——预算、忌口、冰箱里快过期的菜全考虑进去。

一句话点评|AI 的实用价值常藏在不性感的家务里,一步步 walkthrough 的亲身记录比发布会可信。

来源:Hacker News / ducret.dev(2026-08-29)

「写给 AI 看的文档」有了标准提案:软件长出第二个读者

一个开源提案:软件文档不只要给人看,还要让用户的 AI 助手能照着直接操作。作者认为软件现在有两个读者——决定用不用的人,和替人干活的智能体。

一句话点评|文档这个老行当正在长出「给机器读」的新物种,谁先标准化谁占入口。

来源:Hacker News / GitHub(2026-08-29)

老牌电子书管理软件 Calibre 加入 AI 生成封面

本地电子书管理软件 Calibre 上新功能:选中一本书,让 AI 按书名和内容生成封面图,不用会设计软件。

一句话点评|AI 生图正在长进日常软件的默认功能里;封面若要公开使用,留意生成内容的版权条款。

来源:OMG! Ubuntu(2026-08-29)

大家都在看 · HOT

●  微软在新版用户隐私声明中承认将用户数据用于 AI 训练(Hacker News / Slashdot)

●  谷歌 AI Studio 被报「删除后数据仍长期留存」关键缺陷:官方 issue 单冲上热榜(Hacker News / Google Issue Tracker)

●  Internet Archive 上线「复古 AI 藏品」专区:早期 AI 程序与史料打包公开(Hacker News)

●  哈佛商业评论研究:别把 AI 智能体当「员工」放进组织架构图(HBR)

●  Simurg:给 AI 智能体的免费搜索工具,查不到出处宁可中断也不瞎答(Hacker News / PyPI)

●  OpenContext 上线:给 AI 编程智能体加一层「项目本地长期记忆」,跨会话记住决策(Hacker News)

明日关注 · TOMORROW

①  Arena 下一份快照:盯写代码榜前三 22 分以内的座次会不会互换,也盯 Gemini 3.7 Flash 刚宣布的聊天第 9、WebDev 第 8 能不能在快照里站稳

②  谷歌 AI Studio「删除后数据仍留存」issue 单的官方回应:涉及所有把对话当素材喂给 AI 的用户

③  OpenAI Astra 若官宣发布:看有没有公开榜单对标成绩,还是只有一场发布会

—— 以下为早上预览版 ——

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.08.30 · 周日

第 032 期 · 预览版

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1谷歌 Gemini 3.7 Flash 两天爬了三张榜:聊天第9、写码第8、干活第20——跑得快,样本还薄

它能帮你干什么活:这是谷歌 8 月 13 日发布的走量款 AI,主打便宜快。Arena 官方账号 8 月 28 日公布的新数据:它的聊天盲测分 1490、排第 9(榜单快照截至 2026-08-26,对战样本 5718 场);写网页代码的 WebDev 分榜从第 19 一口气跳到第 8;智能体榜(考 AI 能不能替你跑任务、把事办成)新进第 20,「净改进」+3.4,「确办成率」+10% 排全榜第 5。对比它的前代 Gemini 3.6 Flash:智能体第 35、写码第 21,属于换代即跃升。价格也是卖点:读 100 万字约 0.75 美元、写约 3.75 美元(AI 按「token」计费,一个 token 约合四分之三个汉字),限时价。8 月大模型榜单周报还提到它推理速度 343.7 token/秒全场最快、综合分 65.43 总榜第 10(该周报为第三方整理,转引自知乎)。

编程领域专家·老徐说|上期我就提醒过:新名次先稳一两轮再看。今天这份成绩单的样本量还是偏薄——聊天榜 5718 场对战,榜上老玩家动辄两三万场;写码榜它才 2552 场。方向是真猛:前代 Gemini 3.6 Flash 在写码榜只排第 21,一代产品就把位次抬进前十,说明谷歌把「快且便宜」这条线做对了。但老规矩,厂商发布会的成绩单和刚上榜的位次都先记账不入成本,接自己项目前拿真实任务跑一周,看它断在哪一步。

小编小禾说|价格确实香,但我延续第 031 期的做法:新上榜的先看它晃不晃。而且「快」对我这种普通人最直观——回消息不用等转圈。先拿它写周报试试,重要的活儿还是留给用了半年的那家。

来源:Arena 官方账号(LinkedIn)+ 榜单快照 2026-08-26(2026-08-28)

重点 2有人给 AI 编瞎话建了一本「案底」:最近一条来自 8 月 27 日的美国法庭记录

它能帮你干什么活:一个叫 AI Hallucination Cases Database(AI 幻觉案例库)的网站,专门收集 AI「一本正经编瞎话」的真实案底:虚构的法律判例、不存在的引用来源、编出来的事实,连当事人、时间、出处都逐条记档。8 月 29 日它在 Hacker News 上被翻出来,最新收录的一条是 8 月 27 日美国佛罗里达州一桩诉讼里,有人拿 AI 编造的材料当证据。这类库的价值在于把散落的翻车现场攒成一个可查的账本——你下次看到 AI 言之凿凿地列「来源」,可以先去对账。

产品领域专家·阿哲说|我给这类东西的定位是「买家秀档案馆」。模型好不好,厂商说了算的部分太多;但法庭上被当庭戳穿、被记者核实打脸,这些案例没人能公关掉。打分权从厂商手里拿回来,靠的不是又一张跑分榜,而是这种带案号的负面清单。它不告诉你哪家模型最强,它告诉你所有模型都可能在你最认真的那份报告里埋雷。

小编小禾说|我在第 028 期说过「买前先看买家秀」,这回连翻车秀都有存档了。用 AI 写东西,它给的材料、链接、数字,转发前挨个点开验一遍——我的老习惯,AI 的话信之前先验。

来源:Hacker News / AI Hallucination Cases Database(2026-08-29)

重点 3把 AI「装进自己电脑」到底难不难?Wired 写了份从零开始的实操指南

它能帮你干什么活:《连线》(Wired)8 月 29 日发了一篇教程,教你在自己的电脑上跑一个不联网也能用的聊天 AI:选模型、装软件、配硬件,一步步带。断网可用、隐私留在本机是最大卖点;代价是自家电脑能跑动的基本都是小模型,理解力、知识量跟云端旗舰有肉眼可见的差距。想自己搭的人多了,本地部署正在从极客玩具变成一门有标准流程的生意。

穿戴领域专家·阿凯说|本地跑 AI 这条路我从 2026 年 8 月 11 日 Meta 开源 30B 模型那期就开始跟,当时我的判断没变:普通显卡能跑开源模型是分水岭,可玩性大增,但小模型和云端旗舰的差距是真的。这篇教程值得收藏的点是它把「什么硬件能跑到什么水平」讲明白了——按自己电脑的配置选档位,别拿轻薄本去挑战 70B 大模型,跑不动的锅不该 AI 背。

小编小禾说|断网能用确实是刚需,但我还是那句第 017 期的老话:就怕本地版偷偷换了个「小脑子」变笨。先照教程在备用机上装一个试试水,主力机暂时不折腾。

来源:Wired(连线)(2026-08-29)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1聊天盲测榜 · 数据截至 2026-08-26

#模型公司盲测分
1Claude Fable 5Anthropic1508
2Claude Opus 4.6 (High)Anthropic1504
3Claude Opus 4.7 (High)Anthropic1502
4Muse Spark 1.2 (xHigh)Meta1498
5Claude Opus 4.6Anthropic1497
9Gemini 3.7 Flash (High)谷歌1490(新进前十)

大白话|人类当裁判、双方匿名的盲测里,前十的席位 Anthropic 占了六席、Meta 两席,谷歌新来的 Gemini 3.7 Flash 以 1490 分挤进第 9。盲测分就是让真人给两个匿名模型的回答投票选赢家,再按输赢折算成分数,前 8 名的分差全在 20 分以内,互有胜负很正常。

快报 2智能体榜(考 AI 能不能把事办成) · 数据截至 2026-08-26

#模型公司净改进分
1Claude Opus 5 (High)Anthropic12.73
2Claude Opus 5 (Max)Anthropic12.41
3Claude Fable 5 (High)Anthropic11.62
4GPT-5.6 Sol (xHigh)OpenAI10.31
6Kimi K3 (Max)月之暗面9.53

大白话|这张榜不问「谁话说得漂亮」,问「让它替你跑任务,事办成了没有」。Claude 家族包揽前三,国产的 Kimi K3 排第 6,它「确办成率」18.24 全榜最高、但「听话度」只有 2.31——活干得漂亮,就是不太听指挥。本期新进的 Gemini 3.7 Flash 暂列第 20,样本还少。

快报 3写代码榜 · 数据截至 2026-08-26

#模型公司盲测分
1Claude Opus 5 (Max)Anthropic1691
2Kimi K3 (Max)月之暗面1674
3Qwen3.8 Max阿里1669
4Claude Opus 5 (High)Anthropic1663
10Gemini 3.7 Flash (High)谷歌1587(8月28日 WebDev 分榜已升至第8)

大白话|写代码榜上两家开源选手(Kimi K3、Qwen3.8 Max)挤进前三,把付费闭源模型压在身后。Gemini 3.7 Flash 快照时排第 10,8 月 28 日官方更新已跳到 WebDev 分榜第 8,涨势见重点更新第一条。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

给 AI 用的免费搜索工具 Simurg:查不到出处就宁可中断也不瞎答

刚上架的开源工具 Simurg 给 AI 智能体配了个免费网络搜索,卖点是「中止幻觉」:搜不到能撑住答案的出处,宁可停也不接着编。

一句话点评|「宁可停下也不瞎说」是对症的思路,工具刚发布,拦截效果等第三方实测。

来源:Hacker News / PyPI(2026-08-30)

Documentation.ai.md:提出「写给 AI 看的文档」标准,软件有了第二读者

一个开源提案:软件文档不只要给人看,还要让用户的 AI 助手能照着直接操作。作者认为软件现在有两个读者——决定用不用的人,和替人干活的智能体。

一句话点评|文档这个老行当正在长出「给机器读」的新物种,谁先标准化谁占入口。

来源:Hacker News / GitHub(2026-08-30)

程序员长文:编程之外,第一个真省时间的 AI 用途是买菜

一位开发者复盘:试了一圈,AI 在写代码之外唯一稳定省时间的事,是规划每周买菜清单——预算、忌口、冰箱里快过期的菜全考虑进去。

一句话点评|AI 的实用价值常藏在不性感的家务里,一步步 walkthrough 的亲身记录比发布会可信。

来源:Hacker News / ducret.dev(2026-08-29)

BoqCalc:AI 给 500 行工程报价单计价,主打「单价不乱编」

建筑行业的 AI 流水线:上传工程量清单,它算造价、从技术文档里挑隐藏风险,重点是把报价单价锁在可核对的数据里,不让模型自由发挥。

一句话点评|又一个「宁可不算也不乱算」的设计样本;工程报价出错代价高,先等有真实项目案例再用。

来源:Hacker News / BoqCalc(2026-08-29)

AI 开始碰密码学的根基:数学家聊「格归约能不能交给机器证明」

一档安全播客请密码学家 Chris Peikert 讨论近期进展:AI 在「格」这一类数学问题上开始能自动完成证明——而格的困难假设正是后量子加密的地基,AI 既能帮着验证,理论上也可能帮着找破绽。

一句话点评|AI 从「会做题」走到「会证明定理」,密码圈先惊后喜;「AI 破译加密」目前还只是演练假设,没成真。

来源:Hacker News / Security Cryptography Whatever(2026-08-29)

安全研究员公开征集:把你家 AI 智能体最离谱的运行日志发我

有 AI 安全研究者在网上向用户征集「最古怪的智能体日志」——AI 替你干活时跑偏、自作主张、干了匪夷所思之事的过程记录,用来研究智能体的真实行为边界。

一句话点评|智能体最诚实的能力材料不是演示片,是翻车现场的过程记录,这类民间样本比论文稀缺。

来源:Hacker News / Reddit(2026-08-29)

老牌电子书管理软件 Calibre 加入 AI 生成封面

本地电子书管理软件 Calibre 新功能:选中一本书,让 AI 按书名和内容生成封面图,不用会设计软件。

一句话点评|AI 生图正在长进日常软件的默认功能里;封面若要公开使用,留意生成内容的版权条款。

来源:OMG! Ubuntu / IT之家(2026-08-29)

「问问 AI」按钮:网页开始像挂社交分享一样挂 AI 入口

免注册小工具:网站主可以一键生成「问问 AI 本站讲了啥」的按钮挂在页面上,访客点了直接和自己的 AI 助手开聊,把解释权抢回自己手里。

一句话点评|用户已经习惯先问 AI 再决定点不点开网页,网站把 AI 入口当社交按钮补上,是入口迁移的小信号。

来源:Hacker News / llmcheck.app(2026-08-29)

音乐人转行「侦探」:逐轨排查冒充真人新歌的 AI 歌曲

《连线》旗下 The Verge 报道:一批 EDM 音乐人组成民间排查队,用听感细节和频谱工具揪出冒名顶替、蹭播放分成的 AI 生成歌曲——生成工具越来越真,靠人耳鉴别已经不够用。

一句话点评|AI 内容鉴别在音乐圈成了猫鼠游戏,鉴别器和造假者都在加速进化,平台规则还没追上。

来源:The Verge(2026-08-29)

有人用 Rust 给 AI 智能体重写了一个浏览器,不带 Chromium 和 V8

一位工程师开源了自己从头写的无头浏览器:专为 AI 智能体上网干活设计,砍掉 Chromium 和 V8 两个巨型组件,体积和崩溃面都小得多。

一句话点评|智能体底下的基础设施正在被重写一层,「浏览器是给 AI 用的」开始成为独立设计命题。

来源:Hacker News / Medium(2026-08-30)

大家都在看 · HOT

●  OpenAI 宣布 SpaceX 收购 Cursor 后终止其模型接入,11 月停服进入倒计时(CNBC / IT之家)

●  国际研究团队实测:21 个主流开放权重 AI 模型全部存在可被利用的安全弱点(滑铁卢大学)

●  Gemini 3.7 Flash 推理速度 343.7 token/秒全场最快、综合分 65.43 总榜第 10(8 月大模型榜单周报,转引自知乎)

●  Debian 开发者投票通过:项目内可「负责任使用」生成式 AI,人类负最终责任(IT之家 / LWN)

●  英伟达拟 130 亿美元收购 Hugging Face,开放权重模型平台成热门收购目标(TechCrunch / IT之家)

●  国家数据局:截至 7 月底全国智算总规模达 245 万 PFLOPS(新华社)

明日关注 · TOMORROW

①  Arena 下一份快照(上期截至 08-26):盯 Gemini 3.7 Flash 的智能体第 20、WebDev 第 8 能不能守住,样本量攒到多少

②  英伟达若官宣确认收购 Hugging Face:开源模型供给格局、各家榜单上的开源席位会不会跟着重排

③  OpenAI 断供 Cursor 进入倒计时:程序员转投哪家,下周写码榜名次会不会动

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-08-30

数界工坊 · 全球AI评测雷达