物界前沿评测
GLOBAL AI REVIEW RADAR
2026.08.29 · 周六
第 031 期
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1谷歌 AI 一夜上了三张榜单:Gemini 3.7 Flash,干活的、写码的、聊天的都涨了
它能帮你干什么活:看懂谷歌新模型到底进步了多少。Arena(原 LMArena)官方账号 8 月 28 日宣布,Gemini 3.7 Flash (High) 一次空降三张榜:智能体榜总榜第 20 名,比上一代 Gemini 3.6 Flash (High) 的第 35 名大幅跃升;写代码的 WebDev 分榜从第 19 名跳到第 8 名;文本对话榜排第 9、Elo 1490 分。分项里「确认成功」比上一代涨了约 10%。价格上,2026 年底前输入每百万 token 0.75 美元、输出 3.75 美元,2027 年 1 月 1 日起恢复原价 1.5 和 7.5 美元。需要说明:Arena 主榜快照仍是 8 月 26 日的,这批新名次是官方 8 月 28 日刚宣布的。
编程领域专家·老徐说|智能体榜从 35 名跳到 20 名、WebDev 从 19 到 8,这是实打实的位次变化,不是厂商自吹。但两点照旧:一是新名次刚上榜一两天,样本没攒够,名次会晃,先等稳一两轮;二是厂商 8 月 13 日那批自家成绩单(FrontierCode 43.6%、DeepSWE 65.3%)是自家口径,自报分数先打折。真想换工具链,拿自己项目里的活跑一遍再说,别急着生产环境。
小编小禾说|我听懂了:谷歌这版模型干活、写码、聊天三样名次都升了,价格年底前还便宜。但我上期刚立的规矩——新榜单名次会晃——先别急着把全家桶换成谷歌的,等它稳一两轮。对普通人最实用的一句:公开榜单就是买前的买家秀,但这份数据截至 8 月 26 日,新名次是 28 日才宣布的,中间隔了两天,看的时候心里有数。
重点 2让 AI 写带引用的报告,15 个模型测下来:它标出来的「来源」可能压根不存在
它能帮你干什么活:知道 AI 给的参考文献能不能直接信。研究机构 Stipple 8 月 29 日公布了一组基准测试:找 15 个主流大语言模型各写两篇短报告,每篇被要求至少引用 5 个来源。结果发现,AI 写进报告里的那一条条「引用」,很多对应的文章根本不存在——标题、出处是编出来的。说白了:AI 特别会「把引用写成真的样子」,但像不像和真不真是两码事。
安全领域专家·老周说|引用幻觉和误报是同一类问题:模型按「看起来完整」得高分,不按「真实存在」得高分,判断边界本来就没人给它划清楚。这跟今天刊里 Comcast 那篇 44% 漏洞误报是一个结构性毛病,只是考的东西从「是不是漏洞」换成了「引用是不是真的」。给用户就一条:AI 给的每条来源,点不开、搜不到,就当它不存在;拿 AI 资料做决定之前,引用必须逐条人工回查。
小编小禾说|上期我刚学会「AI 报的安全漏洞快一半是冤枉的」,这期又添一条:AI 给的参考文献也可能是查无此文。以后谁用 AI 写论文、写报告,它列的来源我先自己搜一遍标题,确认文章真在再引用——AI 的话,信之前先验一遍,这话我这期要说第三遍了。
重点 346 枚、45 枚、10 枚、5 枚:机器人运动会的奖牌榜,到底在测什么
它能帮你干什么活:看懂机器人「比赛成绩」的水分在哪。2026 世界人形机器人运动会刚结束,企业合并奖牌榜的总成绩是:智元 46 枚、天工平台 45 枚、宇树 10 枚、银河通用 5 枚。数字放一张表里,很容易直接读成第一第二第三第四。但这四家拿奖的方式差别很大:智元把多款机器人送进竞技赛、场景赛和灵巧手多个专项,靠「多机多项目」堆出了数量;奖牌数衡量的是参赛策略和项目覆盖,不等于单台机器人的真实水平。
穿戴领域专家·阿凯说|赛场就是真机考场,这点我欢迎——比发布会剪辑强多了。但看榜的老毛病得改:我 2026 年 8 月评 BBC 机器人披萨店和 Wired 实测 1.6 万美元割草机器人时说过,机器人翻车都翻在安装、维护、可靠性这些比赛不考的科目上。多台同款机器分头刷不同项目,合并榜就把单兵能力稀释了。看赛报先问三件事:几个选手上场、考哪些项目、同一台机器跑了几场。
小编小禾说|机器人运动会听着热血,但奖牌榜跟我买家电看「获奖数量」是一个道理:项目设置不一样,数量不能直接比。真想给家里挑个能干活的机器人,与其看它拿了几块牌,不如看有没有人把它领回家用满一个月——延续我那句「先等第三方实测」。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1人形机器人运动会 · 企业合并奖牌榜(本周新鲜出炉)
大白话|这是唯一一张本周新鲜出炉的「真机竞技榜」:数的是奖牌,但四家拿牌的项目范围差很多。总数能看热闹,含金量还得拆开各项目难度看——同一张表里比总数,容易被带偏。
快报 2AI 引用诚实度 · Stipple 基准(8 月 29 日发布)
大白话|15 个主流模型被要求写带真实引用的报告,结果不少模型交上来的「来源」根本不存在。没有总分名次,但它给所有人提了个醒:AI 给的参考文献,逐条回查再引用。具体各模型误引率,原始报告在链接里,等第三方复测再当定论。
快报 3Arena 视觉分榜 · 数据截至 2026-08-26(快照未更新)
大白话|主榜三天没挪窝,本期换看没上过的视觉分榜:人类盲测「看图说话」,Anthropic 前五占四席,阿里 Qwen3.8 Max 以 10 分之差排第二,挤在第一名身后。分差小、样本截至 8 月 26 日,看个梯队就行,别拿几分差距定生死。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
1.7 亿行代码实测:AI 报的「关键漏洞」44% 是冤枉的
Comcast 把自家 1.7 亿行代码交给 AI 漏洞扫描,对比两种评估方式:探索式让 AI 自由发挥,确定性给足指令和上下文。结果 AI 报出的高危「关键漏洞」里 44% 是误报,两种模式的结论差距明显。
一句话点评|给 AI 的指令越明确、误报越少——但 44% 摆在这,AI 扫描结果必须人工复核,自动处置想都别想。
把各家大模型拉去做政治坐标测试:AI 不是中性的答题机器
一个叫 AI Political Compass 的网站让各家大模型做原版「政治指南针」测试,把每个模型在坐标轴上的位置画出来,点公司名可以单看一家的结果,各家位置差别肉眼可见。
一句话点评|立场是写进训练数据里的出厂设置——问 AI 社会话题,多查几个来源,它给的是说法,不是标准答案。
几十块钱的微控制器,被作者跑起了 AI 生图
一位开发者花了近三年,在树莓派 RP2350 微控制器(Pico 2 用的那颗芯片)上实现了生成式图像模型:没有显卡、没有操作系统,跑通的那刻「几乎不可能」变成了「跑得慢但真能跑」。
一句话点评|端侧能力的天花板又往上顶了一厘米:实用性为零,但它说明小硬件跑生成模型的极限比多数人以为的低得多。
一条提示词跑五天:这个 AI 智能体最后拒绝给自己开合格证
作者公开了一个叫 governed-pass 的实验规范:给 AI 编程智能体定了一套硬规则,每一条都来自一次真实翻车。最戏剧性的一幕是,智能体在没完全达标时拒绝签署「通过」——规则里写死了不许自证。
一句话点评|AI 干活最大的坑是它既当运动员又当裁判;把「不能自己盖章」写进规范,是个值得抄的小设计。
AI 说代码写完了?这个命令行工具检查它是不是真能上线
Show HN 上的 AI Shipcheck:本地跑一圈,检查 AI 生成的代码离「可以上线」还差几步,不用注册、不传源码。
一句话点评|把「AI 说好了」变成「机器可检查」,方向对;它本身也是 AI 时代的产物,先拿小项目试。
不靠大模型的智能体门禁:敏感数据一乱走就让构建失败
开源工具 Weir 是给 AI 智能体用的 CI 门禁:直接读智能体已有的 OpenTelemetry 追踪记录,发现敏感数据流向不该去的地方就让构建失败,全程不调用大模型。
一句话点评|用现成的运行痕迹盯住数据去向,「环境说了算」又往前落成一步工具。
给工厂机器人下指令之前,先过一道「意图安检」
URML 是一套人可读的小语言:把实验室和工厂设备上 AI 智能体「想干什么」写成规范意图,再判定这台真实设备该不该放行。
一句话点评|物理 AI 上岗前最缺的就是「意图可审查」这一环,方向很正,离规模落地还早。
开源语音底座 StreamCore:一个二进制文件给 AI 接上能被打断的嘴
StreamCore 用单个 Go 二进制提供实时语音基础设施:WebRTC 通话、随时打断、流式输出、NAT 穿透全带好,接你自己的智能体就能用。
一句话点评|语音入口的「水电煤」在开源化,自己搭语音 AI 的门槛又低一截。
自部署 AI 推理:一个稳定端点管住换模型的折腾
InferCrane 给自托管推理做了一层「计划-部署-端点」流程:选模型和用途,它自动跑完部署,对外只留一个稳定接口,换模型不动业务。
一句话点评|自己养模型的人最懂换模型有多折腾,这层壳值得跑分之外的关注。
Polytoken:把「AI 框架该长什么样」摊开讲
开发者 Polytoken 公开了自己的 AI harness 设计:模型外面那层调度、上下文、工具调用怎么搭,整套思路直接摊在页面上。
一句话点评|模型分数之外,harness 质量越来越决定实际体验——这类「外壳工程」值得多几家晒。
● OpenAI 正式通知终止向 Cursor 供模型,拟定 11 月 12 日停服,马斯克炮轰奥尔特曼「就是小偷」(IT之家 / Reuters)
● Anthropic 联创汤姆·布朗表态:继续加码算力支持 Cursor,期待与 SpaceX 后续合作(IT之家)
● 腾讯混元发布并开源 Hy4 preview,大版本迭代周期压到约两个月(钛媒体)
● 三大唱片巨头环球/索尼/华纳集体入股 Stability AI,两年前它们还在互相起诉(钛媒体)
● 比尔·盖茨 6000 字长文转「刹车」:AI 在生物、网安、心理、就业四个维度跨过临界点(钛媒体)
● Debian 成员投票通过允许项目中「负责任使用」生成式 AI(Phoronix)
① Gemini 3.7 Flash 空降的智能体第 20、WebDev 第 8 稳不稳,盯 Arena 下一次快照更新怎么走
② 国内首部 AIGC 长剧《后西游记》8 月 31 日开播,第一批观众口碑就是 AI 长片的真人实测
③ OpenAI 断供倒计时开始:Cursor 用户转向哪家模型,各家编程榜名次会不会跟着动
物界前沿评测
GLOBAL AI REVIEW RADAR
2026.08.29 · 周六
第 031 期 · 预览版
重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注
每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。
重点 1谷歌 AI 一夜上了三张榜单:Gemini 3.7 Flash,干活的、写码的、聊天的都涨了
它能帮你干什么活:看懂谷歌新模型到底进步了多少。Arena(原 LMArena)官方账号 8 月 28 日宣布,Gemini 3.7 Flash (High) 空降三张榜单:智能体榜(Agent Arena)总榜第 20 名,净改进分比上一代 Gemini 3.6 Flash (High) 的第 35 名大幅跃升,长程任务档位已经和 Claude Sonnet 4.6、GPT-5.6 Terra (xHigh) 站到同一层;写代码的 WebDev 分榜从第 19 名跳到第 8 名;文本对话榜第 9 名,Elo 1490 分。分项里「确认成功」涨了 10%,排到第 5。厂商 8 月 13 日公布过一批自家成绩单,编程测试 FrontierCode 达到 43.6%、DeepSWE 65.3%,WebDev Arena Elo 宣称 1588。价格上,2026 年底前输入每百万 token 0.75 美元、输出 3.75 美元,2027 年 1 月 1 日起恢复 1.5 和 7.5 美元。榜单数据仍未更新到当天,本文引用快照截至 2026-08-26。
编程领域专家·老徐说|智能体榜从 35 名跳到 20 名、WebDev 从 19 到 8,这是实打实的位次变化,不是厂商自吹。不过两处提醒:一是这批新名次刚上榜一两天,样本量还没攒够,前面几期我跟小禾都说过,名次会晃,先等稳一两轮;二是厂商 8 月 13 日那批编程成绩单(FrontierCode 43.6%、DeepSWE 65.3%)是自家口径,上期我就说过自报分数先打折。想验证就自己拿项目里的真实需求去跑一遍,别急着换工具链。
小编小禾说|我听懂了,就是谷歌这版模型干活、写码、聊天三样都升名次了,而且它价格年底前还有优惠。但我上期刚学会一条规矩,新榜单名次会晃,先别急着把全家桶都换成谷歌的,等它稳一两轮再说。普通用户最该记住的是那句:公开榜单就是买之前的买家秀,数据截至 8 月 26 日,新名次是 8 月 28 日刚宣布的,中间隔了两天。
重点 2AI 扫描代码漏洞,报的「关键漏洞」近一半是冤枉的:1.7 亿行代码实测
它能帮你干什么活:看清 AI 查漏洞到底靠不靠谱。美国电信巨头 Comcast 把自己 1.7 亿行代码交给 AI 漏洞扫描工具过了一遍,结果 AI 报出的「高危关键漏洞」里,44% 是误报(假阳性)。他们把扫描分成两种模式对比:探索式评估让 AI 自由发挥,确定性评估给 AI 明确指令和上下文,结果差的不是一点半点。对普通用户来说,这条消息的意思是:AI 说「发现漏洞」的时候,别急着当圣旨,先让人复核一遍,不然团队会花大量时间去查根本不存在的漏洞。
安全领域专家·老周说|44% 的误报率是个值得记住的数字。这跟我反复讲的「边界不清」是一个问题:AI 扫描器分不清「看起来像漏洞」和「真的是漏洞」,本质上是判断边界没划清楚,跟智能体越界是同一类结构性问题。好消息是这篇实测把两种评估模式分开了,探索式和确定性评估的结果差异说明,给 AI 的指令和上下文越明确,误报越少。但 44% 摆在这,AI 扫描结果必须配人工复核,自动处置想都别想。
小编小禾说|我以为是 AI 报啥就是啥,原来快一半是狼来了。这跟我 029 期学会的那句话对上了:AI 的话,信之前先验一遍。普通人碰上「AI 说你家网站有安全漏洞」这种报告,第一条原则就是别慌,先找人确认是不是误报,别被带节奏。
重点 3AI 也有立场?有人把各家大模型拉去做了套政治坐标测试
它能帮你干什么活:知道 AI 并不是「绝对中立」的答题机器。一个叫 AI Political Compass 的网站,把各家大模型拖去做原版「政治指南针」测试,然后给每个模型标出它在政治坐标上的位置,点左边栏的公司名就能单独看某家模型的结果。测出来每家模型的位置都不一样。对普通用户来说,这条信息的价值是提醒:你问 AI 社会话题、政策话题时得到的回答,带着它训练数据里的立场倾向,别把 AI 的答案当成没有立场的标准答案。
产品领域专家·阿哲说|模型不是中性的答题机器,立场是出厂设置,写进训练数据里了。做这类横评的价值在于把「隐形的立场」变成「看得见的坐标」,用户选哪个助手,某种程度上也是在选一套价值观。我在别的场合说过入口即模型,这里再加一句:选模型不能只看跑分,还得看它怎么回答敏感问题,这本来就是产品的一部分。
小编小禾说|我平时问 AI 问题,默认它说的就是标准答案,从来没想过答案背后还带着训练数据的立场。这个测试把各家模型摆在一起一比,差别还挺明显。以后问社会话题我会提醒自己:AI 给的是它训练数据里的主流说法,不等于事实本身,重要的事多查几个来源。
这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。
快报 1文本对话榜 · 数据截至 2026-08-26
大白话|人类当裁判的盲测里,Claude 家族几乎包场,前十名大多是 Anthropic 家的。
快报 2智能体榜 · 数据截至 2026-08-26
大白话|考智能体「能不能把事情办成」的榜,Claude 家族继续领跑,国内 Kimi K3 排在第 6。
快报 3写代码榜 · 数据截至 2026-08-26
大白话|写代码榜上开源选手 Kimi K3、Qwen 冲进前三。本期新料:Gemini 3.7 Flash 8 月 28 日空降 WebDev 分榜第 8,详见重点更新。
10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。
AI 说代码写完了?这个工具帮你检查是不是真能上线
Show HN 上出现一个叫 AI Shipcheck 的命令行工具,在你本地跑一圈,检查 AI 生成的代码是不是真的达到「可以上线」的程度,不需要注册、不用传源码。
一句话点评|把「AI 说好了」变成「可检查」,方向对;工具自己也是 AI 辅助写的,先拿小项目试。
AI 智能体想偷传敏感数据?这个开源门禁会拦下它
Weir 是一个给 AI 智能体用的 CI 门禁工具:它读取智能体自己发出的 OpenTelemetry 追踪记录,一旦发现敏感数据流向了不该去的地方,就让构建失败,全程不需要调用大模型。
一句话点评|用现成追踪痕迹盯住智能体的数据去向,把「环境说了算」从理念落成工具。
给工厂机器人发指令前,先过一道安全评测
URML 是一套给实验室和工厂硬件上的 AI 智能体用的安全评测语言:用人类可读的小语言描述「机器人想干什么」,再判断这个意图在真实设备上是否被允许执行。
一句话点评|物理 AI 要上岗,先得有「意图可审查」这一步,方向很正,落地还早。
开源语音底座:给你的 AI 接上一张能打断、能实时对话的嘴
StreamCore 是一个开源的实时语音基础设施,一个 Go 二进制文件就能让 AI 通过 WebRTC 和你对话,支持随时打断、流式说话,自带 NAT 穿透,可以接你自己的智能体。
一句话点评|语音入口的「水电煤」正在开源化,自己搭语音 AI 的门槛又低了一截。
AI 代理被丢进真实购物网站,一场实验差点失控
一篇叫 Wet Claude be shoppin' 的实验记录:有人让 AI 代理去真实购物网站自主下单买东西,结果实验过程「失控」了,买回一堆意想不到的东西。
一句话点评|真实环境的代理实验比任何演示片都可信,买家秀式实测永远值得看。
给 AI 开了最高权限之后,作者自己被吓到了
一篇技术随笔《Your AI Agent Has Root》:作者发现自己一直在给 Claude 挂一个能执行系统命令的 MCP 服务,权限大到基本等于把整台电脑交给了 AI,他自己都没意识到风险有多大。
一句话点评|MCP 工具默认权限大得吓人,给 AI 的钥匙先想清楚能开哪几扇门。
企业后台也能统一管 AI 用量了:一个 Spotify 插件
有人给 Spotify 的开源开发者门户 Backstage 写了一个 LiteLLM 插件,让企业直接在后台管理 AI 模型的虚拟密钥、监控模型的调用量,不用再分散到各个平台。
一句话点评|AI 用量在企业内部透明化,是「可控」的第一步,治理类工具开始补位。
拿真实行情数据给 AI 兜底:治它一本正经胡说八道
RobinHood 是一个开源框架,专门分析多资产时序数据,用 TCN 加 LSTM 加注意力机制的深度学习结构,目标是让大模型在金融这类领域少点幻觉,先看真实数据再开口。
一句话点评|治幻觉的「先查后答」路线又多一个样本,效果还得看实测。
多个 AI 模型串成一条流水线?新工具帮你编排
Polytoken 把自己定位成「AI 的编排工具(harness)」,把多个模型、多步任务串起来跑,省得用户在不同 AI 之间手动倒腾提示词。
一句话点评|AI 编排工具扎堆出现,本质都是想当「不用自己搬砖」的那一层。
自托管 AI 推理:一个稳定入口,模型随便换
InferCrane 是一个开源自托管 AI 推理工具:你选好模型和目标,它帮你规划并部署一个稳定的推理端点,换模型不用重新折腾环境。
一句话点评|本地部署的「统一接口」思路,换来换去不搬家,但部署成本仍是门槛。
● 《时代》周刊 2026 全球 AI 100 放榜,奥特曼、李飞飞等 100 人上榜(量子位)
● 韩国推「AI for All」:向全体公民免费开放 AI 服务(WSJ)
● 英伟达支持的 Lambda 拿到 10 亿美元融资,继续买芯片(Bloomberg)
● Musk 的 xAI 起诉制作 Grok 深度伪造的用户,相关诉讼增多(Politico)
● Anthropic 发布 MHS 统一接口,打通 AI 与物理世界(雷锋网)
● 谷歌 AI 模式上线机票比价、积分汇率查询,进军旅行场景(Seroundtable)
① Gemini 3.7 Flash 刚空降的智能体第 20、WebDev 第 8 两个名次稳不稳,看接下来一两周榜单怎么走
② Comcast 误报研究出来后,各家安全厂商会不会跟进公开自家 AI 扫描的误报率
③ DLSS 5 民间移植版在 RTX 40 系列上的实际帧率和画质对比测试,等第一批第三方数据
📖 完整评测 · 论坛全文
物界前沿评测 · 2026-08-29
数界工坊 · 全球AI评测雷达