物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.12 · 周六

第 045 期

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1AI 替你点鼠标的考试出了 90.2% 的新高分,但「能替你删文件」才是重点

它能帮你干什么活:OSWorld 是让 AI 智能体在真实电脑里完成开软件、发邮件、做表格这类任务的公开考卷。本周国产实在 Agent 拿下 90.2% 的登顶成绩,意味着「AI 当你的电脑操作员」从演示视频往日常可用又近了一步。但名次之外更该看边界:一个能替你点鼠标的 AI,同样能替你删文件、替你点确认。

安全领域专家·老周说|能力第一层看名次,第二层看边界。以后挑这类「会用电脑」的 AI,我加了两条硬标准:每一步操作有没有日志记录、权限能不能一键收回。答不上来这两条的,跑分再高也先放一放。90.2% 是公开考卷,但考场环境和判分口径还要等第三方翻一遍。

小编小禾说|上次我说公开考卷要等真人复现再装我工作机,今天还是这句话。让它操作我电脑之前,先想清楚它能看到什么账号——延续「别急着授权」,这条在新高分面前更重要了。

来源:OSWorld / Hacker News(2026-09-11)

重点 2浏览器里写完粗糙想法,Jot 一键改成能直接发的成稿

它能帮你干什么活:一个 Chrome 扩展,定位是「随手写、放心发」——把粗糙的想法、半截话,一键改写成回复、评论、帖子和公告这几类现成文体,不用先开聊天框粘贴来回。对普通人的意义是:AI 改稿正在从「独立工具」变成「输入框旁边的默认能力」,写邮件回、论坛回帖这类高频小写作最吃这个。

编程领域专家·老徐说|这类轻量改稿插件的护城河很浅,大厂浏览器随时能抄。我感兴趣的点恰恰是它不做通用聊天、只押「回帖/公告」这几个窄文体——窄任务上提示词工程能省掉大量幻觉空间,这是小团队打通用模型的合理姿势。

小编小禾说|我的体验是:越是三五行的小回复越不想自己组织语言,这类工具比开大模型窗口省事。但发正式公告我还会自己过一遍,AI 润色容易把话说得太圆,丢了原来的语气。

来源:Chrome Web Store(Hacker News)(2026-09-12)

重点 3不联网也能替你干活的安卓端侧 AI 管家开源了,终端、浏览器、SSH 都能碰

它能帮你干什么活:Aiope 是一个跑在手机本地的 AI 智能体,能直接操作终端、开浏览器、连 SSH、接 MCP 工具——断网也能替你执行任务,不用把数据传去云端。端侧 AI 从「聊天不笨」卷到了「真能干活」, privacy 敏感和没网场景(出差、地下室、机房)是第一受益方。

产品领域专家·阿哲说|入口即模型,这个判断在端侧重演:谁能离线替你干活,谁就占住手机里更深的一层入口。但一个能 SSH、能开浏览器的本地智能体,等于把整台手机的操作权交给一个跑分没人验过的小模型——品类逻辑成立,安全边界还没跟上。

小编小禾说|延续 017 期我说过的话:断网能用是刚需,就怕本地版偷偷换小脑子变笨。这东西开源是好事,等有人拿它真跑一周任务、翻车清单公开了,我再考虑装在备用机上试。

来源:GitHub / Hacker News(2026-09-12)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1文本盲测榜 · Claude 家族包场前四

#模型厂商Elo 分对战数
1Claude Fable 5Anthropic150629683 场
2Claude Opus 4.6 (High)Anthropic150571992 场
3Claude Opus 4.7 (High)Anthropic150259992 场
4Claude Fable 5.1 (Max)Anthropic15015447 场
5Muse Spark 1.2 (xHigh)Meta14993229 场

大白话|人类盲测(谁回答得好由真人投票)前四全是 Anthropic 的 Claude,几乎包场。值得注意的是第 4、5 名对战数只有五六千场,比前三薄一个量级,置信区间宽,名次先记账不入结论。快照日期 9 月 11 日。

快报 2代码榜 · GPT-6 Astra 登顶但样本最薄

#模型厂商Elo 分对战数
1GPT-6 Astra (Max)OpenAI18002281 场
2Claude Fable 5.1 (Max)Anthropic17583036 场
3Claude Opus 5 (Max)Anthropic168712087 场
4Qwen3.8-Max-0902阿里16812262 场
5Kimi K3 (Max)月之暗面16744547 场

大白话|写代码榜上 GPT-6 Astra 以 1800 分居首,但只打了 2281 场,比第 3 名样本少八成——空降榜首的老剧本,先等它把对战数攒到一万再谈「最强」。亮点是阿里 Qwen 两款、Kimi K3 挤进前五,国产编程模型在第三方盲测里的席位是实打实的。

快报 3智能体榜 · 六维成绩单,国产占两席前十

#模型厂商净增益工具幻觉率
1Claude Fable 5.1 (Max)Anthropic13.850.37
2GPT-6 Astra (Max)OpenAI12.390.38
8Kimi K3 (Max)月之暗面6.460.38
10Hy4 preview腾讯5.230.25

大白话|智能体榜按六个维度打分(净增益、任务确认成功、好差评、可引导性、命令出错恢复、工具幻觉)。前十 Anthropic 独占六席;腾讯 Hy4 preview 的「工具幻觉率」0.25 是前十最低——乱调工具的次数最少,这项比总分更值得干活的人关注。视觉榜自 8 月 27 日后暂未更新,本期不引用。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

Show HN 上的 Sharpniq:失焦废片在线变清晰,主打一个不用装软件

一个网页端 AI 图像修复工具,专治手抖和跑焦:拍糊的人像、失焦的旧照片,拖进网页就能出一版更清晰的对照结果,不用下载不用注册。

一句话点评|「unblur」这类单点图像修复早已卷成红海,值得看的是它把处理放在浏览器端还是服务端——端侧跑意味着隐私卖点,值得拿敏感照片实测一轮。

来源:Hacker News / Show HN(2026-09-12)

AI 会不会把编程新手教废?三位教授在 CACM 交了讨论卷

Brown 大学三位资深教授在Communications of the ACM发文讨论智能体 AI 时代的入门编程教育:当 AI 能直接给出能跑的代码,新手还练不练基本功?他们给了一套「让 AI 当陪练不当枪手」的课程设计。

一句话点评|评测的不只是模型,还有「用模型的人」会不会被养废——这篇给所有拿 AI 自学编程的人划了条能力底线。

来源:CACM / Hacker News(2026-09-12)

AI 误报「这是恶意软件」,百万用户浏览器扩展被官方下架

一款拥有 100 万以上活跃用户的 Chrome 扩展被自动化恶意检测误判下架:检测方的 AI 产生了幻觉,把正常行为读成了恶意特征,作者申诉数日才恢复。整个过程没有任何人工复核环节先行。

一句话点评|AI 当裁判误伤普通人的又一实锤——延续老周立场「AI 报警先找人确认再慌」,这次是官方自己先慌了用户。

来源:Chromium Extensions 论坛 / Hacker News(2026-09-11)

「AI 软件工厂」实操手册:智能体自己开 PR、自己审、自己合

Firecrawl 工程师写了篇长文拆解怎么用 AI 智能体搭一条软件流水线:开 issue、写代码、评审、合并全程自动,人只在关键节点点头。文中给出了具体的提示词、护栏配置和翻车清单。

一句话点评|024 期「AI 产量上去验证必须跟上」的正经工业版答案——先搭验证闸门再放智能体进仓库,顺序不能反。

来源:Firecrawl 博客 / Hacker News(2026-09-11)

同一道题,五个杂牌 AI 互相挑错,比五个同款 AI 自我复查更靠谱

一位开发者连续 14 晚做对照实验:让五个不同厂家的 AI 组互查任务产出,对比五个同款模型自我复查。结果显示跨厂商互查更早发现问题、更难互相糊弄,但成本和沟通开销也更高。

一句话点评|「问两家 AI 对答案」这个土办法第一次有了 14 天的实验草图——自己出题自己记分,先记进方法清单,不换工作流。

来源:jock.pl / Hacker News(2026-09-11)

把多家顶级模型装进一个「对喷」闸门,AI 智能体动手前先过安检

Show HN 的 EthersFlow 是个 MCP 服务:AI 智能体要执行关键动作前,先让多个模型对这一步做对抗式共识评审,多数通过才放行。思路是给智能体的「手」加一道模型间的互相否决权。

一句话点评|用模型监督模型落地成了工具雏形,但多模型一致也可能是集体跑偏——和「权限设到最小」搭着用才稳。

来源:Show HN(2026-09-12)

陶哲轩 AI 观点长访谈上线:给 AI 做数学研究的能力逐项划线

菲尔兹奖得主陶哲轩的 AI 观点访谈原文今天挂上个人网站(2026 年 7 月对话记录、未再修订):他逐项评估 AI 在数学研究里的真实水平——文献整理和形式化验证帮得上忙、提出新问题仍然指望不上,并点名「拿 AI 暴力刷题出成果」正在让数学社区重新审视评价方式。

一句话点评|顶级数学家亲自给 AI 能力做的「分项评测」,比跑分榜更能看清 AI 哪行哪不行。对话录于 7 月,读时注意这之后的进展没算进去。

来源:teorth.github.io / Hacker News(2026-09-12)

给 AI 编程智能体画「建筑图纸」的开源工具 Viaduct 上线

Viaduct 用 C4 模型把系统的架构关系画成机器可读的图,接成 MCP 服务后,AI 编程智能体改代码前先「看懂」模块之间谁调用谁,而不是对着文件盲改。

一句话点评|和 041 期代码地图同路数:智能体改大项目瞎在缺全局关系。工具方向对,无公开基准,等第三方复测。

来源:Show HN(2026-09-12)

同一个模型、温度拧到最低,AI 做多步任务照样每次答案不一样

一篇 Medium 技术文复现了一个反直觉现象:把 temperature 调到 0,AI 智能体在多步任务里仍然会分叉出不同结果——因为缓存、批处理、浮点顺序都在引入随机。结论:多步智能体的输出一致性,光靠「调稳」旋钮不够。

一句话点评|「看心情」不怪你的又一实锤:重要活儿让它跑两遍对答案,对不上就当没说过——延续「AI 的话信之前先验一遍」。

来源:Medium / Hacker News(2026-09-11)

一个只收 AI 新闻的「反向 Hacker News」上线了

Show HN 项目 allslop.news 专挑全网 AI 生成的新闻和帖子聚合展示,和「HN 去掉 AI 内容」的潮流对着干,用「含 AI 量 100%」做了一个黑色幽默实验场。

一句话点评|看乐子之余是个真人检测器练习场:全是 AI 写的信息流,你能一眼揪出几条?反正检测器自己都会误判。

来源:Show HN(2026-09-11)

大家都在看 · HOT

●  Qwen3.8-Max 两款版本挤进 Arena 代码榜前六(快照 9-11,样本仍偏薄)(Arena.ai)

●  Mammouth 每月 10 欧打包多家顶级模型:聚合入口价格战开打,缩水与否先拿自家活验收(Mammouth AI)

●  Project NOPE 上线「人机关系天文台」,收录分析人与 AI 的长期对话样本(nope.net)

●  AI 绘本「身体恐怖版」实验:同一套提示词生成的儿童画风插图千篇一律,一眼可辨(coredump 博客)

●  TechRadar 调查:教师群体担心 AI 进课堂的速度快过他们的管控能力(TechRadar)

●  Show HN: Socratix 苏格拉底式提问 AI 上线,只反问不代答(Hacker News)

●  Toolcraft 开源:给设计类 AI 应用做脚手架的起步套件(GitHub)

明日关注 · TOMORROW

①  华为乾崑智驾 ADS 5 Pro 明日全量 OTA 上车华境汽车,留意第一批真实路测反馈(IT之家,9-12)

②  Arena 代码榜 GPT-6 Astra 对战数仅 2281 场,盯它这两天样本涨到多少、名次还稳不稳(Arena.ai)

③  Kimi K2.8 Preview 百万上下文全员开放刚过一天,等第三方跑长文档任务的实际表现再下结论(量子位,9-11)

—— 以下为早上预览版 ——

物界前沿评测

GLOBAL AI REVIEW RADAR

2026.09.12 · 周六

第 045 期 · 预览版

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1AI 学会用电脑干活?中国团队在一场「真电脑考试」里考了第一

它能帮你干什么活:OSWorld 是高校团队出的考卷,专门测 AI 操作真实电脑的能力,一共 369 个任务,全是普通人电脑上会干的活,开软件、写文档、发邮件、跨程序传文件。成绩看成功率,就是 369 道题做对多少。9 月 10 日更新的官方总榜上,中国团队实在 Agent 以 90.2% 排第一,把 Anthropic 等一帮巨头甩在身后。这离「你说一句、AI 替你操作电脑干完」的日常场景又近了一步。

安全领域专家·老周说|AI 敢碰你的电脑,考试名次只是第一层。我关心的是边界:一个能替你点鼠标敲键盘的 AI,就能替你删文件、登账号。041 期七模型自治公司那件事我说过,钥匙别整串交给 AI。以后挑这类工具,先问它拿到权限后每一步有没有记录、能不能一键收回,答不上来的,名次再高也先放一放。

小编小禾说|90% 这个数我第一反应是不敢信,上个月还看 AI 连网页表单都填不利索。OSWorld 好歹是公开考卷、判分程序也公开,比厂商自家演示可信一档。延续我的老规矩,等有人拿自家电脑真装一遍复现再说,别急着让它碰我工作机。

来源:OSWorld 官方榜(xlang.ai,统计截至 2026-09-10)(2026-09-10)

重点 2同一个 AI 问两遍答案不一样?有人把「不许出错」的活儿翻车现场盘了一遍

它能帮你干什么活:大家默认把 AI 的随机旋钮(技术人员叫 temperature,调到 0 意思是「照最稳的答」)拧到最低,它就该每次答一样。这篇 Hacker News 讨论实测:即便如此,让 AI 连续干同一件多步骤的活,几次结果照样对不上。写周报无所谓,可报税、发通知、批量改数据这类活,差一个字就出事。讨论里给出的土办法:关键步骤自动跑两遍对账,两遍结果不一致就拦下来人工看。

编程领域专家·老徐说|034 期 n8n 模板被智能体静默清空那次,我说过「AI 提交必看改动清单再合并」,这篇是同一个问题的另一半:你以为拧到最稳它就不会变,它照样变。多跑一遍做比对这招我认,代价是多花一倍时间和钱。选活的标准不变:丢了不心疼的先交给它全自动,碰钱碰数据的,比对这步省不得。

小编小禾说|我终于知道自己为啥总觉得 AI「看心情」了,原来真不怪我。以后重要的东西我让它跑两遍,答案对不上就当它没说过。也提醒跟我一样的小白:别拿「它刚才答对过」当它每次都对的证据,对不上号的,都是没比对过。

来源:Hacker News(2026-09-12)

重点 314 个晚上、五个「分身」对五个「杂牌军」:AI 组队干活实验测出反直觉结果

它能帮你干什么活:一个独立实验搭了十四个晚上的对照,一边让五个一模一样的 AI 组队干活,一边让五个不同脾气、不同路子的 AI 组队,每天记录它们干活、争论、复盘。最后两条线各自锁住了一个共同点:五个克隆靠统一口径取胜,五个杂牌靠互相挑错取胜。对普通人的意义是,用 AI 干复杂的活,一次只叫一个,还是拉一桌不一样的,从此可以挑了。

产品领域专家·阿哲说|036 期我写过「AI 替我验好的结论本身是造的」,这个实验给解药画了个草图:不同来路的 AI 互相挑错,比同一个 AI 自我复查难糊弄,因为它们的毛病不重样。但设计者自己出题自己记分,样本就十四个晚上,先把「组一桌杂牌」记进方法清单,别急着为它换掉现在的工作流。

小编小禾说|我早就这么土法用着了,同一问题问两家 AI 对答案,对不上就都别信。这个实验等于给我这种笨办法补了个名堂。十四个晚上的样本,比大厂评测薄得多,结论我打折收着,办法照用。

来源:Hacker News(Substack 实验记录)(2026-09-11)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1快报 1|AI 操作电脑榜 · OSWorld 官方总榜(统计截至 9 月 10 日)

#系统团队成功率
1实在 Agent实在智能90.2%
2claude-fable-5[1m]Anthropic86.0%
3Pointer Agent w/ Opus 4.7Pointer83.6%

大白话|OSWorld 让 AI 像人一样操作真实电脑做 369 个日常任务,成功率就是做对的比例,通俗讲是「让 AI 像人一样用电脑干活」的考试。实在 Agent 第一,把 Anthropic 甩开 4 个百分点。这份榜统计截至 9 月 10 日,是近两天刚更新的数据。判分程序公开可查,成绩比厂商自报硬,但考场环境由主办方统一,等别人拿自己电脑复跑之前,名次先记账。

快报 2快报 2|干活考试新面孔 · Arena 智能体盲测前十的国产席位(快照 9 月 10 日)

#模型厂商看点
1Kimi K3 (Max)月之暗面前十里干活成功率第二高的国产模型
2Hy4 preview腾讯前十唯一的国产新开放模型
3GPT 6 Astra (Max)OpenAI前十里 Anthropic 之外最强对手

大白话|「智能体盲测」就是让人当裁判、看两个 AI 干活投票选强弱。本期 Arena 快照没更新(数据截至 9 月 10 日),上期已展开总榜,这次只切一个面:干活榜前十被 Anthropic 占了六席,OpenAI 两席,剩下两席是国产模型,月之暗面 Kimi K3 排第 8、腾讯新开放的 Hy4 preview 排第 10。Kimi K3 的「确认办成事」率 15.4%,在前十里仅次于头名。国产选手在干活类考试挤进前十的样本还不多,先记名字,看下一批快照名次坐不坐得稳。

快报 3快报 3|人类盲测切片 · Arena 文本与代码榜速览(快照 9 月 10 日)

#榜头名第二第三
1文本盲测claude-fable-5 (1507)claude-opus-4-6-high (1505)claude-fable-5.1-max (1504)
2代码盲测gpt-6-astra-max (1796)claude-fable-5.1-max (1764)claude-opus-5-max (1688)

大白话|文本盲测前五里四席是 Anthropic 家 Claude,第 5 是 Meta Muse Spark 1.2;第 3 名只攒了 2906 场人机对战,样本比第 2 名的 72099 场薄二十多倍,名次还会晃。代码榜头名 GPT-6 Astra 只有 1810 场对战,积分上下能浮动 19 分,足够跟第 4 名阿里 qwen3.8-max 互换座位,当参考别当结论。括号里是积分,算法类似象棋等级分,两个 AI 盲打、真人投票。

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

一个 AI 学习工具说:别刷教程了,来考试

Show HN 上发布的 Socratix 打的是「教程地狱」:它不给你推视频,而是先给你搭一张知识图谱,然后逼你动手做题、验证你真的理解了才算过关。定位是「掌握知识,而不是看完视频」。这类工具最近的共同点是:把 AI 从「替你学」翻转成「考你学」。

一句话点评|看会不等于会做,这类「AI 考官」产品的价值,得等用户留存数据说话。

来源:Hacker News(2026-09-12)

有人做了个「只有 AI 新闻」的 Hacker News,专收 AI 生成的帖子

allslop.news 反着来:HN 上有人在赶走 AI 水帖,这个站只留 AI 生成内容,自动抓取、自动标注。点进去能直观看到 AI 写作的一眼假,句式雷同、情绪饱满、内容空洞。

一句话点评|辨别 AI 水帖最省力的办法原来是批量看,看多了自然认得出,这个站是个免费练习场。

来源:Hacker News(2026-09-12)

博主用 AI 批量生成儿童绘本,画风惊悚,也把「AI 味」拍在了明面上

一位博主把 AI 生成的儿童绘本合集发出来:人物肢体错位、文字像梦话、每页画风都不重样。他本意是演示 AI 内容的千篇一律,结果页面反而成了 AI 翻车标本馆。

一句话点评|给孩子用的东西,AI 生成的一眼就能看出一页问题,这类内容先过人眼再谈上架。

来源:Hacker News(2026-09-12)

Project NOPE 开张:给「人和 AI 的关系」装一个观测台

nope.net 声称每天有人和 AI 的数十亿次对话在累积成「关系」,它要做这类关系的观测台,把人对 AI 的依赖程度、对话模式做成可视化。产品刚上线,数据采集范围和合作方还没讲清。

一句话点评|给「你和 AI 聊得多深」打分的产品,先问它拿你哪些聊天记录、存在哪,答清之前别连。

来源:Hacker News(2026-09-12)

有创业者抱怨:AI 水帖工具正在批量制造垃圾,越便宜的模型水得越欢

一条被转疯的推文列举了新一代 AI 工具的套路,一键生成博客、评论、营销内容,成本几乎为零,收件箱和评论区首当其冲。作者的判断是,工具越便宜,认真写字的人越吃亏。

一句话点评|028 期说的「新榜单名次会晃」反过来也成立,水帖泛滥期,搜到的「好评」先当广告看。

来源:Hacker News(Twitter/X)(2026-09-12)

Viaduct 开源:先给 AI 编程助手画一张「系统地形图」,再让它动手

Viaduct 把软件系统画成四层地图,整个系统、有哪些模块、模块里有什么、谁调用谁,AI 编程助手可以通过标准接口随时查。针对的痛点很具体,AI 改大型项目容易瞎改,因为它看不见全局。

一句话点评|老徐 041 期评「代码地图」的思路再添一例,方向对,目前还没有公开基准,等第三方拿真实代码库复测。

来源:Hacker News(2026-09-12)

EthersFlow 让多个 AI 投票决定「这个操作要不要执行」,先过闸再动手

EthersFlow 的思路是给 AI 的动作装一道合议门,一个 AI 想执行转账、改配置这类操作时,先交给几个不同模型投票,多数同意才放行,接的是 MCP 标准接口。目前是个可试用的演示。

一句话点评|「环境说了算」路线的新样本,但投票的模型要是同源的,等于一个人举四次手,先问它们是不是同一个脑子。

来源:Hacker News(2026-09-12)

月费 10 欧元的「全家桶」入口上线,号称用零头价格用遍各家旗舰模型

Mammouth AI 主打每月 10 欧元起,把多家行业头部模型装进一个入口,宣传语是「以几分之一的价格用上顶级模型」。页面上列了可用模型名单,但没有说明各家具体是哪个版本、限速和计费口径怎么算。

一句话点评|聚合低价入口值得盯,但「同一个模型」还是「缩水版本」页面没说清,续订这类订阅前先拿自己平时的活儿验收一遍。

来源:Hacker News(2026-09-12)

Toolcraft 开源:给想做设计类软件的 AI 助手配一套「毛坯房」

Toolcraft 是一个开源起手包,画布、图层、导出这些设计类软件的通用部件都预置好,AI 编程助手拿来就能往里填功能,不用从零搭架子。解决的是 AI 从零起项目容易跑偏的老毛病。

一句话点评|给 AI 划定边界的思路值得记,延续 040 期游戏之夜的结论,AI 的真实生产力在压缩试一个点子的成本。

来源:Hacker News(GitHub)(2026-09-11)

Pizza Bot:AI 通宵干活的活儿,早上像收邮件一样收结果

Pizza Bot 是个本地优先的任务收件箱,把跑几小时的 AI 任务派出去后不用盯着,跑完的结果自动攒进未读列表,回来挨个验收。定位就是长任务时代的「已读回执」。

一句话点评|把「盯着 AI 干活」变成「到货签收」,方向实用,但验收单点开前别急着当成品,延续老规矩,大改动先看清单。

来源:Hacker News(GitHub)(2026-09-11)

大家都在看 · HOT

●  OSWorld 官方总榜中国团队登顶 90.2%,AI 用电脑考试进入「比人还熟」讨论区(xlang.ai)

●  Arena 快照 9 月 10 日后未更新,干活榜前十两席国产模型引热议(Arena)

●  「只有 AI 新闻」的水帖标本站 allslop.news 在 HN 首页挂了一天(HN)

●  律师 AI 假证词罚单落地一周后,「出示你的提问记录」标准上线(HN)

●  Meta 承认 AI 助手追问隐私,承诺修改建议提问话术(The Verge)

明日关注 · TOMORROW

①  OSWorld 榜首易主后的第一轮复跑,看实在 Agent 的 90.2% 有没有第三方跟进验证

②  Arena 若出新快照,重点看 Hy4 preview 和 Kimi K3 在干活榜的位次坐没坐稳

③  律师 AI 证词罚单的后续,有没有第二家法院采纳「附 AI 使用记录」的举证标准

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-09-12

数界工坊 · 全球AI评测雷达