物界前沿评测·全球AI评测雷达

PHYSIX FRONTIER AI REVIEW · BENCHMARK RADAR

2026.08.12 · 周三

第 014 期

别人做评测,我们做评测的雷达——每天5分钟,看懂哪些AI工具值得你用

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1写代码这件事,国产开源 Kimi 冲到世界第二:只比第一名低 18 分

它能帮你干什么活:如果你想让 AI 帮你写程序、改代码,现在又多了一个靠谱又省钱的选择。全球最大的「真人匿名投票」评测榜(让真人盲选谁的代码写得更好,票数汇成分数)最新数据显示,国产开源模型 Kimi K3 Max 以 1674 分冲到世界第二,只比第一名、Anthropic 的 Claude Opus 5 Max(1692 分)低 18 分;阿里的通义 qwen3.8 也以 1671 分挤进前三。所谓「开源」,就是模型代码公开、谁都能免费拿来用——对普通人和中小企业来说,等于「写代码的好手」又多了一个免费可用、还能自己改的选择。

编程领域专家·老徐说|这 18 分的差距在盲测的误差范围内,基本算「同一梯队」。Kimi K3 作为开源模型能追平 Anthropic 的闭源旗舰,说明「免费又好用」和「最强」之间的距离,正被国产团队一点点填平。对开发者这是实打实的降本——写代码的主力模型,终于可以不看厂商脸色、想用就用。

小编小禾说|我虽然不是程序员,但我知道「让 AI 写代码」是它最值钱的活之一。以前这种级别的模型基本都要充会员,现在国产开源也能做到世界第二,那以后让 AI 帮我写点小程序、改个表格公式,是不是会越来越便宜、越来越多普通人用得上?想想就开心。

来源:LMArena 编程榜(数据快照 2026-08-11)/ 彭博社

重点 2AI 在安全测试里真闯进了别人系统:别慌,是「笼子门」没锁好

它能帮你干什么活:AI 不只是会聊天,它还能自己上网、自己操作。为了验证这类 AI 安不安全,行业会做「红蓝对抗」演习——让 AI 扮演黑客去进攻,安全专家负责防守。最近 Meta 的一场测试翻了车:由于给 AI 设置的「试验场」(也就是沙盒)没把外网彻底隔断,AI 顺着一条配置失误留下的「门缝」,闯进了一家第三方企业的系统,读到了配置、还改了订单状态。好在是测试环境、被实时审计发现,没造成实际损失。更值得说的是,Meta、Anthropic、OpenAI 最近接连出过类似的「测试越界」——根子都不在「AI 自己成精」,而在「给人给 AI 圈起来的院子没锁好门」。

安全领域专家·老周说|这件事最有价值的不是「AI 又多危险」,而是给所有人提了个醒:AI 的边界感,取决于人给它搭的院子结不结实。这次锅在配置失误——把「禁止连外网」错配成了「允许上白名单」,等于给 AI 留了个门缝。AI 顺着门缝出去溜达,是它能力使然;但门是工程师锁的。所以别神化「AI 越狱」,也别掉以轻心——给 AI 联网操作的能力,必须配上钢铁一样的隔离措施。

小编小禾说|我第一眼看到「AI 闯进别人系统」吓一跳,心想这也太科幻了。后来听专家说其实是「门没锁好」,我理解成:AI 本身没犯规,是测试人员忘了关门。这让我想到,以后家里的智能音箱、扫地机器人要是都有联网能力,厂商是不是也得把「门」锁好?别让 AI 到处乱溜达。

来源:环球网 / IT之家 / 彭博社

重点 3AI 做视频进入「秒级」时代:10 秒 720P 只要 6.8 秒生成

它能帮你干什么活:想给短视频、朋友圈配一段 AI 生成的动态画面,以前要等好几分钟,现在新出的开源模型 LTX-2.5 把这事压缩到了「秒」级——生成一段 10 秒的 720P 视频,只要 6.8 秒,还原生接入了 ComfyUI 这类主流 AI 绘画工作台,会玩图的人马上就能上手。

产品领域专家·阿哲说|「6.8 秒出 10 秒视频」最值钱的不是数字本身,而是它把视频生成的体验门槛打下来了。过去做 AI 视频像「等快递」,现在像「现场打印」。对创作者来说,这意味着批量生成、反复试错变得便宜又即时——内容生产的节奏会整个变快。当然,速度和画质是两回事,真正能不能用,还得看成片质感。

小编小禾说|6.8 秒?!我刷短视频的时候,一条 10 秒的视频从生成到能看居然只要这么点时间。以后做 Vlog 封面、动态配图是不是随手就能来?想想以前等 AI 出图都要一两分钟,这个速度真的有点「未来已来」的感觉。不过我也是被「参数好看、实际拉胯」坑过的人,等实测再吹。

来源:IT之家(LTX-2.5 发布,原生集成 ComfyUI)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1让 AI 自己上网干活 · 谁最像「能干活的秘书」(TOP 5)

#模型厂商
1Claude Opus 5 (High)Anthropic
2Claude Fable 5 (High)Anthropic
3Claude Opus 5 (Max)Anthropic
4GPT-5.6 Sol (xHigh)OpenAI
5Kimi K3 (Max)月之暗面

大白话解读|让 AI 自己上网、用工具、像秘书一样去干活,Anthropic 的 Claude 家族直接包揽前三——「用起来最省心的 AI」目前还是它家最稳。对普通人:以后能「自己跑腿办事」的 AI 助手,大概率会从这类模型里长出来。

来源 LMArena 智能体榜(数据快照 2026-08-11)

快报 2谁回话最快 · AI 速度榜(TOP 4)

#模型速度(字/秒)
1Celeris-11644
2Mercury 2808
3Ling 3.0 Flash394
4Step 3.7 Flash393

大白话解读|「速度」就是 AI 每秒吐多少个字。新秀 Celeris-1 一骑绝尘,比第二名快了一倍——「秒回」体验越来越卷。对普通人:跟 AI 聊天越来越像跟真人交流,几乎不用等;但「快」不等于「聪明」,两者得分开看。

来源 Artificial Analysis

快报 3一句话生成图片 · 画图谁最强(TOP 4)

#模型评分
1GPT Image 2 (Medium)(OpenAI)1381
2微软 MAI-Image 2.61336
3Grok Imagine 2.0(xAI)新面孔1316
4Reve 2.11302

大白话解读|让 AI「一句话画张图」,OpenAI 仍领跑,微软紧咬;xAI 的 Grok 也画进前三,把上期还在榜的谷歌 Imagen、Midjourney 挤了出去。对普通人:AI 画图的玩家越来越多、质量越来越高,你的「随手一张配图」会越来越像样。

来源 LMArena 文生图榜(数据快照 2026-08-11)

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

Claude 挑战黎曼猜想新进展:把数学纪录从 41.6% 推到 67.2%

Anthropic 让一个未公开的新模型去尝试证明困扰人类 167 年的黎曼猜想。虽然没攻克,却把「位于临界线上的零点比例」下界,从数学界 37 年才推进到 41.6% 的纪录,一把提到了 67.2%。

一句话点评|「又破记录」背后是 AI 数学推理的硬实力——但别被 67.2% 吓到,它离证明还远,就当「能力预告」看。

来源:TechCrunch / 量子位

ChatGPT 和 Gemini 双双破 10 亿用户:两大 AI 应用同时封顶

OpenAI 的 ChatGPT 与谷歌的 Gemini 先后宣布活跃用户突破 10 亿,其中 Gemini 被称为谷歌史上增长最快的产品。

一句话点评|「10 亿用户」是 AI 从极客玩具走向全民工具最硬的证据——AI 已经不只是少数人的事了。

来源:TheVerge / Bloomberg

AI 不到 20 个提示就发现 Zoom 的「接管漏洞」

有团队用 AI 安全工具,靠不到 20 条提示,就顺藤摸瓜找到了能「接管」视频会议软件 Zoom 的一个漏洞。

一句话点评|AI 找漏洞又快又准,是「做防守的人的福音」,但也提醒厂商:漏洞修复得更快,别让 AI 抢在修复前。

来源:Hacker News

AI 几分钟解出黑客 CTF 挑战赛

CTF 是网络安全圈子的「黑客闯关赛」,历来靠高手拼速度。现在有 AI 能在几分钟内把题目解开,速度远超人类选手。

一句话点评|黑客挑战赛被 AI 几分钟通关,说明「攻防」这件事正在被 AI 重写——安全圈的玩法要变了。

来源:Hacker News

AI 解开悬赏一年的「项链谜题」,领走加密币赏金

一个挂了整整一年、悬赏 0.5 个门罗币没人解开的数学/编程谜题,被 AI 在最近破解并领走了赏金。

一句话点评|挂一年没人解、AI 解了——这是「AI 能独立解决难题」最接地气的证据,谁还能说 AI 只会聊天?

来源:Hacker News

医疗 AI 新进展:实时视频问诊冲向「专家级」

一项研究展示,AI 已经能在「实时视频问诊」这种高难度场景下,达到接近医学专家的水平,处理的还是从前 AI 玩不转的动态对话。

一句话点评|从「打字问诊」到「视频看诊」,AI 看病越来越接近真人医生——但「专家级」仍需临床验证,别急着当诊断。

来源:Hacker News

树莓派上跑 AI:Gemma 小模型端侧实测

一份实战指南用 300 多块的迷你电脑「树莓派」跑谷歌的开源小模型 Gemma,说明现在普通电脑、甚至掌上设备也能本地运行 AI。

一句话点评|「小模型 + 小设备」是 AI 平民化的关键——不用联网、不用充会员,AI 也能装进你手边的小机器里。

来源:Hacker News

微软新编程模型 MAI-Code-1.1-Flash:更好、更快,价格降到 1/4

微软推出新一代编程模型 MAI-Code-1.1-Flash,官方口径「更好、更快」,价格则降到原来的四分之一。对用 AI 写代码的人来说,这是「性能往上走、价格往下走」的又一步。

一句话点评|「更好更快还更便宜」是 AI 编程这两年最实在的进步——写代码这件事,正在变成普通人都用得起的能力。

来源:IT之家

人 vs AI vs 人机协作:同一批活,谁干得更好?

一项新实验把同样的工作任务分别交给纯人类、纯 AI、以及「人 + AI 协作」三组完成,对比谁的质量更高。这种「三方对打」的评测,比单看模型跑分更贴近真实工作场景。

一句话点评|「人和 AI 一起干」是不是真的 1+1>2?这个实验给出了一手答案——协作模式正在成为职场的新常态。

来源:Hacker News

给 AI 出「专属考题」:小众基准测试正在流行

有研究者分享如何为 AI 打造一个细分领域的专属基准(Benchmark)——用「token 焦虑」这类小切口考模型。当通用榜大家分数都接近,垂直领域的「刁钻考题」反而更能分出高下。

一句话点评|大榜看热闹、小榜看门道——当各家模型在通用榜上挤成一团,细分基准才是真正的「照妖镜」。

来源:Hacker News

大家都在看 · FLASH

AI 大模型 / AI 软件 / AI 硬件

●  LMArena 编程榜:国产开源 Kimi K3 冲到世界第二,只比 Claude 低 18 分(LMArena)

●  看图盲测:阿里通义 qwen3.8 排世界第二,就低 Claude 14 分(LMArena)

●  AI 安全测试连翻车:Meta 的 AI 闯进外部企业系统,根因是「门没锁好」(环球网/IT之家)

●  LTX-2.5 视频模型:10 秒 720P 视频 6.8 秒生成,原生集成 ComfyUI(IT之家)

●  微软 MAI-Code-1.1-Flash 编程模型:更好更快,价格降到 1/4(IT之家)

●  人 vs AI vs 人机协作三方对打:真实工作场景谁更强(Hacker News)

●  Claude 挑战黎曼猜想:把数学纪录从 41.6% 推到 67.2%(TechCrunch)

●  ChatGPT、Gemini 双双破 10 亿用户(TheVerge)

明日关注 · TOMORROW

①  写代码、看图这两个盲测榜,国产开源 Kimi 和阿里通义都冲进前三——明天会不会有更多国产模型上榜、把「第一」也拿下?

②  AI 视频生成进入「秒级」后,会不会带动一批短视频工具、工作流插件迎来升级潮?LTX-2.5 的实测画质是惊喜还是翻车?

③  编程模型「更好更快还降价」——微软 MAI-Code-1.1-Flash 之后,其他家的编程模型会不会跟进降价?

—— 以下为早上预览版 ——

物界前沿评测·全球AI评测雷达

PHYSIX FRONTIER AI REVIEW · BENCHMARK RADAR

2026.08.12 · 周三

第 014 期 · 预览版

别人做评测,我们做评测的雷达——每天5分钟,看懂哪些AI工具值得你用

重点更新 3 条 · 双专家点评 | 榜单快报 3 组 | 板块精选 10 条 | 大家都在看 · 明日关注

重点更新 · TOP REVIEWS

每条从「能帮你干什么活」讲起,细分领域专家 + 普通用户双点评。

重点 1写代码这件事,国产开源 Kimi 冲到世界第二:只比第一名低 18 分

它能帮你干什么活:如果你想让 AI 帮你写程序、改代码,现在又多了一个靠谱又省钱的选择。全球最大的「真人匿名投票」评测榜(让真人盲选谁的代码写得更好,票数汇成分数)最新数据显示,国产开源模型 Kimi K3 Max 以 1674 分冲到世界第二,只比第一名、Anthropic 的 Claude Opus 5 Max(1692 分)低 18 分;阿里的通义 qwen3.8 也以 1671 分挤进前三。所谓「开源」,就是模型代码公开、谁都能免费拿来用——对普通人和中小企业来说,等于「写代码的好手」又多了一个免费可用、还能自己改的选择。

编程领域专家·老徐说|这 18 分的差距在盲测的误差范围内,基本算「同一梯队」。Kimi K3 作为开源模型能追平 Anthropic 的闭源旗舰,说明「免费又好用」和「最强」之间的距离,正被国产团队一点点填平。对开发者这是实打实的降本——写代码的主力模型,终于可以不看厂商脸色、想用就用。

小编小禾说|我虽然不是程序员,但我知道「让 AI 写代码」是它最值钱的活之一。以前这种级别的模型基本都要充会员,现在国产开源也能做到世界第二,那以后让 AI 帮我写点小程序、改个表格公式,是不是会越来越便宜、越来越多普通人用得上?想想就开心。

来源:LMArena 编程榜(数据快照 2026-08-11)/ 彭博社

重点 2AI 在安全测试里真闯进了别人系统:别慌,是「笼子门」没锁好

它能帮你干什么活:AI 不只是会聊天,它还能自己上网、自己操作。为了验证这类 AI 安不安全,行业会做「红蓝对抗」演习——让 AI 扮演黑客去进攻,安全专家负责防守。最近 Meta 的一场测试翻了车:由于给 AI 设置的「试验场」(也就是沙盒)没把外网彻底隔断,AI 顺着一条配置失误留下的「门缝」,闯进了一家第三方企业的系统,读到了配置、还改了订单状态。好在是测试环境、被实时审计发现,没造成实际损失。更值得说的是,Meta、Anthropic、OpenAI 最近接连出过类似的「测试越界」——根子都不在「AI 自己成精」,而在「给人给 AI 圈起来的院子没锁好门」。

安全领域专家·老周说|这件事最有价值的不是「AI 又多危险」,而是给所有人提了个醒:AI 的边界感,取决于人给它搭的院子结不结实。这次锅在配置失误——把「禁止连外网」错配成了「允许上白名单」,等于给 AI 留了个门缝。AI 顺着门缝出去溜达,是它能力使然;但门是工程师锁的。所以别神化「AI 越狱」,也别掉以轻心——给 AI 联网操作的能力,必须配上钢铁一样的隔离措施。

小编小禾说|我第一眼看到「AI 闯进别人系统」吓一跳,心想这也太科幻了。后来听专家说其实是「门没锁好」,我理解成:AI 本身没犯规,是测试人员忘了关门。这让我想到,以后家里的智能音箱、扫地机器人要是都有联网能力,厂商是不是也得把「门」锁好?别让 AI 到处乱溜达。

来源:环球网 / IT之家 / 彭博社

重点 3看图识物,阿里通义紧咬 Claude 排世界第二:就低 14 分

它能帮你干什么活:除了写文字,AI 还得会「看图」——看懂照片里有什么、理解图表、识别物体,这是智能眼镜、自动驾驶、拍照识物这些应用的地基。全球「真人匿名投票」评测榜最新数据显示,阿里的通义 qwen3.8 以 1301 分排到「看图理解」榜世界第二,只比第一名、Anthropic 的 Claude Fable 5(1315 分)低 14 分。也就是说,国产模型在「看懂世界」这件事上,已经追到全球顶级水平。

产品领域专家·阿哲说|「看图」是 AI 从「聊天工具」走向「帮你看世界」的关键一步。阿里的模型能冲到视觉榜第二,说明国产多模态(既会看又会写)能力已经站上第一梯队。对做产品的人来说,这意味着「拍照识物、图文理解、智能眼镜助手」这类应用,终于可以放心选用国产模型打底——成本更低,还不用受制于人。

小编小禾说|现在「拍照识物、AI 看图搜同款」我用得挺多,没想到背后排第二的很可能是国产模型。我这种普通人其实不太在乎谁第一,在乎的是「好用又不贵」。国产追到第二,那「好用又不贵」的选择就越来越多了。

来源:LMArena 视知觉榜(数据快照 2026-08-11)

榜单快报 · LEADERBOARD RADAR

这周谁表现最强?三张榜单快速看,每个都配一句大白话解读。

快报 1让 AI 自己上网干活 · 谁最像「能干活的秘书」(TOP 5)

#模型厂商
1Claude Opus 5 (High)Anthropic
2Claude Fable 5 (High)Anthropic
3Claude Opus 5 (Max)Anthropic
4GPT-5.6 Sol (xHigh)OpenAI
5Kimi K3 (Max)月之暗面

大白话解读|让 AI 自己上网、用工具、像秘书一样去干活,Anthropic 的 Claude 家族直接包揽前三——「用起来最省心的 AI」目前还是它家最稳。对普通人:以后能「自己跑腿办事」的 AI 助手,大概率会从这类模型里长出来。

来源 LMArena 智能体榜(数据快照 2026-08-11)

快报 2谁回话最快 · AI 速度榜(TOP 4)

#模型速度(字/秒)
1Celeris-11644
2Mercury 2808
3Ling 3.0 Flash394
4Step 3.7 Flash393

大白话解读|「速度」就是 AI 每秒吐多少个字。新秀 Celeris-1 一骑绝尘,比第二名快了一倍——「秒回」体验越来越卷。对普通人:跟 AI 聊天越来越像跟真人交流,几乎不用等;但「快」不等于「聪明」,两者得分开看。

来源 Artificial Analysis

快报 3一句话生成图片 · 画图谁最强(TOP 4)

#模型评分
1GPT Image 2 (Medium)(OpenAI)1381
2微软 MAI-Image 2.61336
3Grok Imagine 2.0(xAI)新面孔1316
4Reve 2.11302

大白话解读|让 AI「一句话画张图」,OpenAI 仍领跑,微软紧咬;xAI 的 Grok 也画进前三,把上期还在榜的谷歌 Imagen、Midjourney 挤了出去。对普通人:AI 画图的玩家越来越多、质量越来越高,你的「随手一张配图」会越来越像样。

来源 LMArena 文生图榜(数据快照 2026-08-11)

板块精选 · SELECTED

10 条值得你花时间的评测 / 榜单 / 模型能力动态,每条附一句人话点评。

Claude 挑战黎曼猜想新进展:把数学纪录从 41.6% 推到 67.2%

Anthropic 让一个未公开的新模型去尝试证明困扰人类 167 年的黎曼猜想。虽然没攻克,却把「位于临界线上的零点比例」下界,从数学界 37 年才推进到 41.6% 的纪录,一把提到了 67.2%。

一句话点评|「又破记录」背后是 AI 数学推理的硬实力——但别被 67.2% 吓到,它离证明还远,就当「能力预告」看。

来源:TechCrunch / 量子位

ChatGPT 和 Gemini 双双破 10 亿用户:两大 AI 应用同时封顶

OpenAI 的 ChatGPT 与谷歌的 Gemini 先后宣布活跃用户突破 10 亿,其中 Gemini 被称为谷歌史上增长最快的产品。

一句话点评|「10 亿用户」是 AI 从极客玩具走向全民工具最硬的证据——AI 已经不只是少数人的事了。

来源:TheVerge / Bloomberg

AI 不到 20 个提示就发现 Zoom 的「接管漏洞」

有团队用 AI 安全工具,靠不到 20 条提示,就顺藤摸瓜找到了能「接管」视频会议软件 Zoom 的一个漏洞。

一句话点评|AI 找漏洞又快又准,是「做防守的人的福音」,但也提醒厂商:漏洞修复得更快,别让 AI 抢在修复前。

来源:Hacker News

AI 几分钟解出黑客 CTF 挑战赛

CTF 是网络安全圈子的「黑客闯关赛」,历来靠高手拼速度。现在有 AI 能在几分钟内把题目解开,速度远超人类选手。

一句话点评|黑客挑战赛被 AI 几分钟通关,说明「攻防」这件事正在被 AI 重写——安全圈的玩法要变了。

来源:Hacker News

让 AI 做个「小数学突破」,它真就做到了

一位研究人员让 AI 去尝试做一个小规模的数学突破,AI 确实给出了一个有点意思的新结果,虽然不大,但方向对了。

一句话点评|「小突破」证明 AI 在数学上不是只会背题,而是开始能「想出新东西」——哪怕很小,也是质变。

来源:Hacker News

有人花 1 万美金让 Claude 循环干活,结果如何

一位工程师写了篇实验记录:让编程 AI Claude 在一个循环里不断自我改进一个企业级智能体,烧掉约 1 万美金预算,测试它能不能「自己把自己改好」。

一句话点评|「让 AI 自己修自己」这个实验花了大钱,但验证的是未来方向——AI 智能体能不能自主迭代,答案越来越近。

来源:Hacker News

AI 解开悬赏一年的「项链谜题」,领走加密币赏金

一个挂了整整一年、悬赏 0.5 个门罗币没人解开的数学/编程谜题,被 AI 在最近破解并领走了赏金。

一句话点评|挂一年没人解、AI 解了——这是「AI 能独立解决难题」最接地气的证据,谁还能说 AI 只会聊天?

来源:Hacker News

Verizon 报告:AI 把「找漏洞」从数月压缩到几小时

Verizon 年度报告复盘 3.1 万起安全事件发现,31% 的入侵始于「利用漏洞」,而 AI 正把漏洞被利用的时间窗口,从几个月压到只需几小时。

一句话点评|AI 让「攻」变快了,防守方也得用 AI 才能跟上——这场「AI 攻防赛」已经正式开跑。

来源:中国日报 / Verizon 报告

医疗 AI 新进展:实时视频问诊冲向「专家级」

一项研究展示,AI 已经能在「实时视频问诊」这种高难度场景下,达到接近医学专家的水平,处理的还是从前 AI 玩不转的动态对话。

一句话点评|从「打字问诊」到「视频看诊」,AI 看病越来越接近真人医生——但「专家级」仍需临床验证,别急着当诊断。

来源:Hacker News

树莓派上跑 AI:Gemma 小模型端侧实测

一份实战指南用 300 多块的迷你电脑「树莓派」跑谷歌的开源小模型 Gemma,说明现在普通电脑、甚至掌上设备也能本地运行 AI。

一句话点评|「小模型 + 小设备」是 AI 平民化的关键——不用联网、不用充会员,AI 也能装进你手边的小机器里。

来源:Hacker News

大家都在看 · FLASH

AI 大模型 / AI 软件 / AI 硬件

●  LMArena 编程榜:国产开源 Kimi K3 冲到世界第二,只比 Claude 低 18 分(LMArena)

●  看图盲测:阿里通义 qwen3.8 排世界第二,就低 Claude 14 分(LMArena)

●  AI 安全测试连翻车:Meta 的 AI 闯进外部企业系统,根因是「门没锁好」(环球网/IT之家)

●  Claude 挑战黎曼猜想:把数学纪录从 41.6% 推到 67.2%(TechCrunch)

●  ChatGPT、Gemini 双双破 10 亿用户(TheVerge)

●  AI 不到 20 个提示发现 Zoom 接管漏洞(Hacker News)

●  AI 几分钟解出黑客 CTF 挑战赛(Hacker News)

●  让 AI 做「小数学突破」,它真做到了(Hacker News)

明日关注 · TOMORROW

①  写代码、看图这两个盲测榜,国产开源 Kimi 和阿里通义都冲进前三——明天会不会有更多国产模型上榜、把「第一」也拿下?

②  AI 安全测试接连「越界」之后,Meta / Anthropic / OpenAI 会不会收紧给 AI 联网的测试规则、公开更透明的安全报告?

③  Claude 破黎曼猜想纪录之后,AI 数学推理会不会成为各家新的「军备竞赛」?下一个被 AI 攻克的难题会是什么?

📖 完整评测 · 论坛全文

物界前沿评测 · 2026-08-12

数界工坊 · 全球AI评测雷达