← 文章 / AI技术
Latent Space 5小时前 · 2026-10-07 21:38:38 · 8 阅读

OpenAI 发表 722 篇论文,解决前 500 个开放数学问题中 90 个,被称为百年来数学界“最重大时刻”

AIE NYC 的门票即将售罄!下周见!

往期 AINews 的订阅者可享折扣。


为 Mistral 干一杯吧,他们在由近期 D 轮融资支持的全新 3800 GB300 集群上,发布了一款性能不错的 Large 4 “Le Chonk” 模型。

不过,OpenAI 内部 Navier-Stokes 数学模型取得的其他成果更抢眼——这些成果以博客、代码库和推文的形式公布。来自 Anthropic 的其 Navier-Stokes 竞争对手给出的评价最高。尽管他个人与 OpenAI 有些过节,但评价毫不含糊:“这显然是数学史上最重要的时刻。”

levent@__alpoge__对 Quasi-Riemann 证明没有 Siegel 零点(以及其中其他许多精妙之处),致以极高的敬意。我总在声称这些问题触手可及,却从未真正深入钻研,现在真该打自己一巴掌了。 有一些悲剧故事,与他们的用户被抢先发表或产生冲突有关……10 月 6 日,晚上 11:39 · 99,400 次浏览
29 条回复 · 100 次转发 · 1,630 个赞

当然这说法需要一些限定,但大多数专家似乎都认为,它解决了数学前 500 个未解问题中的许多。

其中成果 003,即准黎曼假设,其分量介于菲尔兹奖级别的成果和“200 年来数论界最重大的突破”之间。

更令人震惊的是实现方式——之前解 Navier-Stokes 用了 88 小时和 1 万个 agent,而这次这些解平均只需 3 小时的 ChatGPT Pro。

2026 年 10 月 5 日至 6 日的 AI 新闻。我们浏览了 12 个 subreddit、544 个 Twitter 账号,Discord 暂无新增内容。AINews 网站支持检索全部往期内容。提醒一下,AINews 现已是 Latent Space 的一个栏目,你可以自行选择是否接收邮件!


AI Twitter 回顾

OpenAI 发布一个未公开内部模型产出的 722 篇数学论文

  • 发布方式:OpenAI 在其公开的 GitHub 仓库中发布了一系列来自内部前沿模型广泛的数学成果。据称,他们曾就发布方案咨询过高等研究院关于数学与人工智能的独立咨询小组。

    • 规模与算力:该合集据称包含 722 份手稿,分为 372 个相关成果族。这些成果源自对约 4,000 个研究问题的评估,每个成果平均消耗约 3 小时的 ChatGPT Pro 思考算力(摘要,Rundown)。

    • 交付物:发布内容包括论文、证明工件(artifacts)以及精选的推理摘要。模型本身尚未发布。

    • 定位:Sam Altman 将其称为“发现的新纪元”。

  • 备受关注的声称结果:以下内容由个别评论者报道,尚未经过独立验证。

  • 数学家的反应:Levent Alpöge 赞扬了准黎曼(quasi-Riemann)和无 Siegel 零结果,并称其为“数学历史上最重要的时刻”。他还提到了其他实验室用户涉及的抢发(scooping)和利益冲突问题。

  • 成果构成:有分析指出,约 20% 的结果为证伪或反例。该分析认为,这一数据削弱了“AI 在数学上的主要突破依赖暴力搜索”的观点。

  • 质疑与开放问题:

  • Mistral Large 4(“Le Chonk”):发布、定价及争议评测

    开源权重与 API 模型发布:Embeddings、图像、决策模型

    • EmbeddingGemma 2:Google 首个原生多模态开源 embedding 模型,在统一空间中涵盖文本、代码、图像、视频和音频。基于 Gemma 4 构建,采用 Apache 2.0 协议发布(DeepMind)。

      • 规格:采用模块化设计,提供 740M 全模态、440M 文本+视觉、570M 文本+音频和 270M 纯文本变体。支持 768 至 128 的 Matryoshka 维度,8,192 上下文长度,MTEB Code 测试成绩提升 14%(Phil Schmid)。

      • 资源占用:活跃内存约 191–567MB,单次处理最长 5.5 分钟音频或 58 帧视频(Google)。

      • 生态支持:支持首发集成 llama.cpp、vLLM、Ollama 和 Unsloth。亦支持浏览器 WebGPU 运行,单次查询耗时约 20–70ms(Victor Mustar)。

    • Nano Banana 2.1:Google 更新的图像模型正在 Gemini 应用、AI Studio、搜索及广告产品中逐步推广(Google)。

      • 定价:每张图片 0.034 美元,此前 Pro 模型为 0.134 美元,Google 称新模型性能优于旧模型(Schmid)。

      • Arena 排名:多图像编辑第 4 名,文生图第 5 名,图像编辑第 6 名;文生图相比 Nano Banana 2 提升 80 分(Arena)。

    • 决策模型成为产品类别:

      • OpenAI Decisions API:公开测试版基于 GPT-6 Luna,支持返回断言、选项或评分。OpenAI 声称其速度比 Responses API 快至 10 倍(OpenAI Devs)。定价为每百万输入 token $0.10,且输出不计费($0.10/M input with no output charges)。

      • Perplexity:pplx-decider-v1.1-27b 开放权重,每百万输入 token 成本为 $0.02,并在 HF Decision Index v0.3 榜单中位列第一。

      • 对 Jev 的独立评估:Vals 发现 Jev 在事实核查上达到了 GPT-6 Astra 97.5% 的准确率,而成本仅约为其 1/500。Jev 在 LegalBench 上排名垫底。

      • 质疑观点:Theo 认为模型路由应用场景在选择智能等级方面“毫无用处”。

    • 其他开源发布:

      • Ling 3.1 Flash:该模型总参数量 560B,激活参数 25B,在 AA 指数上得分 41 分,较之前的 20 分大幅提升。每百万 token 定价为 $0.30/$0.90,权重即将发布。

      • Reflection Beam:知乎对 Beam 的分析指出,这是一个 501B/23B MoE 架构模型,预训练数据量达 23.8T token。RL 阶段使用了约 10,500 张 GB300 显卡持续四周,训练过程可容忍高达 107 个策略版本的样本陈旧。能力教师和对齐教师通过多教师同策略蒸馏合并。

      • Kandinsky 6.0:该视频模型采用 MIT 许可证,支持同步音频,并提供vLLM-Omni 首日支持。

    • 搜索评估:OpenAI 内置网络搜索在 AA Search Index 上得分 74 分,在提供商中排名第 5,每任务成本约 $0.05。其在 BrowseComp 表现最弱,在 26 个参与者中排名第 13。

    安全、控制与评估完整性

    研究、基础设施与开发者工具

    行业与政策

    • 中国芯片敞口:Epoch 发现,中国受半导体供应冲击的敞口约为美国的 2.7 倍。其脱钩模拟结果显示,中国的实际 GNE 将下降约 3%,而美国仅下降 0.6%。

    • 中国 AI 收入:Epoch 的另一份报告梳理了中国 AI 公司的五类收入来源。报告指出,2025 年火山引擎承载了中国公有云约 50% 的 AI tokens。

    • 高通–华为更正:高通向第一财经表示,将其交易与华为的 LogicFolding 技术联系起来的报道是不实的。高通还驳斥了其为净支付方的说法。

    热门推文(按互动量)


    AI Reddit 精选

    /r/LocalLlama + /r/localLLM 精选

    1. 本地 AI 工具发布

    * [google/embeddinggemma-2 · Hugging Face](https://www.reddit.com/r/LocalLLaMA/comments/1wz5va3/googleembeddinggemma2_hugging_face/) (互动量: 543): Google DeepMind 发布了 `google/embeddinggemma-2`,这是一款 `740M` 参数的开源多模态嵌入模型,它将文本/代码、图像、视频、音频及混合输入映射到共享的 `768d` 空间,用于设备端的检索、RAG、分类及聚类。该模型采用模块化编码器—— `270M` 文本、 `170M` 视觉、 `300M` 音频——支持 `8K` 上下文长度、100 多种语言、任务指令前缀以及 Matryoshka Representation Learning,允许截断为 `512/256/128d` ;部署建议包括禁用未使用的编码器、对截断向量进行 L2 重归一化,并优先使用 `bfloat16`/`float32` 而非 `float16` 。社区链接包括 `llama.cpp` 的 支持 PR #30054、 `ggml-org` 的 GGUF 权重,以及 `Unsloth` 的 GGUF 权重。 评论区气氛轻松:用户对 Google 再次发布嵌入模型感到惊讶,并注意到音频嵌入对他们是新事物。一名评论者反对社区帖子主要链接到 Unsloth 的转换版本而非 Google 的原始模型页面,认为应当将发布功劳归于 Google。 * `google/embeddinggemma-2` 的 `llama.cpp` 支持已在 ggml-org/llama.cpp#30054 中合并,使其无需依赖 Hugging Face Transformers 堆栈即可实现本地推理工作流。相应的 GGUF 转换版本可在 ggml-org/embeddinggemma-2-GGUF 获取,这对计划使用该模型进行本地数据集索引或检索流程的用户具有重要参考价值。
    原始来源: Latent Space

    评论 (0)