OpenAI 在 GitHub 发布 372 个 AI 生成的数学证明结果
OpenAI 发布由内部前沿模型生成的 372 项数学结果,托管在 GitHub 仓库而非学术期刊,含改进主要计算机算法和与黎曼猜想相关的进展。多数结果附带 Lean 形式化以便机器验证,平均每个结果消耗约三小时 ChatGPT Pro Thinking 算力;此前同一模型产出的 Navier-Stokes 解动用了 1 万个 agent 和数百万美元算力,仍在正式评审中。
OpenAI 发布由内部前沿模型生成的 372 项数学结果,托管在 GitHub 仓库而非学术期刊,含改进主要计算机算法和与黎曼猜想相关的进展。多数结果附带 Lean 形式化以便机器验证,平均每个结果消耗约三小时 ChatGPT Pro Thinking 算力;此前同一模型产出的 Navier-Stokes 解动用了 1 万个 agent 和数百万美元算力,仍在正式评审中。
OpenAI 通过 GitHub 仓库发布 722 篇手稿,覆盖 372 个结果族,内容为一个未公开前沿模型对长期数学问题的解答,AGMAI 称其中包括对数百个开放问题的解决方案。
Mistral 发布 Mistral Large 4 预览版,为 1 万亿总参数、490 亿激活参数的模型,用自有的 3,800 块 NVIDIA Grace Blackwell GPU 训练,已可通过其 API 使用,并承诺本月底开放权重。
曾参与构建 AlphaGo 的作者撰文指出,AlphaGo 的第 37 手靠的是搜索机制构建数千分支的博弈树,属于真正的推理,而 LLM 逐 token 预测只是“系统 1”式的模式补全。
GPT-6 Astra Ultrafast 现已在 OpenAI API 及符合条件的 ChatGPT Work 和 Codex 用户中可用,运行在 NVIDIA Blackwell GPU 上,token 生成速度比 Astra Standard 模式最高快 8x。
推荐理由:原文解释了 Ultrafast 模式如何借助 NVIDIA Blackwell 提速 8x,以及这对智能体开发循环的具体影响。
Google DeepMind 宣布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,定价为每百万输入 token $2、输出 token $10,缓存输入 95% 折扣。
推荐理由:官方发布正文给出定价、基准分数和内部落地实例,读者可以据此了解模型在工程与防御安全场景的实际表现。
Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组中约 90 亿个单核苷酸变异的分子效应预测,是超过 1PB 的数据集,可经免费网站、AlphaGenome API 和 Google Antigravity 技能访问。
推荐理由:官方平台整合了 AlphaGenome 与 AlphaMissense 的预测,读者可以了解它如何用于变异排序和稀有病等研究场景。
Microsoft Research 发布 Skala 1.1,该深度学习 DFT 泛函的训练数据比前代多 2.5 倍,在 GMTKN55 的 55 个类别中 32 个排名第一,加权平均误差为 2.8 kcal/mol,计算成本相当于 meta-GGA 泛函。
Berkeley Sky Lab 在进化式内核搜索框架 K-Search 基础上新增 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,把已有 CUDA 内核作为知识库自动适配为 Apple Silicon 上的高质量 GPU 内核。
UC Berkeley 教授 Aditya G. Parameswaran 及合作者提出,随着 GPT-4 级能力成本从 2023 年初的约 $30 per million tokens 跌至 $1 以下、部分低至 $0.10,每年推理价格下降 9x 到 900x,"近乎免费的智能"时代将至。
Berkeley AI Research 发布一篇关于并行推理(Parallel Reasoning)的综述兼观点文章,探讨让大语言模型自行决定何时分解任务、并行化以及协调子任务的自适应并行推理。
Berkeley AI Research 等团队提出 GRASP,一种基于梯度的规划器,让学习型世界模型的长时程规划更稳健。它将轨迹提升到虚拟状态以实现跨时间并行优化,在状态迭代中加入随机性以支持探索,并通过重塑梯度避免经过高维视觉模型的脆弱“状态-输入”梯度。该方法解决了长时程 rollout 中雅可比矩阵病态化导致的梯度爆炸/消失,以及非贪心结构带来的局部极小问题。