Latent Space AINews:OpenAI 发布内部模型 722 篇数学论文,宣称解决 top 500 开放问题中的 90 个
OpenAI 公开发布来自未公开内部前沿模型的 722 份数学稿件,分为 372 组相关结果,来自约 4000 个研究问题的评估,平均每题使用约 3 小时 ChatGPT Pro 思考算力,包含论文、证明产物和部分推理摘要。
OpenAI 公开发布来自未公开内部前沿模型的 722 份数学稿件,分为 372 组相关结果,来自约 4000 个研究问题的评估,平均每题使用约 3 小时 ChatGPT Pro 思考算力,包含论文、证明产物和部分推理摘要。
Microsoft Research 播客中,资深研究经理 Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,探讨评估如何推动 AI 系统性能突破传统 benchmark,以及测试超出常规基准时出现的“意外失败”。她还分享了使用当前 AI 系统的实用建议,并谈到结果不符预期时为何要仔细审视数据,以及数十年 AI 发展对她预测未来的启示。
GitHub 发布 AI 代码审查离线基准 ReviewBench,现已开放使用。基准基于 103.9M 真实 pull request 的分布构建,包含来自 19 种语言的 219 个公开 pull request。
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,在 DeepSWE v1.1 上比 GPT-6 Sol 高 6.4 分,在 Agent Arena 以 $0.56 中位成本列第 5。
Google DeepMind 发布 Gemini 4 Argon,主打编码、企业知识工作与网络防御,声称在 19 项基准中的 13 项排名第一,对标 GPT-6 Astra 和 Claude Opus 5.5。