GitHub 发布开源代码审查基准 ReviewBench
GitHub 发布 AI 代码审查离线基准 ReviewBench,现已开放使用。基准基于 103.9M 真实 pull request 的分布构建,包含来自 19 种语言的 219 个公开 pull request。
GitHub 发布 AI 代码审查离线基准 ReviewBench,现已开放使用。基准基于 103.9M 真实 pull request 的分布构建,包含来自 19 种语言的 219 个公开 pull request。
MIT Technology Review 基于 300 位数据与 AI 高管调研的报告指出,企业 AI 智能体缺乏组织语境下的知识,是智能体项目难以落地的主要原因——平均仅 34% 的 agentic AI 项目进入生产环境。
Berkeley AI Research 提出 ABBEL 框架,将摘要形式化为自然语言信念状态并施加 belief grading 监督,以替代完整交互历史。
Berkeley AI Research 等团队提出 GRASP,一种基于梯度的规划器,让学习型世界模型的长时程规划更稳健。它将轨迹提升到虚拟状态以实现跨时间并行优化,在状态迭代中加入随机性以支持探索,并通过重塑梯度避免经过高维视觉模型的脆弱“状态-输入”梯度。该方法解决了长时程 rollout 中雅可比矩阵病态化导致的梯度爆炸/消失,以及非贪心结构带来的局部极小问题。