GitHub 发布开源代码审查基准 ReviewBench
GitHub 发布 AI 代码审查离线基准 ReviewBench,现已开放使用。基准基于 103.9M 真实 pull request 的分布构建,包含来自 19 种语言的 219 个公开 pull request。
GitHub 发布 AI 代码审查离线基准 ReviewBench,现已开放使用。基准基于 103.9M 真实 pull request 的分布构建,包含来自 19 种语言的 219 个公开 pull request。
Microsoft Research 开发了一套机器学习系统,为美国本土 66,935 座变电站生成位置级空间天气风险估计,可提前 30-60 分钟预警。系统结合 L1 点太阳风观测、AE 与 Dst 指数预测、地质导电率和电网数据预测 dB/dt。
Microsoft Research 的逆合成模型 RetroChimera 论文发表于 Nature,该模型结合基于 Transformer 的 R-SMILES 与基于 GNN 的 NeuralLoc 两个互补子模型,并用 learning-to-rank 策略聚合预测。
Berkeley Sky Lab 在进化式内核搜索框架 K-Search 基础上新增 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,把已有 CUDA 内核作为知识库自动适配为 Apple Silicon 上的高质量 GPU 内核。
Berkeley AI Research 提出 ABBEL 框架,将摘要形式化为自然语言信念状态并施加 belief grading 监督,以替代完整交互历史。
Berkeley AI Research 发布一篇关于并行推理(Parallel Reasoning)的综述兼观点文章,探讨让大语言模型自行决定何时分解任务、并行化以及协调子任务的自适应并行推理。
Berkeley AI Research 等团队提出 GRASP,一种基于梯度的规划器,让学习型世界模型的长时程规划更稳健。它将轨迹提升到虚拟状态以实现跨时间并行优化,在状态迭代中加入随机性以支持探索,并通过重塑梯度避免经过高维视觉模型的脆弱“状态-输入”梯度。该方法解决了长时程 rollout 中雅可比矩阵病态化导致的梯度爆炸/消失,以及非贪心结构带来的局部极小问题。
Berkeley AI Research 提出 SPEX 和 ProxySPEX 两种算法,可在大规模场景下高效识别 LLM 的关键交互。
Berkeley AI Research 在 NeurIPS 2025 论文中提出直接基于信息量评估和优化成像系统的框架,仅用噪声测量数据和噪声模型估计互信息,无需训练任务专用解码器。该指标在彩色摄影、射电天文、无透镜成像和显微成像四个领域均能预测下游解码性能,优化结果可媲美最先进的端到端方法,且内存和算力开销更低。