Microsoft Research 播客:Jennifer Neville 谈 AI 的意外失败与评估的作用
Microsoft Research 播客中,资深研究经理 Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,探讨评估如何推动 AI 系统性能突破传统 benchmark,以及测试超出常规基准时出现的“意外失败”。她还分享了使用当前 AI 系统的实用建议,并谈到结果不符预期时为何要仔细审视数据,以及数十年 AI 发展对她预测未来的启示。
Microsoft Research 播客中,资深研究经理 Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,探讨评估如何推动 AI 系统性能突破传统 benchmark,以及测试超出常规基准时出现的“意外失败”。她还分享了使用当前 AI 系统的实用建议,并谈到结果不符预期时为何要仔细审视数据,以及数十年 AI 发展对她预测未来的启示。
AWS 解读国际标准 ISO/IEC 42005:2025,说明如何将 AI 系统影响评估融入企业整体风险管理。该标准覆盖评估全生命周期,包括范围界定、执行、报告、持续监控及再评估触发条件,Annex D 提供与现有 IT 系统影响评估(风险、隐私、网络安全等)整合以避免重复的流程,Annex E 提供独立可用的模板。
GitHub 发布 AI 代码审查离线基准 ReviewBench,现已开放使用。基准基于 103.9M 真实 pull request 的分布构建,包含来自 19 种语言的 219 个公开 pull request。
GitHub 撰文指出,AI 正在改变开发者工作方式,写代码依然重要,但开发者更需学会指挥 AI、评估其产出并做出技术决策。文章给出三项建议:学会指挥 AI 智能体而非仅仅使用;不要轻信 AI 的第一次答案,可用第二个模型批判性审查(如 GitHub Copilot 内置的 Rubber Duck 智能体);让 AI 承担实现工作,把时间用于理解客户需求、权衡架构等 AI 无法替代的判断。
Microsoft Research 开发了一套机器学习系统,为美国本土 66,935 座变电站生成位置级空间天气风险估计,可提前 30-60 分钟预警。系统结合 L1 点太阳风观测、AE 与 Dst 指数预测、地质导电率和电网数据预测 dB/dt。
Microsoft Research 推出 Quine,一个结合生物学多模态世界模型与交互式 harness 的 AI 研究系统,可连接科学工具、文献、湿实验与研究人员。
Microsoft Research Asia – Singapore 于 2025 年 7 月 24 日开幕,是微软在东南亚的首个研究实验室,一年间已扩展团队并深化合作。
GitHub 官方教程讲解如何在 GitHub Copilot app 中用 /create-canvas 技能,用自然语言描述生成看板、issue 分诊、发布清单等自定义 canvas 界面,无需手写代码或设计。
推荐理由:原文给出用 /create-canvas 从工作流描述生成可共享界面并双向协作的具体步骤与提问框架,方法可直接迁移到自己的项目。
GitHub Copilot 团队作者提出 chat 常常不是合适的 AI 交互界面,介绍 Copilot app 中的 canvas 功能:canvas 是运行在应用内、无浏览器外壳的全栈应用,可与 Copilot agent 双向通信,并能调用第三方 API 和本地执行代码,如 Winget 包管理界面、SQLite 操作界面等。
GitHub 团队重建了 GitHub Copilot 应用的 PR 视图,使其能流畅渲染包含 2,200 个文件、超百万行变更和 400 多条行内评论的超大 PR。核心做法是将代码行与评论拆成确定性几何与动态块两套几何体系,配合视口范围内的测量调度、基于身份锚点的滚动校正,以及先流式返回结构再渲染内容的管线。团队还用结构化探针加无人值守的自动化测量循环来发现并修复仅在特定滚动位置出现的 bug。
微软研究挑战机器人推理必须依赖机载 GPU 的假设,系统评估移动操作工作负载后发现卸载推理到边缘或云端 GPU 可显著提升任务成功率、精度并延长续航,如 Jetson Thor 等大机载 GPU 可使电池消耗增加高达 160%。
Microsoft Research 的逆合成模型 RetroChimera 论文发表于 Nature,该模型结合基于 Transformer 的 R-SMILES 与基于 GNN 的 NeuralLoc 两个互补子模型,并用 learning-to-rank 策略聚合预测。
GitHub 团队借助 Copilot CLI 和 Copilot app,用智能体把 Copilot agent runtime 从 TypeScript/Node.js 完整重写为 832,378 行生产 Rust,AI 智能体编写了大部分代码,通过 128 个 pull request 增量合入 main 并增量发布,整个移植约 14.5 周完成,主要由一名开发者主导。
推荐理由:作者复盘了用智能体把 Copilot agent runtime 从 TypeScript 移植到 Rust 的全过程,读者可以了解大规模智能体协作编程的真实做法与经验。
Microsoft Research 推出 GigaPath-Flash 和 GigaTIME-Flash,以更少算力扩展 GigaPath 与 GigaTIME 的病理学基础模型能力。
Microsoft Research 发布 Skala 1.1,该深度学习 DFT 泛函的训练数据比前代多 2.5 倍,在 GMTKN55 的 55 个类别中 32 个排名第一,加权平均误差为 2.8 kcal/mol,计算成本相当于 meta-GGA 泛函。