Microsoft Research 播客:Jennifer Neville 谈 AI 的意外失败与评估的作用
Microsoft Research 播客中,资深研究经理 Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,探讨评估如何推动 AI 系统性能突破传统 benchmark,以及测试超出常规基准时出现的“意外失败”。她还分享了使用当前 AI 系统的实用建议,并谈到结果不符预期时为何要仔细审视数据,以及数十年 AI 发展对她预测未来的启示。
Microsoft Research 播客中,资深研究经理 Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,探讨评估如何推动 AI 系统性能突破传统 benchmark,以及测试超出常规基准时出现的“意外失败”。她还分享了使用当前 AI 系统的实用建议,并谈到结果不符预期时为何要仔细审视数据,以及数十年 AI 发展对她预测未来的启示。
Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组中约 90 亿个单核苷酸变异的分子效应预测,是超过 1PB 的数据集,可经免费网站、AlphaGenome API 和 Google Antigravity 技能访问。
推荐理由:官方平台整合了 AlphaGenome 与 AlphaMissense 的预测,读者可以了解它如何用于变异排序和稀有病等研究场景。
Berkeley AI Research 提出 ABBEL 框架,将摘要形式化为自然语言信念状态并施加 belief grading 监督,以替代完整交互历史。