Microsoft Research 播客:Jennifer Neville 谈 AI 的意外失败与评估的作用
Microsoft Research 播客中,资深研究经理 Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,探讨评估如何推动 AI 系统性能突破传统 benchmark,以及测试超出常规基准时出现的“意外失败”。她还分享了使用当前 AI 系统的实用建议,并谈到结果不符预期时为何要仔细审视数据,以及数十年 AI 发展对她预测未来的启示。
Microsoft Research 播客中,资深研究经理 Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,探讨评估如何推动 AI 系统性能突破传统 benchmark,以及测试超出常规基准时出现的“意外失败”。她还分享了使用当前 AI 系统的实用建议,并谈到结果不符预期时为何要仔细审视数据,以及数十年 AI 发展对她预测未来的启示。
电信运营商正日益将 AI 战略建立在开源模型之上,NVIDIA 电信行业 AI 现状报告显示 89% 的受访者认为开源模型和软件对公司 AI 战略很重要。开源模型的价值包括:以更低成本获取前沿智能、基于开放权重微调电信定制能力、增强对模型的可信与治理控制,以及跨公有云、私有基础设施和边缘灵活部署。
企业 AI 的焦点已从预测模型能否超越统计预测,转向如何让预测系统自主执行结论而不偏离业务意图。Everest Group 合伙人 Vishal Gupta 表示,企业不再满足于回顾性视角,希望更具前瞻性。深度学习与生成式 AI 支持的实时训练和非结构化数据,正推动企业从被动后见之明转向务实的预见。
Airbnb CTO Ahmad Al-Dahle 在 Latent Space 访谈中详述其 AI 原生转型。Airbnb 60% 代码由 AI 编写,年同比多发布近 80% 的功能,工程师 PR 吞吐提升约 1.6x;客服场景约一半工单由 AI 解决,与 Q2 财报的近 45% 一致。
Latent Space 播客专访 MIT 博士生 Alex Zhang,聚焦其 RLM(递归语言模型)研究——通过上下文卸载、代码执行与递归子智能体提升模型能力,基于 RLM 的 harness 曾率先接近解决 ARC-AGI-3。
GitHub Podcast 最新一期逐条拆解五个热门 AI 观点:AI 生成代码仍需审查,关键是判断风险在哪;Skills 并没有取代 MCP,二者一个提供访问、一个解释如何使用,可以互补。RAG 也没死,检索让模型更快接近答案,可与 agent、MCP、skills 同一工作流共存。文章还谈到企业面试看重的是判断力而非是否用 AI,以及 AI 正成为代码可维护性的又一压力测试。
UC Berkeley 教授 Aditya G. Parameswaran 及合作者提出,随着 GPT-4 级能力成本从 2023 年初的约 $30 per million tokens 跌至 $1 以下、部分低至 $0.10,每年推理价格下降 9x 到 900x,"近乎免费的智能"时代将至。