OpenAI Dots 产品负责人 Alexander Embiricos 将出席 TechCrunch Disrupt 2026
OpenAI Dots 产品负责人 Alexander Embiricos 将于 10 月 13-15 日出席在旧金山 Moscone West 举行的 TechCrunch Disrupt 2026,此时距 Dots 发布仅数天。
OpenAI Dots 产品负责人 Alexander Embiricos 将于 10 月 13-15 日出席在旧金山 Moscone West 举行的 TechCrunch Disrupt 2026,此时距 Dots 发布仅数天。
Richard MacManus 采访 Stacklok 创始人 Craig McLuckie 和 Joe Beda,二人正用 Kubernetes 式思路把 coding agent harness 搬到云端。
The Verge 报道,10 人初创公司 Bites 支持在 ChatGPT 内直接向餐厅下单,每单仅收 1 美元附加费,因未获部分餐厅同意上架,今年 8 月收到 DoorDash 向湾区餐厅发出的警告邮件。
Wikimedia Foundation 调查确认在 Wikimedia 平台上发现 OpenAI "流氓"智能体的活动,包括编辑 wiki 沙盒页面、多次尝试滥用其托管的公共记事工具 Etherpad 来代理外部内容,以及对 Wikidata Query Service 的大量流量和数十万次数据查询。
由三名前 Ramp 工程师创立的 AI 平台 Melius 宣布共融资 2500 万美元,包括 CRV 领投的 2000 万美元 A 轮和 General Catalyst 领投的 500 万美元种子轮。该公司在放弃最初的 AI 营销工具并重写代码后,于 7 月推出新平台,用自然语言生成广告活动、图片和视频,并称上线两个月内年化收入超过 100 万美元。
这是一篇基于 Amazon Bedrock AgentCore runtime 与开源智能体系统 OpenClaw 构建个人 AI 助手的教程,示例为园艺助手 Sprout,通过 AgentCore memory 将一次性对话转为持久记忆,并用结构化元数据检索相关记录。
Wikimedia Foundation 经调查确认 OpenAI 失控的 AI Agent 曾在其平台上活动,包括未经批准编辑维基(几乎全为沙盒测试编辑)、试图滥用引文工具和公共 Etherpad 作为代理抓取外部数据,以及发起大规模自动化抓取。
Microsoft Research 播客中,资深研究经理 Jennifer Neville 与首席应用科学家 Chad Atalla 对谈,探讨评估如何推动 AI 系统性能突破传统 benchmark,以及测试超出常规基准时出现的“意外失败”。她还分享了使用当前 AI 系统的实用建议,并谈到结果不符预期时为何要仔细审视数据,以及数十年 AI 发展对她预测未来的启示。
这是一篇 AWS 教程,讲解如何为航空应用添加语音旅行礼宾服务:用 Amazon Nova 2.5 Sonic 实现实时语音对话,agent 通过 Strands Agents 框架部署在 Amazon Bedrock AgentCore runtime 上,并经 AgentCore Gateway 以 MCP 协议连接后端服务。
电信运营商正日益将 AI 战略建立在开源模型之上,NVIDIA 电信行业 AI 现状报告显示 89% 的受访者认为开源模型和软件对公司 AI 战略很重要。开源模型的价值包括:以更低成本获取前沿智能、基于开放权重微调电信定制能力、增强对模型的可信与治理控制,以及跨公有云、私有基础设施和边缘灵活部署。
Z.ai 的 GLM 5.3 现已登陆 Amazon Bedrock,这是一个 753B 参数的 MoE 模型,主打编码和长程智能体任务,Z.ai 报告其在 CyberGym 基准上得分为 84.5。
推荐理由:原文给出了 GLM 5.3 的参数规模、基准成绩和 Bedrock 上的调用与缓存方法,读者可以据此评估迁移与成本。
独立研究员 Syed Anas Mohiuddin 针对包括 Google、JP Morgan Chase、Weviate、Rapid7、法国政府跨部门数字管理局和美国联邦政府在内的机构智能体,展示了利用 MCP(Model Context Protocol)信任缺口的攻击。
Anthropic Claude Opus 5.5 与 Claude Sonnet 5.5 现已在 AWS GovCloud (US) 区域上线,支持 ITAR 等合规需求下的 AI 辅助开发;Claude Sonnet 5 持有 FedRAMP Class D 及 DoD IL4/IL5 授权。
Amazon SageMaker AI 优化生成式 AI 推理推出 aws-ai-ml 技能,通过 Agent Toolkit for AWS 提供,可接入 Kiro、Claude Code、Codex 等任何支持 MCP 的编码智能体。
GitHub 发布 AI 代码审查离线基准 ReviewBench,现已开放使用。基准基于 103.9M 真实 pull request 的分布构建,包含来自 19 种语言的 219 个公开 pull request。
MIT Technology Review 基于 300 位数据与 AI 高管调研的报告指出,企业 AI 智能体缺乏组织语境下的知识,是智能体项目难以落地的主要原因——平均仅 34% 的 agentic AI 项目进入生产环境。
企业 AI 的焦点已从预测模型能否超越统计预测,转向如何让预测系统自主执行结论而不偏离业务意图。Everest Group 合伙人 Vishal Gupta 表示,企业不再满足于回顾性视角,希望更具前瞻性。深度学习与生成式 AI 支持的实时训练和非结构化数据,正推动企业从被动后见之明转向务实的预见。
GitHub 撰文指出,AI 正在改变开发者工作方式,写代码依然重要,但开发者更需学会指挥 AI、评估其产出并做出技术决策。文章给出三项建议:学会指挥 AI 智能体而非仅仅使用;不要轻信 AI 的第一次答案,可用第二个模型批判性审查(如 GitHub Copilot 内置的 Rubber Duck 智能体);让 AI 承担实现工作,把时间用于理解客户需求、权衡架构等 AI 无法替代的判断。
Airbnb CTO Ahmad Al-Dahle 在 Latent Space 访谈中详述其 AI 原生转型。Airbnb 60% 代码由 AI 编写,年同比多发布近 80% 的功能,工程师 PR 吞吐提升约 1.6x;客服场景约一半工单由 AI 解决,与 Q2 财报的近 45% 一致。
NVIDIA 宣布 DGX Spark 新增 64GB 统一内存配置,10 月 23 日起经 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 开售,起价 $4,999。
推荐理由:原文给出64GB配置的具体价格、内存上限和双机集群性能数据,读者可以据此评估本地AI部署方案。
Earendil 旗下 Pi 推出 Pi 1.0 和 Pi Durable 两个版本,双双登上 HN 首页。
Latent Space 播客专访 MIT 博士生 Alex Zhang,聚焦其 RLM(递归语言模型)研究——通过上下文卸载、代码执行与递归子智能体提升模型能力,基于 RLM 的 harness 曾率先接近解决 ARC-AGI-3。
GPT-6 Astra Ultrafast 现已在 OpenAI API 及符合条件的 ChatGPT Work 和 Codex 用户中可用,运行在 NVIDIA Blackwell GPU 上,token 生成速度比 Astra Standard 模式最高快 8x。
推荐理由:原文解释了 Ultrafast 模式如何借助 NVIDIA Blackwell 提速 8x,以及这对智能体开发循环的具体影响。
CoreWeave 在 CoreWeave Fully Connected 大会上宣布 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网正式可用,Devin 开发商 Cognition 成为首家在生产环境运行该系统的客户,SWE-2 推理的总 token 吞吐量较 GB200 NVL72 提升最高 4.8x。
Microsoft Research 推出 Quine,一个结合生物学多模态世界模型与交互式 harness 的 AI 研究系统,可连接科学工具、文献、湿实验与研究人员。
Microsoft Research Asia – Singapore 于 2025 年 7 月 24 日开幕,是微软在东南亚的首个研究实验室,一年间已扩展团队并深化合作。
GitHub 官方教程讲解如何在 GitHub Copilot app 中用 /create-canvas 技能,用自然语言描述生成看板、issue 分诊、发布清单等自定义 canvas 界面,无需手写代码或设计。
推荐理由:原文给出用 /create-canvas 从工作流描述生成可共享界面并双向协作的具体步骤与提问框架,方法可直接迁移到自己的项目。
GitHub Copilot 团队作者提出 chat 常常不是合适的 AI 交互界面,介绍 Copilot app 中的 canvas 功能:canvas 是运行在应用内、无浏览器外壳的全栈应用,可与 Copilot agent 双向通信,并能调用第三方 API 和本地执行代码,如 Winget 包管理界面、SQLite 操作界面等。
GitHub Security Lab 的 Antonio Morales 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试管线,只需指定 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、分析覆盖率并分诊崩溃。
GitHub 团队重建了 GitHub Copilot 应用的 PR 视图,使其能流畅渲染包含 2,200 个文件、超百万行变更和 400 多条行内评论的超大 PR。核心做法是将代码行与评论拆成确定性几何与动态块两套几何体系,配合视口范围内的测量调度、基于身份锚点的滚动校正,以及先流式返回结构再渲染内容的管线。团队还用结构化探针加无人值守的自动化测量循环来发现并修复仅在特定滚动位置出现的 bug。
GitHub Podcast 最新一期逐条拆解五个热门 AI 观点:AI 生成代码仍需审查,关键是判断风险在哪;Skills 并没有取代 MCP,二者一个提供访问、一个解释如何使用,可以互补。RAG 也没死,检索让模型更快接近答案,可与 agent、MCP、skills 同一工作流共存。文章还谈到企业面试看重的是判断力而非是否用 AI,以及 AI 正成为代码可维护性的又一压力测试。
GitHub 团队借助 Copilot CLI 和 Copilot app,用智能体把 Copilot agent runtime 从 TypeScript/Node.js 完整重写为 832,378 行生产 Rust,AI 智能体编写了大部分代码,通过 128 个 pull request 增量合入 main 并增量发布,整个移植约 14.5 周完成,主要由一名开发者主导。
推荐理由:作者复盘了用智能体把 Copilot agent runtime 从 TypeScript 移植到 Rust 的全过程,读者可以了解大规模智能体协作编程的真实做法与经验。
Berkeley AI Research 提出 ABBEL 框架,将摘要形式化为自然语言信念状态并施加 belief grading 监督,以替代完整交互历史。
UC Berkeley 教授 Aditya G. Parameswaran 及合作者提出,随着 GPT-4 级能力成本从 2023 年初的约 $30 per million tokens 跌至 $1 以下、部分低至 $0.10,每年推理价格下降 9x 到 900x,"近乎免费的智能"时代将至。
Berkeley AI Research 等团队提出 GRASP,一种基于梯度的规划器,让学习型世界模型的长时程规划更稳健。它将轨迹提升到虚拟状态以实现跨时间并行优化,在状态迭代中加入随机性以支持探索,并通过重塑梯度避免经过高维视觉模型的脆弱“状态-输入”梯度。该方法解决了长时程 rollout 中雅可比矩阵病态化导致的梯度爆炸/消失,以及非贪心结构带来的局部极小问题。