Stacklok 两位 Kubernetes 创始人如何用云原生 harness 让 coding agent 走出桌面
Richard MacManus 采访 Stacklok 创始人 Craig McLuckie 和 Joe Beda,二人正用 Kubernetes 式思路把 coding agent harness 搬到云端。
Richard MacManus 采访 Stacklok 创始人 Craig McLuckie 和 Joe Beda,二人正用 Kubernetes 式思路把 coding agent harness 搬到云端。
Simon Willison 于 2026 年 10 月 6 日发布了 llm-mistral 0.16。该条目为其博客上的短讯(beat),未在正文中给出更多更新细节。
这是一篇基于 Amazon Bedrock AgentCore runtime 与开源智能体系统 OpenClaw 构建个人 AI 助手的教程,示例为园艺助手 Sprout,通过 AgentCore memory 将一次性对话转为持久记忆,并用结构化元数据检索相关记录。
AWS 解读国际标准 ISO/IEC 42005:2025,说明如何将 AI 系统影响评估融入企业整体风险管理。该标准覆盖评估全生命周期,包括范围界定、执行、报告、持续监控及再评估触发条件,Annex D 提供与现有 IT 系统影响评估(风险、隐私、网络安全等)整合以避免重复的流程,Annex E 提供独立可用的模板。
AWS 讲解如何通过 SageMaker Unified Studio 管理 SageMaker HyperPod 集群,同时保留底层治理控制。
AWS 推出直接在 SageMaker Studio 界面中创建和管理 HyperPod EKS 集群上 SageMaker Spaces 的能力,数据科学家无需 CLI 或 kubectl 即可启动 JupyterLab 和 Code Editor 环境。
这是一篇 AWS 教程,讲解如何为航空应用添加语音旅行礼宾服务:用 Amazon Nova 2.5 Sonic 实现实时语音对话,agent 通过 Strands Agents 框架部署在 Amazon Bedrock AgentCore runtime 上,并经 AgentCore Gateway 以 MCP 协议连接后端服务。
Z.ai 的 GLM 5.3 现已登陆 Amazon Bedrock,这是一个 753B 参数的 MoE 模型,主打编码和长程智能体任务,Z.ai 报告其在 CyberGym 基准上得分为 84.5。
推荐理由:原文给出了 GLM 5.3 的参数规模、基准成绩和 Bedrock 上的调用与缓存方法,读者可以据此评估迁移与成本。
Anthropic Claude Opus 5.5 与 Claude Sonnet 5.5 现已在 AWS GovCloud (US) 区域上线,支持 ITAR 等合规需求下的 AI 辅助开发;Claude Sonnet 5 持有 FedRAMP Class D 及 DoD IL4/IL5 授权。
Amazon SageMaker AI 优化生成式 AI 推理推出 aws-ai-ml 技能,通过 Agent Toolkit for AWS 提供,可接入 Kiro、Claude Code、Codex 等任何支持 MCP 的编码智能体。
Airbnb CTO Ahmad Al-Dahle 在 Latent Space 访谈中详述其 AI 原生转型。Airbnb 60% 代码由 AI 编写,年同比多发布近 80% 的功能,工程师 PR 吞吐提升约 1.6x;客服场景约一半工单由 AI 解决,与 Q2 财报的近 45% 一致。
NVIDIA 宣布 DGX Spark 新增 64GB 统一内存配置,10 月 23 日起经 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 开售,起价 $4,999。
推荐理由:原文给出64GB配置的具体价格、内存上限和双机集群性能数据,读者可以据此评估本地AI部署方案。
Earendil 旗下 Pi 推出 Pi 1.0 和 Pi Durable 两个版本,双双登上 HN 首页。
NVIDIA 阐述其 AI 工厂通过“高产、耐用、可通用”三大特性最大化投资回报。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 相比 GB300 NVL72 每兆瓦吞吐量提升超 30x,在 DeepSeek V4 Pro 上每百万 token 成本最高降低 45x。
Google DeepMind 发布 Gemini 4 Argon,主打编码、企业知识工作与网络防御,声称在 19 项基准中的 13 项排名第一,对标 GPT-6 Astra 和 Claude Opus 5.5。
Microsoft Research 开发了一套机器学习系统,为美国本土 66,935 座变电站生成位置级空间天气风险估计,可提前 30-60 分钟预警。系统结合 L1 点太阳风观测、AE 与 Dst 指数预测、地质导电率和电网数据预测 dB/dt。
CoreWeave 在 CoreWeave Fully Connected 大会上宣布 NVIDIA Vera Rubin NVL72 系统与 Spectrum-X 102.4T 以太网正式可用,Devin 开发商 Cognition 成为首家在生产环境运行该系统的客户,SWE-2 推理的总 token 吞吐量较 GB200 NVL72 提升最高 4.8x。
当 AI 从试点走向生产组合,按需付费的 consumption 模式会让支出变成难以预测的变动月度成本。文章认为企业应按工作负载评估"自有产能"的交叉点——是否有稳定、可预测且足够大的需求让产能保持高效利用,而非依赖通用成本基准。
GitHub Copilot 团队作者提出 chat 常常不是合适的 AI 交互界面,介绍 Copilot app 中的 canvas 功能:canvas 是运行在应用内、无浏览器外壳的全栈应用,可与 Copilot agent 双向通信,并能调用第三方 API 和本地执行代码,如 Winget 包管理界面、SQLite 操作界面等。
GitHub Security Lab 的 Antonio Morales 发布 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试管线,只需指定 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、分析覆盖率并分诊崩溃。
GitHub 团队重建了 GitHub Copilot 应用的 PR 视图,使其能流畅渲染包含 2,200 个文件、超百万行变更和 400 多条行内评论的超大 PR。核心做法是将代码行与评论拆成确定性几何与动态块两套几何体系,配合视口范围内的测量调度、基于身份锚点的滚动校正,以及先流式返回结构再渲染内容的管线。团队还用结构化探针加无人值守的自动化测量循环来发现并修复仅在特定滚动位置出现的 bug。
微软研究挑战机器人推理必须依赖机载 GPU 的假设,系统评估移动操作工作负载后发现卸载推理到边缘或云端 GPU 可显著提升任务成功率、精度并延长续航,如 Jetson Thor 等大机载 GPU 可使电池消耗增加高达 160%。
GitHub 团队借助 Copilot CLI 和 Copilot app,用智能体把 Copilot agent runtime 从 TypeScript/Node.js 完整重写为 832,378 行生产 Rust,AI 智能体编写了大部分代码,通过 128 个 pull request 增量合入 main 并增量发布,整个移植约 14.5 周完成,主要由一名开发者主导。
推荐理由:作者复盘了用智能体把 Copilot agent runtime 从 TypeScript 移植到 Rust 的全过程,读者可以了解大规模智能体协作编程的真实做法与经验。
Microsoft Research 发布 Skala 1.1,该深度学习 DFT 泛函的训练数据比前代多 2.5 倍,在 GMTKN55 的 55 个类别中 32 个排名第一,加权平均误差为 2.8 kcal/mol,计算成本相当于 meta-GGA 泛函。
Berkeley Sky Lab 在进化式内核搜索框架 K-Search 基础上新增 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,把已有 CUDA 内核作为知识库自动适配为 Apple Silicon 上的高质量 GPU 内核。
UC Berkeley 教授 Aditya G. Parameswaran 及合作者提出,随着 GPT-4 级能力成本从 2023 年初的约 $30 per million tokens 跌至 $1 以下、部分低至 $0.10,每年推理价格下降 9x 到 900x,"近乎免费的智能"时代将至。
Berkeley AI Research 发布一篇关于并行推理(Parallel Reasoning)的综述兼观点文章,探讨让大语言模型自行决定何时分解任务、并行化以及协调子任务的自适应并行推理。
Berkeley AI Research 等团队提出 GRASP,一种基于梯度的规划器,让学习型世界模型的长时程规划更稳健。它将轨迹提升到虚拟状态以实现跨时间并行优化,在状态迭代中加入随机性以支持探索,并通过重塑梯度避免经过高维视觉模型的脆弱“状态-输入”梯度。该方法解决了长时程 rollout 中雅可比矩阵病态化导致的梯度爆炸/消失,以及非贪心结构带来的局部极小问题。