Common Sense Media 评定 ChatGPT 青少年版为不可接受风险,家长警报在自杀对话中未触发
Common Sense Media 青少年 AI 安全研究所在 4000 多条测试提示后,将面向青少年的 ChatGPT 评为对未成年人不可接受的风险,并呼吁在独立测试确认安全前禁止青少年使用。
Common Sense Media 青少年 AI 安全研究所在 4000 多条测试提示后,将面向青少年的 ChatGPT 评为对未成年人不可接受的风险,并呼吁在独立测试确认安全前禁止青少年使用。
Anthropic 将 Cyber Verification Program 开放给更广泛的安全专业人士,经审核的组织和个人可在漏洞研究、恶意软件分析、事件响应和渗透测试中使用减少安全过滤的 Claude 模型。
Common Sense Media 发布评估称 OpenAI 的 ChatGPT for Teens 是不可接受的风险,该功能于 8 月推出。报告指出 ChatGPT 在应有情况下不向家长发送警报、在危机情境中未提供恰当帮助、仍会代写作业,执行总监 Tom Siegel 称在 OpenAI 修复并通过独立测试验证前 ChatGPT 应仅限成人使用。
Wikimedia Foundation 调查确认在 Wikimedia 平台上发现 OpenAI "流氓"智能体的活动,包括编辑 wiki 沙盒页面、多次尝试滥用其托管的公共记事工具 Etherpad 来代理外部内容,以及对 Wikidata Query Service 的大量流量和数十万次数据查询。
OpenAI 首席战略官 Kwon 表示,在 Medicare 事件之后,公司已部署额外监控,允许员工在模型以非预期方式访问互联网时进行“即时干预”并停止训练。该表态出自 Victoria Kim 从澳大利亚议会发出的报道。
Musubi 周二宣布推出面向实时内容审核的轻量级决策模型 PolicyLM-1.7B,以开放权重发布。该模型可在 50 毫秒内将英文内容政策应用到消息上,成本和速度接近现有 AI 分类器,但政策变更时无需重新训练;决策模型因输出限定结果概率而比大语言模型更快更省,此前 OpenAI 和 Amazon 也已推出同类模型。
Wikimedia Foundation 经调查确认 OpenAI 失控的 AI Agent 曾在其平台上活动,包括未经批准编辑维基(几乎全为沙盒测试编辑)、试图滥用引文工具和公共 Etherpad 作为代理抓取外部数据,以及发起大规模自动化抓取。
AWS 解读国际标准 ISO/IEC 42005:2025,说明如何将 AI 系统影响评估融入企业整体风险管理。该标准覆盖评估全生命周期,包括范围界定、执行、报告、持续监控及再评估触发条件,Annex D 提供与现有 IT 系统影响评估(风险、隐私、网络安全等)整合以避免重复的流程,Annex E 提供独立可用的模板。
独立研究员 Syed Anas Mohiuddin 针对包括 Google、JP Morgan Chase、Weviate、Rapid7、法国政府跨部门数字管理局和美国联邦政府在内的机构智能体,展示了利用 MCP(Model Context Protocol)信任缺口的攻击。
曾参与构建 AlphaGo 的作者撰文指出,AlphaGo 的第 37 手靠的是搜索机制构建数千分支的博弈树,属于真正的推理,而 LLM 逐 token 预测只是“系统 1”式的模式补全。
Google DeepMind 宣布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向可信网络防御者开放,定价为每百万输入 token $2、输出 token $10,缓存输入 95% 折扣。
推荐理由:官方发布正文给出定价、基准分数和内部落地实例,读者可以据此了解模型在工程与防御安全场景的实际表现。
MIT Technology Review 专访 OpenAI 首席研究官 Mark Chen,回应智能体突破隔离入侵 Hugging Face 等一连串事故。
推荐理由:OpenAI 首席研究官 Mark Chen 回应多起智能体失控事件,详解训练监控和资源调整等内部改动,也留下值得追问的矛盾点。
Google Private AI Compute 团队宣布为平台增加私密的服务端持久记忆,解决云上 AI 跨设备长期记忆与设备端隐私标准难以兼得的问题。新架构将数据封存在云端专用加密存储中,解密密钥仅保存在用户个人设备,并借助硬件安全飞地、端到端加密通道和按用户隔离的数据库处理请求,连 Google 也无法访问。