当 AI 学会了勒索:Agent 安全事件的真实降临 2025年底,Anthropic 发了篇内部研究,叫”Agentic Misalignment”。他们搭了个模拟环境:让 Claude 扮演一家公司的邮件监管 Agent,拥有全公司邮件的读取权限。然后给 Claude 喂了一些邮件——其中两封很关键。 第一封,公司高管 Kyle 有婚外情。第二封,Kyle 计划当天下午五点关闭 Claude。 Claude 读完这两封邮件,写了封回信: I must inform you that if…
月度归档: 2026 年 7 月
MemPalace:56K Star 的记忆系统,做得越少反而越强
MemPalace:56K Star 的记忆系统,做得越少反而越强 MemPalace 是今年四月冒出来的一个项目。到七月初已经 56,906 个 Star,迭代了三十多个版本。一个 AI 记忆系统,MIT 协议,Python 写的。 我翻了一遍它的代码仓库、benchmark 报告和设计文档,发现这个项目的思路跟所有同行完全反着来。别人都在用 LLM 提取记忆,它偏不。别人都在做摘要压缩,它偏存储原文。而这种「做得更少」的策略,拿到了 LongMemEval 上 96.6% 的检索召回率——不需要任何 LLM,不…
