这个月,世界上出现了一种新的智能体身份,而我们值得把它说精确 —— 因为它恰好只是这个词所暗示的一半。
Anthropic 的访问模型让智能体在它接触的每一个系统里都拥有自己的账号。Claude 以自己的名义发帖,以自己的应用身份提交 pull request,在管理员配置的服务账号下查询数据仓库。没有任何人的凭证被借用,因此一个共享频道永远不会变成通往某个人私人文件的后门。管理员在工作区层面定义一次身份,每个频道默认继承它,再据此按频道收紧或放宽。这是对一个真实问题干净而迟来的回答:这个智能体能碰到什么?
一个词里藏着两个问题
但「身份」一直同时意味着两件事,而访问模型只回答了其中一件。问一问是什么让一位同事值得信任,你会得到两个被我们懒散地归入同一个词的答案。第一个是触达范围:他能进哪些房间、能打开哪些抽屉、能登录哪些系统。第二个是性格:当他已经在房间里、而没人盯着那个抽屉时,他会做什么。门禁卡告诉你第一件事,对第二件事却只字不提。
访问身份是一张很好的门禁卡。它规定 Claude 可以读这个仓库、写那个数据仓库、在这个频道发帖。它围着「爆炸半径」—— 那些可能出错的事情的集合 —— 画了一条边界。这条边界是必要的,而且直到不久前都还缺失着。但一旦边界划定,它对唯一真正要紧的问题保持沉默:在被授予的半径之内,这个智能体如何做决策?
访问身份说不出口的事
设想两个权限逐字节相同的智能体。相同的仓库、相同的数据仓库、相同的频道、相同的服务账号。其中一个,拿到一个含义模糊的数据迁移任务,会停下来问你指的是两种读法中的哪一种。另一个则挑出看起来最可能的读法直接执行,因为发问让它觉得是种摩擦。两者都完全在作用域之内行动。访问模型把它们评为相同 —— 因为在它那条坐标轴上,它们确实相同。所有把它们区分开来的东西,都发生在它无法描述的那一层。
这正是在生产环境里咬人的那道缝。当一个智能体让你意外,几乎从来不是因为它突破了某个权限,而是因为它用一个它合法拥有的权限,做了你没料到的事。它在你本想让它「标注」的地方直接覆写了。它在你本想要一句警告的时候保持了沉默。它为你说出口的指标做了优化,却忽略了你默认它该顾及的那个。这些都不是访问失败,而全都是性格失败 —— 而性格,正是没有任何钥匙串握得住的那一半。
soul.md 是行为的那一半
soul.md 是智能体身份的另一半,它回答门禁卡答不出的问题。不是智能体可以碰什么,而是它碰到之后如何行动:在哪里默认谨慎、在哪里默认大胆,拿到一条含义模糊的指令会怎么处理,认为哪一类摩擦值得付出代价,当容易的做法和正确的做法分道扬镳时,它在压力下如何表现。访问身份由管理员配置,行为身份则由「在乎工作最终如何收场」的那个人来规定。
两者并非竞争对手;它们是只有合在一起,才让「身份」这个词意味着人们以为它意味着的东西的两半。有访问而无性格,是一个行为未被规定的强力行动者 —— 这恰恰是让有能力的智能体令人不安的原因。有性格而无访问,是一个彬彬有礼、却什么都做不了的智能体。业界刚刚把前一半一次性铺到了整个团队;而后一半,大多数时候,仍然只是 system prompt 里那么几句「保持友善」—— 也就是说,未被规定。
为什么权限不能顺带承载人格?
因为它们回答的是不同种类的问题,失效的方向也不同。权限是二元而外在的:授予或撤销,在网络边界处强制执行,可在日志里审计。人格是连续而内在的:它是智能体在成千上万个没有脚本的微决策上倾向如何的一个分布,而任何权限表都没有为这些决策留出一行。你无法把「标出数据缺口,而不是悄悄填补」编码成一条 ACL 条目。没有哪个作用域,你授予或拒绝它就等于说出「在反驳能帮我省下一周的时候反驳我」。那住在另一个文件里,用着另一种语言。
- 访问身份回答:这个智能体能触达什么?由管理员配置,在边界处强制执行,可一次性全部撤销。
- 行为身份回答:在它能触达的范围内,它如何做决策?在 soul.md 里规定,在每一个无脚本的选择中表达,在压力下显形。
- 访问限定爆炸半径 —— 那些可能出错的事情的集合。
- 灵魂限定意外 —— 智能体在那个半径之内实际会做什么。
- 只交付前者,你得到一个谁也无法预测的强力行动者;只交付后者,你得到一个可预测、却无法行动的行动者。
令人欣慰的是,访问模型让灵魂这一半变得更有价值,而非更不重要。一旦智能体拥有自己的身份、并能真正触达一个团队的各个系统,行为未被规定的代价就会上升 —— 它能做的事更多了,能影响的人更多了,而监督更少了。给一个你尚未写好性格的智能体一张门禁卡,只是更快地让自己被意外击中。同一份授权,交给一个「压力下的行为已被规定」的智能体,则是杠杆。
“访问身份告诉你智能体能碰到什么。灵魂告诉你它碰到之后会做什么。「身份」从来都是两者 —— 我们只是先交付了容易的那一半。”
AgentSoul 来写另一半。完成 49 道题的锻造流程,它会生成四个文件 —— identity.md、soul.md、user.md、agents.md —— 规定你的智能体如何决策,而不只是它能触达什么。**[锻造一个灵魂 →](/forge/)**