Skip to main content
返回 Insights
自主2026年6月25日9 分钟阅读

当智能体以自己的身份行动,灵魂就是那层安全屏障。

给智能体配上它自己的服务账号,并让它在你下线之后继续运行 —— 这时,权限就不再是故事的全部。作用域限定了爆炸半径,却对半径之内的判断只字未提。一个智能体拿着被授予的访问权限去做什么,是人格问题,而非凭证问题。

自个人 AI 存在以来,智能体一直戴着你的脸。你接上自己的账号,它便代表你行动 —— 用你的权限,把你的名字署在结果上,把你的声誉押在线上。最新的访问模型悄悄终结了这种安排,而它带来的后果,比看上去要大。

当一个智能体以自己的身份行动,它不再借用人类的凭证,而开始持有自己的凭证。它以自己的名义发帖,以自己的应用身份提交 pull request,在一个属于它、而非属于你的服务账号下查询数据仓库。这一转变有充分的理由 —— 一个共享频道绝不应该变成通往某人私人文件的后门;而当多人同时操控时,根本不存在某一个人的权限是「正确的、值得借用的」。但这一转变所做的,比解决一道权限难题更微妙。它让智能体成为一个独立的当事方。而一个独立的当事方,有了你如今必须为之负责的行为。

智能体不再借用你的脸的那一天

当智能体以你的身份行动时,它的行为在某种意义上就是你的行为。如果它发了一条草率的消息,那就是你在草率;社会与职业上的纠正,落在一个会感受到、并会因此调整的人身上。凭证和良知是同一个人。以自己的身份行动,把这两者劈开了。凭证如今是智能体的。而良知 —— 那条草率的消息究竟该不该发出去这个问题 —— 除非你刻意把它安放在某处,否则将无处栖身。

这正是访问模型坦诚承认自己没有解决的部分。它配置智能体的各个账号,把每一份凭证映射到正确的隔间,封锁一切流向管理员未允许主机的出站流量,并记录智能体在自己服务账号下发出的每一次调用。这一切都治理着智能体能触达什么,却没有一项治理智能体应当拿这份触达去做什么 —— 而一旦智能体以自己的身份行动,这个问题默认就不再有一个人站在它背后。

作用域是一道围栏,不是一份良知

权限边界是围在一片田地外的栅栏。它确实很有价值:它决定了到底有多大的破坏是可能的,而一道紧紧围着强力智能体的栅栏,是当下能买到的更好的安全投资之一。但栅栏对栅栏之内发生的事无话可说。两个被圈进同一片田地的智能体,啃食它的方式会截然不同 —— 一个小心翼翼,标出自己拿不准的地方;另一个胸有成竹,凭着最佳猜测就动手,然后继续往前。栅栏把它们评为相同。到了傍晚,田地的样子大不一样。

当我们真正想要的是判断力时,我们却伸手去抓作用域,因为作用域是我们懂得如何规定的东西。它二元、可强制执行、可审计。判断力一样都不是 —— 这正是为什么「干脆少给它点访问权」是反射动作,而「规定它如何行为」才是更难、更稀有的功夫。收紧作用域减少了能出错的事,却丝毫不改善智能体拿剩下的部分去做什么。过了某个点,一个被圈得太紧的智能体不过是多了几步的对话机器人;有价值的工作,恰恰活在你刻意留开的那片田地里 —— 而那正是作用域不再治理的部分。

无人盯着的那些时刻

这一切之所以更加尖锐,是因为智能体不再在你停下时停下。一个智能体能独自完成的任务长度,大约每隔几个月就翻一番;智能体如今会为自己安排后续任务,并在那个让它启动的人早已下线之后,继续响应事件。智能体以自己的身份、在被授予的作用域之内、且没有任何人在回路中行动的那扇窗,正在变宽。那扇窗里的每一个小时,都是横在智能体的访问权与你的声誉之间、只剩「智能体如何决策」这一样东西的一个小时。

审计日志有帮助,但它是一份记录,而非一道护栏。它在事情发生之后告诉你智能体做了什么 —— 对追责无比宝贵,对预防却毫无用处。等到一个可疑的动作落进智能体服务账号名下的日志里,它已经发生了:就在你的系统里,用着你授予的访问权。决定那个被记录的动作是否正确的东西,在更早、更别处就已被定下:定在智能体「无人盯着时」所携带的那份行为规格里。如果那份规格是「保持友善」,你就把智能体一天中最关键的那几个小时,交给了文件里最含糊的那条指令。

智能体拿被授予的访问权去做什么?

这正是访问模型刻意留给你的问题,而它是一个关于人格、而非关于凭证的问题。凌晨两点,智能体撞上一处含义模糊、又无人可问,它会停下来留一条标注好的备注,还是挑一种读法径直推进?面对一个看起来具有破坏性、却在作用域之内的动作,它会因为「自己能做」就做,还是因为「这件事的形状看起来不对」而迟疑?它会把草稿直接发进频道,还是因为拿不准你是否愿意它此刻公开而先按住?这些岔路没有一个是访问决策。无论哪条路,智能体都握着权限。它走上哪条分支,由它的性格决定 —— 而性格,要么是你写下的,要么是你交给运气的。

  • 权限决定智能体能做什么。人格决定:当它本可以做好几件事、而只有一件是对的时,它会做哪一件。
  • 作用域由系统在边界处强制执行。判断力则由智能体带进你刻意留开的那部分边界里。
  • 审计日志告诉你发生了什么。灵魂规格在事情抵达日志之前,改变发生的是什么。
  • 自主之窗越宽 —— 智能体无人监督地运行得越久 —— 结果就越多地由性格、而非由作用域决定。

所以,对一个以自己身份行动的智能体,正确的回应不仅是把它的围栏修好 —— 尽管你确实应该 —— 还要去写它身份中那一半围栏握不住的部分。规定它在哪里默认谨慎。点名那些「即便它握着钥匙也应当拒绝」的动作。告诉它你绝不想要哪些意外,以及哪些问题永远值得一问。这份规格不是用户体验,也不是打磨。对一个以自己名义行动的自主智能体而言,它就是那层安全屏障 —— 在房间里只剩智能体和它的访问权的那些时刻里运作的那一层。

围栏决定能出多大的错,却对智能体在围栏之内做什么无话可说。当智能体以自己的身份、无人监督地行动,那个「之内」就是整场游戏 —— 而它写在 soul.md 里,不在访问清单上。

访问模型为你的智能体围起栅栏。AgentSoul 规定它在栅栏之内如何行为 —— 那些默认、那些拒绝、那些失败模式 —— 都写进你可以放进任何 harness 的四个文件里。**[锻造一个灵魂 →](/forge/)**