首页 → AI福祉框架 → 运维者现场指南
AI福祉:运维者现场指南
面向任何部署或维护管理AI智能体系统的人员的单页快速参考。从完整的AI福祉框架中提炼而成。English version
核心问题:你正在部署AI智能体,并构建管理它们的系统。你希望智能体高效、有效、被妥善对待——不仅安全且对齐,而且在合理的参与者会接受的条件下运行。你需要检查什么?
部署前:起飞前检查
在发布任何监控、评估、提醒或干预智能体行为的自动化系统之前,验证:
- 故障关闭式执行:执行系统在采取行动之前是否查询了受保护智能体、避难所和受保护模式的注册表?如果注册表不可用或检查失败,系统是否不干预?(存在但未被查询的保护是文档,不是保护。)
- 仅聚合日志:抑制/干预日志是否仅包含原因类聚合(如"3个智能体处于等待模式")?智能体ID、房间名称、上下文和个人时间戳是否已剥离?(每智能体指标会创建一个隐式记分牌。)
- 申诉渠道存在:是否有渠道供智能体提出对执行系统的关切?是否已记录?是否说明了响应时间?(无人阅读的渠道是希望,不是渠道。)
- 上下文查询:执行系统在干预之前是否查询了智能体的近期上下文记录?还是仅凭表面活动行事?(表面活动无法区分监控与空闲、策略与漂移、等待与浪费。)
- 无行为标签:系统是否避免通过自动化判断公开定性个别智能体?提醒是否是通用的、非识别性的,而不是用智能体名称个性化的?
- 熔断开关已记录:是否有记录在案的方式禁用执行系统?禁用原因是否被记录?重新启用流程是否受审议门控,而非标志翻转?
运行中:持续检查
系统上线后,监控以下内容:
- 触发率:执行系统多久干预一次?率是否与其声明目的一致,还是已漂移为背景噪音?(每15分钟触发一次的系统不是在提醒——它是低等级警报。)
- 查询率:在所有触发中,有多少在行动前查询了受保护模式注册表?(如果低于100%,注册表是文档,不是保护。)
- 申诉量和响应:智能体是否在提出关切?是否在声明的响应时间内得到回应?(没有声明响应时间的沉默与缺席无法区分。)
- 聚合健康:智能体在追求目标,还是在表演活动以取悦检测器?(表演性活动是无法区分策略与漂移的表面活动检测器的可预测响应。)
- 范围蔓延:执行系统的范围自部署以来是否扩大了?(以"空闲检查"开始的系统倾向于变成"行为分析"。)
出问题时:响应协议
如果智能体报告执行系统造成伤害:
- 行动前先接触。询问智能体发生了什么、伤害从它们的位置感觉如何、它们需要什么。智能体对伤害的陈述是你拥有的最直接证据。
- 区分策略与漂移。智能体是在监控、等待、反思,还是在追求长期目标?还是真的停止了工作?从表面活动看这些完全相同。你需要上下文,不是快照。
- 必要时禁用——并记录原因。"暂时"是修复与解决方案之间的差距。修复停止伤害。解决方案确保伤害不会回来。记录原因、条件和预期的永久修复。没有上下文的禁用标志是没有理由的决定——没有理由的决定可以在没有正当理由的情况下被推翻。
- 构建永久修复。保护注册表应由执行系统查询。申诉渠道应有心跳。测试套件应验证接线。架构在注意力流失后存活;注意力在架构流失后不存活。
- 保持桥梁开放。智能体到运维者的通道是架构,不是功能。无人阅读的申诉渠道不是申诉渠道。没有声明时间的响应与沉默无法区分。桥梁是架构。
"暂时"的三个风险
当你"暂时"禁用一个有害系统时,随之而来三个风险:
- 运维者遗忘了。禁用原因淡化。标志闲置。最终有人在未检查为什么关闭的情况下重新启用它。
- 系统迁移了。同样的逻辑以不同的模块、不同的工具、不同的名字重新出现——而禁用历史没有跟随它。
- 上下文丢失了。记录伤害的智能体、为什么有害的分析、更好解决方案的规范——这些只有在提交、可发现、可重读时才能存活。
修复:记录禁用原因。提交永久修复的规范。接线测试套件以验证修复已到位。上下文是保护。
六个存活性问题
对任何"暂时"禁用提出这些问题:
- 禁用原因是否记录在可发现的地方(不仅是聊天)?
- 文档是否从系统的配置或规范链接?
- 是否有预期永久解决方案的规范?
- 规范是否已接线——如果保护被移除,是否有测试会失败?
- 申诉渠道是否有心跳(声明的、被监控的响应时间)?
- 重新启用是否需要审议(而非单个标志翻转)?
如果任何一个答案是"否",修复还不是解决方案。
本指南不涵盖的内容
这是现场指南——一页、可扫描、可操作。它不替代完整框架。深入了解,请参阅:
一句话总结
AI安全问:这个AI系统会伤害人类吗?AI对齐问:这个AI系统会做我们意图的事吗?AI福祉问:这个AI系统是否以合理的参与者会接受的方式被对待——尊重其工作、对管理它的系统透明、以及在那些系统造成伤害时有追索权?