公测功能:AI SRE 正在公测,面向 On-call 专业版及以上账户灰度开放,公测期间不单独收费;如需开通,请填写 AI SRE 公测申请表。功能与界面可能继续调整。
概述
自动化(Automation)让 AI SRE 按你设定的节奏自行跑一次 隐藏会话——它不出现在控制台左侧的会话列表里,而是在后台用一段固定的 任务提示词 驱动 Agent 完成工作,产出巡检、运营洞察或故障复盘等结果。 每条自动化是一条 规则(rule)。一条规则至少携带一种触发方式:
- 按周期执行:用 4 段或 5 段 cron 设定运行节奏(例如每周一上午、每天 09:15),到点自动跑。
- 经 API 调用:生成一个带 Bearer Token 的触发地址,你在外部系统里用
POST按需触发,把本次运行的上下文随请求体一起带进来。 - On-call 故障触发:选择要监听的 On-call 协作空间与严重程度,当匹配故障产生时自动拉起一次诊断运行。
/ai-sre/automations。
自动化跑出的每一次运行,本质上仍是一个 AI SRE 会话——只是它被标记为隐藏,不混进你的日常会话列表。你随时可以从运行历史点进去,看到这次运行完整的对话、工具调用与产物。
新建自动化
页面右上角提供两个创建入口:outline 样式的 通过聊天创建 按钮,点击后跳转到会话页面并带一段预填的引导提示——「我们来创建一个自动化任务。先说明自动化任务如何运作。然后通过提问了解我需要安排什么任务,以及它应在何时运行。」——由 Agent 通过对话帮你确定任务内容和触发方式,跳过表单;以及 primary 样式的 创建 按钮,点击后会弹出一个起始选择面板,提供两条入口:
1
从零开始
选择 从零开始,进入空白表单,手动填写名称、任务提示词与触发方式。适合你已经清楚要让 Agent 做什么、想完全自定义提示词的场景。
2
基于预设模板
下方列出一组 预设模板 卡片(由后端按界面语言下发,中文环境取
zh-CN、英文环境取 en-US),常见的有 告警噪音分析、事故响应复盘、每周值班洞察、升级和值班负载分析 等。点击任一模板卡片,会用模板预置的名称与任务提示词预填表单,你在此基础上微调即可。配置字段
配置表单的字段如下:
执行 Environment 的「自动」会在每次运行时由后端挑选当前最优的可用环境;「云端沙箱」是平台托管的临时沙箱;自托管 Runner 则把运行落在你自己的机器上。三者的差异与连接方式见 运行环境。
触发方式
一条规则必须 至少配置一种触发方式。当前控制台表单在「触发方式」区提供 按周期执行、经 API 调用 与 On-call 故障触发 三种入口,三者可同时启用。
按周期执行(cron)
按时间周期自动运行。运行节奏支持两种 cron 写法:- 4 段:
小时 日期 月份 星期,系统自动补minute=0,适合整点任务。 - 5 段:
分钟 小时 日期 月份 星期,适合分钟级任务,例如15 9 * * *表示每天 09:15。
为免手写表达式,界面提供四种模式:
实际执行时间可能与设定时间存在 分钟级延迟,这是有意为之,用于把系统负载分散开。请不要把规则当作秒级精确的定时器使用。
经 API 调用(HTTP POST)
让你在外部系统里按需触发这条自动化,而不依赖时间周期。1
启用并保存
在「触发方式」中添加 Call via API 并保存规则。保存成功后,系统会一次性生成本次触发用的 Token 与 触发地址,并弹出一个包含
curl 示例的窗口。2
保存 Token
Token 只显示一次:请立即复制保存。关闭弹窗后无法再次查看,只能重新生成(轮换)一个新 Token——重新生成会使旧 Token 失效。
3
从外部触发
用
POST 调用触发地址,把 Token 放在 Authorization: Bearer 请求头里,请求体用 text 字段传入本次运行的上下文。弹窗里给出的 curl 示例形如:text 会作为本次运行的上下文交给 Agent,叠加在规则配置好的任务提示词之上。
请求成功后,响应的 data 会返回新建隐藏会话的信息。你可以保存 session_id,或直接使用 session_url 打开这次运行的完整对话、工具调用和产物:
On-call 故障触发
当你希望 AI SRE 随 On-call 故障自动启动时,添加 On-call incident 触发方式。触发器会向 On-call 侧注册订阅,只有匹配指定协作空间和严重程度的故障事件才会启动运行。1
添加触发方式
在「触发方式」中点击 On-call incident 卡片,表单会展开协作空间与严重程度条件。
2
选择协作空间
在 协作空间 下拉框中选择要监听的 On-call 协作空间。个人范围规则可选择账户下可见的协作空间;团队范围规则会按所选团队收窄可选协作空间。
3
选择严重程度
在 严重程度 中选择
Critical、Warning、Info 中的一个或多个值。启用该触发器时,协作空间和严重程度都至少需要一个值。
匹配事件到达后,系统会以
oncall_incident 作为 trigger_kind 创建运行,并把 incident_id、channel_id、severity 等事件上下文传给会话。相同触发器与相同 incident_id 会复用同一次运行,避免同一故障重复拉起多个隐藏会话。
运行历史
每条规则都保留它的运行历史。点击规则行的任意位置(而不是某个专门的历史图标)会打开该规则的详情页
/ai-sre/automations/:ruleId:左侧栏是「配置信息」,右侧栏是「执行历史」,两栏并排展示;右侧栏顶部自带一个 手动执行 按钮,可以直接在详情页里触发一次运行。
运行历史以表格呈现,列为:
运行状态的取值:
表格上方提供三个筛选项:
- 时间范围:默认显示 最近 30 天,可调整范围,最大跨度 180 天。
- 状态:按上表中的运行状态过滤,或选 全部状态。
- 触发类型:
全部触发类型/Schedule/HTTP POST三选一。
「触发类型」筛选项目前不包含 On-call incident 选项——即便「触发」列本身能显示
On-call incident 标签,也暂时无法单独按它筛选。trigger_kind,可能取值为 schedule、manual、http_post、oncall_incident 或 debug。其中 manual 表示通过立即执行接口启动,oncall_incident 表示由匹配的 On-call 故障事件启动。
点击任意一行,会跳转到这次运行对应的隐藏会话对话页(chat?session_id=<会话ID>),让你查看该次运行完整的消息、工具调用与产物。
运行历史内嵌在规则详情页中,而打开详情页本身就要求你对该规则有编辑权限——没有编辑权限的规则连详情页都无法打开(会提示「自动化规则不存在或无权访问」),因此其运行历史也无法查看。
管理与权限
启用 / 停用、编辑与删除
每条规则在 操作 列提供一组操作:
点击规则行任意位置会打开该规则的详情页,在详情页里可以编辑配置、删除规则,也能看到运行历史(见上文「运行历史」一节)。
对你 没有编辑权限 的只读规则(
can_edit=false),开关与全部操作按钮都会被禁用;打开其表单时顶部会显示「只读 — 你可以查看此自动化,但无法编辑。」
列表上方还提供两个筛选器:范围(全部 / 个人 / 团队,选「团队」后可多选具体团队)与 状态(全部状态 / 已启用 / 未启用)。
作用域与权限
自动化规则与 Customize 下的其它资源(Skill、知识库、MCP、Agent、运行环境)共用同一套两级作用域:账户 Owner / 管理员能在列表中看到其他成员的个人规则(见上表「可见 / 列表」),但点击进入详情页会被拒绝——「编辑 / 管理」权限不会像团队规则那样因 Owner / 管理员身份而对个人规则豁免。
相关页面
控制台
了解会话如何承载一次完整对话——自动化跑出的每次运行本质上就是一个隐藏会话。
运行环境
了解自动、云端沙箱与自托管 Runner 的差异,以及自动化的执行环境选择。
使用洞察
基于会话数据生成团队的故障处理与运营洞察,可作为定时自动化的产出目标。
管理知识
为自动化运行提供领域知识,按团队范围加载。
产物
自动化运行产出的报告如果被发布,会作为产物沉淀在产物库里,可长期查看与分享。