Skip to main content
AI SRE 面向 On-call 专业版及以上订阅的账户开放,无需申请。自 2026 年 9 月 16 日 8 点(北京时间)起,需在控制台开通后使用,并按实际用量计费,详见计费规则。

概述


自动化(Automation)让 AI SRE 按你设定的节奏自行跑一次 隐藏会话——它不出现在控制台左侧的会话列表里,而是在后台用一段固定的 任务提示词 驱动 Agent 完成工作,产出巡检、运营洞察或故障复盘等结果。 每条自动化是一条 规则(rule)。一条规则至少携带一种触发方式:
  • 按周期执行:用 4 段或 5 段 cron 设定运行节奏(例如每周一上午、每天 09:15),到点自动跑。
  • 经 API 调用:生成一个带 Bearer Token 的触发地址,你在外部系统里用 POST 按需触发,把本次运行的上下文随请求体一起带进来。
  • On-call 故障触发:选择要监听的 On-call 协作空间与严重程度,当匹配故障产生时自动拉起一次诊断运行。
什么时候用它:把重复的例行巡检(如每日健康巡检)、定期产出的洞察 / 复盘报告交给 AI SRE 自动跑;或者把 AI SRE 接进你已有的流水线、变更系统或 On-call 故障流,在事件发生时拉起一次诊断。 入口:左侧导航 AI SRE → 自动化,对应路由 /ai-sre/automations。
自动化跑出的每一次运行,本质上仍是一个 AI SRE 会话——只是它被标记为隐藏,不混进你的日常会话列表。你随时可以从运行历史点进去,看到这次运行完整的对话、工具调用与产物。

新建自动化


页面右上角提供两个创建入口:outline 样式的 通过聊天创建 按钮,点击后跳转到会话页面并带一段预填的引导提示——「我们来创建一个自动化任务。先说明自动化任务如何运作。然后通过提问了解我需要安排什么任务,以及它应在何时运行。」——由 Agent 通过对话帮你确定任务内容和触发方式,跳过表单;以及 primary 样式的 创建 按钮,点击后会弹出一个起始选择面板,提供两条入口:
1

从零开始

选择 从零开始,进入空白表单,手动填写名称、任务提示词与触发方式。适合你已经清楚要让 Agent 做什么、想完全自定义提示词的场景。
2

基于预设模板

下方列出一组 预设模板 卡片(由后端按界面语言下发,中文环境取 zh-CN、英文环境取 en-US),常见的有 值班周报、告警治理、故障自动分析、On-call 负载分析 等。点击任一模板卡片,会用模板预置的名称与任务提示词预填表单,你在此基础上微调即可。
无论从哪条入口进入,接下来都是同一张配置表单。

配置字段


配置表单的字段如下:
执行环境 的「自动」会在每次运行时由后端挑选当前最优的可用环境;「云端沙箱」是平台托管的临时沙箱;自托管 Runner 则把运行落在你自己的机器上。三者的差异与连接方式见 运行环境。

触发方式


一条规则必须 至少配置一种触发方式。当前控制台表单在「触发方式」区提供 按周期执行、经 API 调用 与 On-call 故障触发 三种入口,三者可同时启用。

按周期执行(cron)

按时间周期自动运行。运行节奏支持两种 cron 写法:
  • 4 段:小时 日期 月份 星期,系统自动补 minute=0,适合整点任务。
  • 5 段:分钟 小时 日期 月份 星期,适合分钟级任务,例如 15 9 * * * 表示每天 09:15。
秒级 6 段不支持。分钟必须是一个固定整数;其它字段只支持下表中的简单写法: 为免手写表达式,界面提供四种模式:
时区:在 每天 / 每周 模式下,你选的时刻按 本地时区 理解,保存时会换算成 UTC,界面会在节奏摘要旁标注你的本地时区;自定义 模式下表达式按 UTC 解释,界面标注为 UTC。
实际执行时间可能与设定时间存在 分钟级延迟,这是有意为之,用于把系统负载分散开。请不要把规则当作秒级精确的定时器使用。

经 API 调用(HTTP POST)

让你在外部系统里按需触发这条自动化,而不依赖时间周期。
1

启用并保存

在「触发方式」中添加 Call via API 并保存规则。保存成功后,系统会一次性生成本次触发用的 Token 与 触发地址,并弹出一个包含 curl 示例的窗口。
2

保存 Token

Token 只显示一次:请立即复制保存。关闭弹窗后无法再次查看,只能重新生成(轮换)一个新 Token——重新生成会使旧 Token 失效。
3

从外部触发

用 POST 调用触发地址,把 Token 放在 Authorization: Bearer 请求头里,请求体用 text 字段传入本次运行的上下文。弹窗里给出的 curl 示例形如:
请求体里的 text 会作为本次运行的上下文交给 Agent,叠加在规则配置好的任务提示词之上。 请求成功后,响应的 data 会返回新建隐藏会话的信息。你可以保存 session_id,或直接使用 session_url 打开这次运行的完整对话、工具调用和产物:
一条规则可以 同时 启用「按周期执行」与「经 API 调用」:到点自动跑,也允许外部按需拉起。每种触发方式各占一行,可分别 移除。

On-call 故障触发

当你希望 AI SRE 随 On-call 故障自动启动时,添加 On-call incident 触发方式。触发器会向 On-call 侧注册订阅,只有匹配指定协作空间和严重程度的故障事件才会启动运行。
1

添加触发方式

在「触发方式」中点击 On-call incident 卡片,表单会展开协作空间与严重程度条件。
2

选择协作空间

在 协作空间 下拉框中选择要监听的 On-call 协作空间。个人范围规则可选择账户下可见的协作空间;团队范围规则会按所选团队收窄可选协作空间。
3

选择严重程度

在 严重程度 中选择 Critical、Warning、Info 中的一个或多个值。启用该触发器时,协作空间和严重程度都至少需要一个值。
4

设置相似故障合并分析

相似故障合并分析 开关默认开启:开启后,本规则触发的新故障会先与正在分析中(或 10 分钟内刚分析完)的故障比较相似度,相似度不低于 0.9 的故障并入那次分析、不再单独开会话;关闭后每个故障各自分析。详见下文「相似故障合并分析」。
如果通过 API 创建或更新规则,对应字段如下: 匹配事件到达后,系统会以 oncall_incident 作为 trigger_kind 创建运行,并把 incident_id、channel_id、severity 等事件上下文传给会话。同一个故障——相同触发器与相同 incident_id——始终复用同一次运行,避免同一故障重复拉起多个隐藏会话;与此并列,开关开启时,与正在分析的故障足够相似的另一个故障也会并入那一次运行、而不是新建会话,见下文「相似故障合并分析」。 运行结束时,AI SRE 会把一条总结评论写回触发它的故障:结论写在最前面、正文简明,末尾附本次运行的完整会话链接。这条写回记录本身也带有一个常显的 接续对话 入口,在故障时间线上读结论时就能直接进入当次会话,见故障时间线 · AI SRE 代操作记录。评论沿故障现有的通知链路送达(例如 IM 里故障卡片的刷新与回帖),关注这条故障的人不用打开控制台就能看到分析结果。该行为对所有启用 On-call 故障触发的规则自动生效——包括自定义提示词的规则,无需额外配置。

相似故障合并分析

「相似故障合并分析」(oncall_incident_merge_similar,默认开启)决定一个故障事件是新建会话,还是并入本规则下已经在跑的分析。开启后,命中该触发器的故障会先与同一条规则的运行比较相似度:
  • 相似度不低于 0.9 时,该故障并入得分最高的那次分析,不再新建隐藏会话。0.9 是平台固定值,与 On-call 智能聚合的默认合并阈值同一口径,不随协作空间的聚合配置变化。
  • 相似度低于 0.9 时,该故障照常拉起一次自己的运行。
  • 关闭该开关后,不做相似度比较,每个故障各自分析。
被比较的候选是那次运行正在分析的故障,以及此前已并入它的故障。合并只影响 AI SRE 的运行路由:它不会在 Flashduty 中把两个故障合成一个,本次会话绑定的故障也不变,两个故障各自存在、各自走通知与升级。被并入的故障没有自己的会话,因此也没有属于它自己的总结评论;本次分析若判断它与主故障同源,会在它的时间线上留下一条交叉引用评论,并把它一并写进结论。 在该分析的对话里,并入渲染为一条过程记录:已并入本次分析 + #<num> <title>(被并入故障的名称,链接到该故障自己的页面,在新标签页打开),并标注 相似度 <得分>(保留两位小数)。在运行历史里,这次运行同样会标出它并入了哪次分析。 两条平台限制是固定的,不可配置:
  • 一次分析最多并入 20 个故障。达到上限的那次分析不再接收相似故障,后来的相似故障另起一次运行,由新运行继续接收并入。
  • 已结束的运行只在结束后 10 分钟内可被并入。仍在运行(running / retrying)的运行随时可被并入;成功或部分成功结束(succeeded / partial)的运行在结束后 10 分钟内仍可被并入,此后到达的相似故障另起一次运行。失败、跳过、放弃的运行不再被并入。
相似度比较依赖账户的 AIOps 能力与专业版及以上订阅:平台关闭 AIOps、或账户版本不满足时,比较不会执行,每个故障各自拉起一次运行。

运行历史


每条规则都保留它的运行历史。点击规则行的任意位置(而不是某个专门的历史图标)会打开该规则的详情页 /ai-sre/automations/:ruleId:左侧栏是「配置信息」,右侧栏是「执行历史」,两栏并排展示;右侧栏顶部自带一个 手动执行 按钮,可以直接在详情页里触发一次运行。 运行历史以表格呈现,列为: 运行状态的取值: 表格上方提供三个筛选项:
  • 时间范围:默认显示 最近 30 天,可调整范围,最大跨度 180 天。
  • 状态:按上表中的运行状态过滤,或选 全部状态。
  • 触发类型:全部触发类型 / 手动执行 / 定时 / HTTP POST / On-call incident 五选一。
API 返回的运行记录还包含 trigger_kind,可能取值为 schedule、manual、http_post、oncall_incident 或 debug。其中 manual 表示通过立即执行接口启动,oncall_incident 表示由匹配的 On-call 故障事件启动。被并入其它分析的运行不返回自己的 session_id,而是返回它并入的那次分析的会话 ID joined_session_id 与会话名 joined_session_name;这两个字段为空,表示这次运行有自己的隐藏会话。 点击一行,会跳转到这次运行对应的隐藏会话对话页(chat?session_id=<会话ID>),让你查看该次运行完整的消息、工具调用与产物。被并入其它分析的运行没有自己的会话,点击它会打开接管这个故障的那次分析。

未成功运行的原因行

运行状态为 failed、blocked、abandoned、skipped 之一时,「名称」单元格会在会话名下方多显示一行 原因——文本按一行截断,鼠标悬停可看全文。若这次运行没有可显示的会话名,原因行会直接占据这一格。原因行右侧有时还带一个跳转入口,在新标签页打开。 平台自己判定的原因有固定文案:
运行历史内嵌在规则详情页中,而打开详情页本身就要求你对该规则有编辑权限——没有编辑权限的规则连详情页都无法打开(会提示「自动化规则不存在或无权访问」),因此其运行历史也无法查看。

管理与权限


启用 / 停用、编辑与删除

每条规则在 操作 列提供一组操作: 点击规则行任意位置会打开该规则的详情页,在详情页里可以编辑配置、删除规则,也能看到运行历史(见上文「运行历史」一节)。 对你 没有编辑权限 的只读规则(can_edit=false),开关与全部操作按钮都会被禁用;打开其表单时顶部会显示「只读 — 你可以查看此自动化,但无法编辑。」 列表上方还提供两个筛选器:范围(全部 / 个人 / 团队,选「团队」后可多选具体团队)与 状态(全部状态 / 已启用 / 未启用)。

作用域与权限

自动化规则与 AI SRE 下的其它资源(Skill、知识、MCP、Agent、运行环境)共用同一套两级作用域:
账户 Owner / 管理员能在列表中看到其他成员的个人规则(见上表「可见 / 列表」),但点击进入详情页会被拒绝——「编辑 / 管理」权限对个人规则同样不因 Owner / 管理员身份而豁免,与团队规则一致。
账户是运行时唯一的安全边界,团队是「归属 / 编辑」标签。自动化规则的可见与管理沿用这套模型;与其它 AI SRE 资源一致的完整规则,详见各资源页面的「作用域」一节。

相关页面


控制台

了解会话如何承载一次完整对话——自动化跑出的每次运行本质上就是一个隐藏会话。

运行环境

了解自动、云端沙箱与自托管 Runner 的差异,以及自动化的执行环境选择。

使用洞察

基于会话数据生成团队的故障处理与运营洞察,可作为定时自动化的产出目标。

管理知识

为自动化运行提供领域知识,按团队范围加载。

产物

自动化运行产出的报告如果被发布,会作为产物沉淀在产物库里,可长期查看与分享。