Skip to main content
AI SRE 面向 On-call 专业版及以上订阅的账户开放,无需申请。自 2026 年 9 月 16 日 8 点(北京时间)起,需在控制台开通后使用,并按实际用量计费,详见计费规则。

概述


排障往往就发生在你的 IM 群里——告警推过来、大家在群里讨论、拉个作战室。AI SRE 把 Agent 直接放进这条协作链路:你不必切换到控制台,就能在 IM 里召唤它排查,团队成员也能全程看到它的分析过程。 AI SRE 的 IM 集成有两种触发方式:

@ 提及召唤

在群聊或私聊里 @ AI SRE 并描述问题,即可发起或续接一次排查。它在线程内回答,对话上下文与这条 IM 会话绑定。

作战室自动诊断

为故障开启 IM 作战室时,若该集成保留默认开启的 自动发起 AI 故障分析,AI SRE 会跑一轮初步诊断,并把结论作为一条分析消息回贴到作战室——无需任何人手动召唤。

支持的 IM 平台


AI SRE 的 IM 交互覆盖四个主流平台,每个平台都支持入站的 @ 提及(webhook)、历史消息读取与出站回复: 「处理中回执」是机器人收到你的消息后给出的即时信号,各平台的具体形式见处理中回执。
IM 交互依赖你已在 Flashduty 中接入对应平台的机器人(用于告警通知与协作的同一套 IM 机器人)。请先在 Flashduty 的 IM 集成中完成机器人配置,AI SRE 才能在该平台收发消息。

IM 集成中的 AI SRE 设置


在 On-call → 集成中心 → 集成列表 → 即时消息 打开对应 IM 集成详情,在 增强功能 中分别配置该集成的 AI SRE 行为。以下开关默认均为开启:
  • 自动发起 AI 故障分析:开启作战室后可配置;集成成功创建作战室时,自动发起一次 AI SRE 初步诊断并把结果回贴到作战室。
  • 允许在 IM 中使用 AI SRE:无需开启作战室即可配置,同时控制 群聊 @ 提及 与 机器人私聊 两个入口;Slack 在此之外还控制 /fd 命令。关闭后,群聊 @ 提及、机器人私聊(Slack 另含 /fd 命令)都不会触发 AI SRE 回复。企业微信的第三方应用模式只支持机器人私聊,群聊 @ 提及需使用企业自建应用模式。
  • 普通群聊中 AI SRE 使用话题回复:仅飞书/Lark 与 Slack 提供。开启后,普通群聊中的每个话题对应一个独立 Session;作战室仍直接在群内回复。
若账户尚未开通 AI SRE,这些开关不会实际生效;开通后会按各 IM 集成自己的设置生效。

@ 提及召唤


在已接入并开启了 允许在 IM 中使用 AI SRE 的 IM 群里 @ 机器人 并写下你的问题(例如「@AI SRE 看下 payment 服务为什么 5xx 飙升」),消息会通过平台 webhook 转给 AI SRE 处理:
1

识别提及

平台区分群聊 @ 提及与私聊消息两种入口。被提及后,AI SRE 会做去重、给这条消息贴一个「处理中」回执(见处理中回执),并识别消息里是否带有命令式指令。
2

绑定会话

AI SRE 以「账户 + 平台 + 会话(chat)」为键定位一个会话:同一个 IM 会话里的多次 @ 提及,会续接到同一个 Agent 会话,从而保留上下文。若是新会话,平台会带入该 IM 线程的起始消息、以及(若有)关联的故障作为初始上下文。
3

读取上下文作答

AI SRE 读取线程 / 会话的历史消息构建上下文,自主排查,并把结论在线程内回复。消息里一并 @ 到的其他人也会被保留为提及对象,在回复中带上,方便多方在群里协作。
回复模式可配置(off / first / all),决定 AI SRE 是否在回复时 @ 提问者、以及是在线程内还是主频道作答。在嘈杂的大群里,线程内回复能让排查讨论保持聚拢、不刷屏。

处理中回执

收到你的消息后,机器人会先给你发出的那条消息贴一个表情回执,作为「已收到、正在处理」的即时信号。表情从该平台自己的表情池里随机挑选,不再固定某一个: Slack 除此之外还会显示一条原生的「正在处理」状态,与表情回执并存。 答案送达后,回执会被移除。单次移除失败(平台抖动、限流)不会让表情永远留在消息上:下一次成功投递会按当初贴上的那个表情重试移除,卡住的回执最终都会被清掉。 企业微信没有表情接口,它的「处理中」回执是一条占位消息(随机的一句「收到,处理中…」),随后被任务清单卡片与最终回答就地替换。

答复如何抵达聊天

AI SRE 在 IM 里的答复只经 reply 工具投递——模型输出的普通文本是内部草稿,不会自动发到聊天。你把一次排查交给它之后,群里出现的每一条消息都是它主动提交的,属于两类之一:
  • 结论:回答你的具体问题,或给出一个可行动的阶段性结论。
  • 进展:工作仍在进行时的一两句话更新——确认的进展、当前在等什么、遇到的真实阻塞。进展消息不是结论,它不结束这轮任务,结论会照常单独投递。
如果一轮以自然收尾结束,而结论只写成了普通文本、没有经 reply 提交,系统会自动补一次只允许投递的纠正:这次纠正只开放 reply,不执行任何调查或变更类操作;纠正后仍未提交,该轮以错误结束——那份草稿始终不会出现在群里。取消、被新消息打断、派发子代理、等待子代理回报、输出被截断等非自然结束的回合不会触发这次纠正。 这套交付契约只作用于由人发起的 IM 请求:控制台会话仍按流式文本作答;作战室自动诊断是无人值守的后台回合,也保持原生流式输出。
单条答复还有阅读长度上的软约束:过长时 reply 会拒绝一次,并建议精简重复内容,或把详细的证据与对比发布为产物、只把关键结论和产物链接发到聊天。因此 IM 里的长分析通常长成「结论 + 产物链接」,而不是一条很长的消息,详见产物。当你在消息里明确要求「把完整报告直接贴在聊天里」时,这条约束不生效。

作战室自动诊断


当你为一个故障在 IM 中开启作战室(war room)且该集成保留 自动发起 AI 故障分析 开关时,AI SRE 会自动介入——无需任何人 @ 它:
1

创建作战室

在故障的协作流程中创建作战室(飞书 / 钉钉 / 企业微信 / Slack 群)。
2

后台拉起诊断

作战室建好后,平台会以非阻塞后台任务触发一轮初步诊断,让 AI SRE 带着该故障的上下文进入排查。
3

回贴结论

诊断完成后,AI SRE 把分析结果作为一条消息发回作战室。人还没开始排查,第一手分析就已经摆在群里了。
作战室自动诊断与故障上下文绑定:进入排查时,对应的 incident_id 会绑定到本次运行,AI SRE 可据此读取故障详情、时间线与近期变更。关于故障 / 作战室与 A2A 的联动细节,见 Agent · 故障与作战室联动。

常驻任务与监控中卡片


Agent 的当前回合结束时,如果它留下的常驻进程类任务还在运行(例如 monitor 监视器、后台命令),AI SRE 会向聊天中投递一条监控中卡片:
每个常驻任务占一行:任务自带截止时间的显示剩余分钟数(不足 1 分钟按 1 分钟计),没有截止时间的显示「无限期」。常驻任务列表发生变化时卡片会重新投递。
常驻任务存活期间,本次 IM 会话的根消息保持打开(不关闭事故视图):后续由任务通知触发的回合继续投递到同一个聊天,无需重新 @ 召唤。
通知回合遵循「无消息 = 没有新进展」的静默语义:如果某个通知回合没有新内容要投递,AI SRE 会静默关闭该回合,不向聊天发送任何占位回执,也不会重复投递监控中卡片;只有真正有新结论时才会在聊天里出现新消息。

长排查中的进展消息

排查链路长的时候,聊天里可能长时间没有动静——过程性文字不下发,监控中卡片也要等出现常驻任务才会发。为此,当一次 IM 请求连续静默约 60 秒仍没有任何公开回复提交时,系统会视情况给模型加一条瞬态提醒,把「你已经等了多久」告诉它,由它自己决定要不要发一条进展消息:
  • 提醒节奏:同一请求两次提醒至少间隔 3 分钟,一段连续静默里最多提醒 2 次。任何一次提交成功的回复(结论或进展)都会开启新的静默段、重新计数,但不会缩短那 3 分钟的最小间隔。
  • 等待时长从哪算起:从你的消息进入平台待处理队列的时刻起算,排队时间同样计入——不是从 Agent 真正开始处理的时刻起算。
  • 提醒不会自己发消息:它只是把等待时长告诉模型,不替它往群里写任何东西;已经说过的等待、且没有新变化时,或者模型正在等你补充信息时,不发才是正确的。
  • 进展消息不是结论:它表示「还在查、卡在哪、下一步看什么」,不结束这轮任务,结论随后单独投递。
这里的「静默」和上一段的「无消息 = 没有新进展」不是一回事:那一条讲的是通知回合没有新内容时不发占位回执;这里讲的是人在等、而 Agent 还没有任何公开答复。
等待提醒只出现在有人值守的 IM 请求上;控制台、API 与自动化渠道都没有等待提醒。

连接与授权


控制台在凭证缺失时会渲染内联卡片(授权〈资源名〉以继续、连接〈厂商名〉以继续,见 控制台)。IM 与 API 渠道不出卡——Agent 会根据本次会话的渠道改用下面这套办法把这件事交给你: 自动化(automation)渠道没有人值守、也不会有回复:Agent 不会等待、不会把话写成问句,而是把缺失的连接或授权记为阻塞项写进最终报告,并交付已有证据能支持的部分。

IM 会话内切换命令


IM 会话没有控制台那样的选择器 UI,但支持两条斜杠命令在对话进行中动态切换绑定——控制台会话不支持这两个操作,其环境与团队绑定在创建时固定、不可变更。

/env — 切换运行环境

在群聊或私聊里向机器人发送 /env <目标>,可将当前 IM 会话重新绑定到另一个运行环境,对话历史与上下文完整保留。切换后,旧环境的工作目录不再可用:本次对话中在旧环境里创建或修改的文件已丢失,技能与知识文件会在新环境中按需重新挂载。 <目标> 有三种写法: 直接发送不带参数的 /env,机器人会列出当前可切换的全部目标:共享环境、您所在团队的环境,以及云端沙箱(默认沙箱与各个命名模板)。找不到指定的沙箱模板时,机器人会回复「未找到名为「x」的云端沙箱模板。使用 /env sandbox 选择默认沙箱。」并附上可选模板列表。
切换在当前轮次结束、下一条消息处理之前生效,不会打断正在进行的工具调用。若目标 Runner 离线或不存在,命令会立即报错且绑定不变。
私有化部署没有云端沙箱:私有化部署不运行云端沙箱设施,因此 /env 的沙箱选项、沙箱列表项与相关提示文案都不会出现,只能在 BYOC Runner 与「自动」之间切换。

/scope — 切换团队作用域

在群聊或私聊里向机器人发送 /scope <团队名>(或 /scope personal 切回个人作用域),可将当前 IM 会话重新绑定到指定团队,无需结束对话并新建会话。团队绑定是使用权操作,账户内任意成员均可将会话绑定到账户内的任意团队——这与作战室中响应人员通常不属于故障所属团队的场景一致。 切换后,AI SRE 会:
  1. 将记忆快照刷新为新团队作用域下的记忆(旧团队的记忆不再适用于本次会话)。
  2. 把新团队的知识排入挂载队列,在下一条消息处理时自动注入上下文。
  3. 检查本次会话钉定的运行环境是否仍然可用:如果钉定的是另一个团队独有的 BYOC Runner 或云端沙箱模板,会把运行环境改回「自动选择」,并回复「「x」不属于当前团队,运行环境已改回自动选择。」共享环境与账户级环境不受影响;无法确认归属时(例如模板列表拉取失败)保持原有钉定不变。
已挂载到本次会话的知识不会被移除——挂载是对话级别的,切回之前挂载过的团队不会重复注入提醒。

/feedback — 评价 AI SRE 的回复


AI SRE 的回复进入群聊后,群里任何人都可以评价它——不只是发起排查的人。向机器人发送 /feedback,即可对你正在看的那条回复给出评价或评论:
  • 入口与定位:/feedback 由 AI SRE 侧提供后端(POST /safari/session/latest-reply → POST /safari/feedback/create),它能把你「当前看中的那条消息」解析为对应的回复事件,即使你没有参与过那次对话。
  • 评价资格:不限会话成员——账户内任何可使用 AI SRE 的成员都可以评价(只读群聊读者同样可以);群聊里 AI SRE 的回答是公开的,看错的人正是我们想收集反馈的人。
  • 评价方式:可选 like / dislike / none;只写评论不选评价也可以提交(空评价不会清掉你之前给过的评价),显式的 none 才会清除已有评价。
  • 独立存储:每条回复按 (回复事件, 评价人) 分开存储——同一条回复被群里多个人评价,会各留一行,互不覆盖。
  • 控制台侧:控制台会话头部也有对回复的点赞反馈(见 会话反馈),与 IM 的 /feedback 共用同一套评价体系。

与控制台会话的关系


无论从 IM 还是控制台发起,都是同一个 AI SRE:按顺序处理消息、流式输出、长对话自动压缩上下文、可绑定团队与运行环境。区别只在入口——
  • 控制台:在「对话」工作区里逐条提问、查看完整的工具调用与子会话面板;环境与团队绑定在创建时固定,后续不可变更。
  • IM:在你日常协作的群里 @ 召唤,结论回贴到线程;支持 /env 和 /scope 命令在对话中途动态切换绑定,适合在故障现场快速拿到分析,再到控制台深入。
会话的更多细节见 对话。

相关页面


概述

了解 AI SRE 的整体能力、典型场景与控制台导航。

控制台

了解会话、流式输出、取消与上下文压缩。

Agent

入站 Agent Card 与故障 / 作战室联动。

使用洞察

用 /insight 复盘近 30 天会话,发现运维摩擦。