公测功能:AI SRE 正在公测,面向 On-call 专业版及以上账户灰度开放,公测期间不单独收费;如需开通,请填写 AI SRE 公测申请表。功能与界面可能继续调整。
必要概念(30 秒)
上手前只需要知道这四件事:
三个入口(从哪儿开始)
AI SRE 没有唯一入口,从你现在所在的场景开始就好:
控制台对话(Chat)
适合主动排查一个问题、深入追问、沉淀知识。进入 AI SRE → 对话 → 新建对话;输入框下方有场景卡,点击即可填入现成提示词;输入@ 可引用故障。→ 详见控制台
自动化(Automations)
适合不需要人守着的周期性 / 触发式任务——定时巡检、周报洞察、告警治理。进入 AI SRE → 自动化,可从内置模板一键创建(如告警噪音分析、事故响应复盘、每周值班洞察),也可以从零开始自定义任务提示词。它在后台跑一个隐藏会话,结果记录进运行历史,随时可以打开查看完整的调查过程。→ 详见自动化IM(@ 召唤 + 作战室自动诊断)
故障发生的现场。在已接入机器人的 Slack / 飞书 / 钉钉 / 企业微信群里 @ AI SRE 即可发起或续接排查,它在线程内作答;为故障开启作战室时,AI SRE 会自动跑一轮初步诊断并把结论回贴到作战室。→ 详见IM 平台第一次排障(约 5 分钟)
前提条件:账户已开通 On-call 专业版及以上订阅,且至少有一条故障记录。AI SRE 公测期间按灰度节奏开放,账户还需已灰度开通——未开通可先填写 AI SRE 公测申请表。 如果你现在手头没有故障,可以先跳到下面的「之后:把它建设成你的 SRE」。
1
新建一个对话
进入 AI SRE → 对话,点击左侧边栏的 新建对话。
2
带上故障上下文
在输入框里输入
@,会弹出故障搜索列表,选中你要排查的那条故障——它会作为一枚引用胶囊插入到输入框里。也可以直接点输入框下方的场景卡 排查一个故障:它会把一段现成的提示词填进输入框,你可以在发送前用 @ 补上具体的故障引用。3
发送指令
发送类似这样的一句话:
4
查看调查过程
Agent 会流式给出它的调查计划、工具调用与中间发现,最后给出带证据支撑的结论。
- 输入
@没搜到目标故障——确认这条故障确实存在于当前账户,名称或编号没有拼错; - 长时间没有响应或停在”运行环境初始化”——多半是云端 Sandbox 或 Runner 正在启动,稍等片刻;持续无响应见运行环境的故障排查;
- 只给了结论、没给调查计划——直接追问”先给我一份调查计划,再逐条给证据”,Agent 会补上;
- 看不到 AI SRE 入口——确认账户具备 On-call 专业版及以上订阅;也可能尚未灰度开通,填写 AI SRE 公测申请表 申请。
之后:把它建设成你的 SRE(按需)
跑完第一次排障只是起点。AI SRE 排查得准不准,取决于它对你系统的了解程度、以及能连到多少真实数据——这两件事都可以按需慢慢建设,不必一次做完。
建一份团队知识库
Agent 每次排障都从零猜「这是什么服务」「谁负责」「以前是怎么处理的」,效率就上不去。在会话里输入/init,Agent 会用访谈的方式带你梳理服务清单、runbook、值班路径等知识,逐条确认后写入知识库,后续会话自动加载。完整访谈流程见初始化(/init),知识库结构与最佳实践见管理知识。
接入真实数据源
默认情况下 Agent 只能看到 Flashduty 自身的数据。要让它查到你系统里的真实信息——日志、指标、代码仓库、内网数据库,需要接入 MCP 服务器或部署 BYOC Runner。公网可达的服务(如可观测平台、GitHub)从 MCP 市场一键安装并授权即可;VPC、内网数据库或本地命令,则需要在能访问目标资源的机器上部署 Runner。见 MCP(外部工具) 与运行环境。下一步
产品概述
了解 AI SRE 的定位、能力全景与控制台导航。
控制台
会话的新建与管理、流式输出、Fork、上下文压缩。
IM 平台
在 IM 群里 @ Agent 排障,了解作战室自动诊断。
运行环境
云端 Sandbox 与 BYOC Runner 的区别、部署与权限配置。