> ## Documentation Index
> Fetch the complete documentation index at: https://docs.flashduty.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 15 分钟完成第一次 AI SRE 排障

> 从一个真实故障开始，完成第一次有上下文、有证据、可继续追问的 AI SRE 调查；随后按需建立团队知识并连接真实数据源。

<Info>
  **公测功能**：AI SRE 正在公测，面向 On-call 专业版及以上账户灰度开放，公测期间不单独收费；如需开通，请填写 [AI SRE 公测申请表](https://c9xudyniiq.feishu.cn/share/base/form/shrcn0ngCfdoygiaHnAT80BfZiH)。功能与界面可能继续调整。
</Info>

## 必要概念（30 秒）

***

上手前只需要知道这四件事：

| 概念   | 是什么                                                                         |
| ---- | --------------------------------------------------------------------------- |
| 会话   | 你和 Agent 的一次协作，控制台或 IM 里都能开 → [控制台](/zh/ai-sre/sessions)                    |
| @ 引用 | 把故障现场带进对话的方式，输入 `@` 搜索并插入故障 → [控制台](/zh/ai-sre/sessions)                    |
| 知识库  | Agent 对你系统的长期记忆，越完整定位越准 → [管理知识](/zh/ai-sre/knowledge)                      |
| 运行环境 | Agent 动手的地方——云端 Sandbox 或你内网的 BYOC Runner → [运行环境](/zh/ai-sre/environments) |

## 三个入口（从哪儿开始）

***

AI SRE 没有唯一入口，从你现在所在的场景开始就好：

### 控制台对话（Chat）

适合主动排查一个问题、深入追问、沉淀知识。进入 **AI SRE → 对话 → 新建对话**；输入框下方有场景卡，点击即可填入现成提示词；输入 `@` 可引用故障。→ 详见[控制台](/zh/ai-sre/sessions)

### 自动化（Automations）

适合不需要人守着的周期性 / 触发式任务——定时巡检、周报洞察、告警治理。进入 **AI SRE → 自动化**，可从内置模板一键创建（如告警噪音分析、事故响应复盘、每周值班洞察），也可以从零开始自定义任务提示词。它在后台跑一个隐藏会话，结果记录进运行历史，随时可以打开查看完整的调查过程。→ 详见[自动化](/zh/ai-sre/automations)

### IM（@ 召唤 + 作战室自动诊断）

故障发生的现场。在已接入机器人的 Slack / 飞书 / 钉钉 / 企业微信群里 **@ AI SRE** 即可发起或续接排查，它在线程内作答；为故障开启作战室时，AI SRE 会自动跑一轮初步诊断并把结论回贴到作战室。→ 详见[IM 平台](/zh/ai-sre/im)

## 第一次排障（约 5 分钟）

***

前提条件：账户已开通 On-call 专业版及以上订阅，且至少有一条故障记录。AI SRE 公测期间按灰度节奏开放，账户还需已灰度开通——未开通可先填写 [AI SRE 公测申请表](https://c9xudyniiq.feishu.cn/share/base/form/shrcn0ngCfdoygiaHnAT80BfZiH)。

<Tip>**版本要求**：AI SRE 需要 On-call 专业版及以上订阅。[了解更多](https://flashcat.cloud/flashduty/price/)</Tip>

如果你现在手头没有故障，可以先跳到下面的「之后：把它建设成你的 SRE」。

<Steps>
  <Step title="新建一个对话">
    进入 **AI SRE → 对话**，点击左侧边栏的 **新建对话**。
  </Step>

  <Step title="带上故障上下文">
    在输入框里输入 `@`，会弹出故障搜索列表，选中你要排查的那条故障——它会作为一枚引用胶囊插入到输入框里。也可以直接点输入框下方的场景卡 **排查一个故障**：它会把一段现成的提示词填进输入框，你可以在发送前用 `@` 补上具体的故障引用。
  </Step>

  <Step title="发送指令">
    发送类似这样的一句话：

    ```
    分析这个故障。先列调查计划，再给出每条结论的证据，不要执行生产变更。
    ```
  </Step>

  <Step title="查看调查过程">
    Agent 会流式给出它的调查计划、工具调用与中间发现，最后给出带证据支撑的结论。
  </Step>
</Steps>

**完成标志**：你收到一份包含调查计划、工具调用记录和结论的回复，并且可以针对结论继续追问。

**如果卡住，检查这些**：

* 输入 `@` 没搜到目标故障——确认这条故障确实存在于当前账户，名称或编号没有拼错；
* 长时间没有响应或停在"运行环境初始化"——多半是云端 Sandbox 或 Runner 正在启动，稍等片刻；持续无响应见[运行环境](/zh/ai-sre/environments)的故障排查；
* 只给了结论、没给调查计划——直接追问"先给我一份调查计划，再逐条给证据"，Agent 会补上；
* 看不到 **AI SRE** 入口——确认账户具备 On-call 专业版及以上订阅；也可能尚未灰度开通，填写 [AI SRE 公测申请表](https://c9xudyniiq.feishu.cn/share/base/form/shrcn0ngCfdoygiaHnAT80BfZiH) 申请。

**下一步**：想了解流式输出、取消、Fork、上下文压缩等控制台细节，见[控制台](/zh/ai-sre/sessions)。

## 之后：把它建设成你的 SRE（按需）

***

跑完第一次排障只是起点。AI SRE 排查得准不准，取决于它对你系统的了解程度、以及能连到多少真实数据——这两件事都可以按需慢慢建设，不必一次做完。

### 建一份团队知识库

Agent 每次排障都从零猜「这是什么服务」「谁负责」「以前是怎么处理的」，效率就上不去。在会话里输入 `/init`，Agent 会用访谈的方式带你梳理服务清单、runbook、值班路径等知识，逐条确认后写入知识库，后续会话自动加载。完整访谈流程见[初始化（/init）](/zh/ai-sre/init)，知识库结构与最佳实践见[管理知识](/zh/ai-sre/knowledge)。

### 接入真实数据源

默认情况下 Agent 只能看到 Flashduty 自身的数据。要让它查到你系统里的真实信息——日志、指标、代码仓库、内网数据库，需要接入 MCP 服务器或部署 BYOC Runner。公网可达的服务（如可观测平台、GitHub）从 MCP 市场一键安装并授权即可；VPC、内网数据库或本地命令，则需要在能访问目标资源的机器上部署 Runner。见 [MCP（外部工具）](/zh/ai-sre/mcp) 与[运行环境](/zh/ai-sre/environments)。

## 下一步

***

<CardGroup cols={2}>
  <Card title="产品概述" icon="robot" href="/zh/ai-sre/overview">
    了解 AI SRE 的定位、能力全景与控制台导航。
  </Card>

  <Card title="控制台" icon="comments" href="/zh/ai-sre/sessions">
    会话的新建与管理、流式输出、Fork、上下文压缩。
  </Card>

  <Card title="IM 平台" icon="comment-dots" href="/zh/ai-sre/im">
    在 IM 群里 @ Agent 排障，了解作战室自动诊断。
  </Card>

  <Card title="运行环境" icon="server" href="/zh/ai-sre/environments">
    云端 Sandbox 与 BYOC Runner 的区别、部署与权限配置。
  </Card>
</CardGroup>
