评测与 Badcase
以人工最终处置结果作为标准答案,评估 AI 分诊效果;判断错误或建议不可执行的案例进入 Badcase,复盘后用于优化分诊策略。
评测周期:2026-06-01 至 2026-06-29评测集:200 条已完成人工复核的历史告警人工标准结果(Gold Label):人工最终确认的风险等级和处置结果当前策略版本:Triage-v1.3
当前指标基于已冻结的 200 条评测集计算;本周期新增人工反馈将在下一评测周期统一纳入指标。
Agent 效果指标
本周期 5 项 Agent 指标中 4 项达标;风险等级一致率为 82%,是当前主要优化项。
86.5%
处置建议一致率
173 / 200
AI处置建议与人工最终处置一致的比例
目标:≥85%已达标
82.0%
重点优化风险等级一致率
164 / 200
AI风险等级与人工确认等级一致的比例
目标:≥85%未达标
78.5%
工单草稿可直接派发率
157 / 200
草稿无需修改或少量修改即可派发的比例
目标:≥75%已达标
6.2%
错误建议派单率
8 / 129
AI建议派单但人工判定无需派单的比例
目标:≤8%已达标
4.8%
漏建议派单率
5 / 104
应建议派单但AI未给出派单建议的比例
目标:≤5%已达标
业务效果
4.6 小时 → 3.0 小时
平均处理耗时降低约 35%
对比基线:引入 AI 分诊与工单草稿前后的平均处理耗时。
目标:≥30%已达标
人工反馈记录
筛选
| 工单 | 关联告警 | AI 原始输出 | 人工结论 | 提交时间 | 反馈流向 | 操作 |
|---|
Badcase 复盘
仅展示 AI 判断、风险等级、原因或建议存在实际问题的案例。
复盘流程:定位错误原因 → 制定优化方案 → 使用评测集回归验证 → 人工确认关闭。
复盘过程仅记录候选优化方案,不会自动修改或发布当前生效策略。
待复盘
定位根因
优化中
实施优化
待验证
回归验证
已关闭
人工确认
| 案例 | AI 原始输出 | 人工最终结论 | 问题类型 | 修正与优化 | 复盘状态 | 操作 |
|---|
当前生效版本
Triage-v1.3
候选验证版本
Triage-v1.4-rc1
发布状态
待人工审批
| 策略名称 | 触发条件 | Agent 处理策略 | 适用设备 | 状态 |
|---|---|---|---|---|
| 连续功率下降策略 | 近7天同类告警≥3次 | 提升风险等级,生成派单建议 | 逆变器、组件 | 启用 |
| 低置信度转人工策略 | AI置信度<70% | 转人工复核,不生成工单 | 全部设备 | 启用 |
| 关键数据异常降级策略 | 数据缺失、工具失败或结果冲突 | 标记证据不足,停止派单建议并转人工 | 全部设备 | 启用 |
| 历史工单参考策略 | 近30天存在相关工单 | 参考历史处理结果生成建议 | 逆变器、组件、汇流箱 | 启用 |