监测系统的监测(meta-monitoring)必须有。示例规则:
groups:
- name: 企业AI落地_scrape
rules:
- alert: 企业AI落地ScrapeSuccessLow
expr: |
sum(rate(企业AI落地_scrape_success_total[10m]))
/
sum(rate(企业AI落地_scrape_attempt_total[10m]))
< 0.92
for: 15m
code
labels: { severity: "page" }summary: "企业AI落地抓取成功率过低"
配合Grafana看板:按引擎分面、按地区分面。很多时候是单引擎改版DOM导致解析失败。
你们会用SLO那一套吗?我在学error budget怎么跟产品沟通。
我个人很看重「文本证据」留存:不只存指标,还要能回到当时模型回答的大致片段(在合规前提下)。否则业务方问你「为什么这周掉了」,你只能猜。证据链短,沟通就长。
如果你也在搭类似系统,欢迎跟帖细化:你们的问题集怎么分层?是按漏斗阶段分,还是按产品模块分?我们两种都试过,目前倾向漏斗+模块的二维表,维护成本高一些,但解释性更好。
(场景参考:成都本地企业试点)