监测¶
监控用于在问题发生后定位执行记录、查询详情和接口操作;告警用于在异常发生时主动通知。两者结合,可以形成从发现异常、定位原因到调整规则的完整闭环。
监控入口¶
页面 |
主要回答的问题 |
当前范围 |
|---|---|---|
某条 SQL 是否成功、耗时如何、执行计划是什么 |
查询历史入口受产品开关控制 |
|
某次工作流执行处于什么状态、哪个节点失败 |
仅覆盖工作流执行记录 |
|
当前登录用户的接口操作请求是否成功 |
仅覆盖当前用户、当前工作区的操作记录 |
|
哪些异常需要主动通知、通知谁、历史上触发过什么 |
规则、通知对象和告警记录 |
这三类记录互为补充,但不应互相替代。SQL 历史关注单条查询,作业关注一轮工作流执行,操作日志关注接口请求及其结果。
常用排查路径¶
告警配置与处置¶
告警由告警规则、通知对象和告警记录组成。先建立通知对象,再创建规则,最后通过告警记录回看触发情况并调优阈值和通知周期。
收到告警后,先从告警记录确认规则、表达式和时间,再进入作业、SQL 历史或操作日志定位具体原因。已读只表示有人查看,不代表问题已经解决。
内容边界¶
本指南不介绍独立仪表盘、平台系统日志、Genesis 模型服务用量或 MatrixOne 实例监控。它只覆盖 AI Studio 工作区中的监控、告警和异常定位能力。