监测

监控用于在问题发生后定位执行记录、查询详情和接口操作;告警用于在异常发生时主动通知。两者结合,可以形成从发现异常、定位原因到调整规则的完整闭环。

监控入口

页面

主要回答的问题

当前范围

SQL 历史

某条 SQL 是否成功、耗时如何、执行计划是什么

查询历史入口受产品开关控制

作业

某次工作流执行处于什么状态、哪个节点失败

仅覆盖工作流执行记录

操作日志

当前登录用户的接口操作请求是否成功

仅覆盖当前用户、当前工作区的操作记录

告警

哪些异常需要主动通知、通知谁、历史上触发过什么

规则、通知对象和告警记录

这三类记录互为补充,但不应互相替代。SQL 历史关注单条查询,作业关注一轮工作流执行,操作日志关注接口请求及其结果。

常用排查路径

  1. 工作流失败、暂停或执行异常时,先进入作业,确认执行状态、失败信息和节点轨迹。

  2. 需要分析某条 SQL 的耗时、结果或执行计划时,进入SQL 历史

  3. 怀疑接口请求、权限或提交参数导致问题时,进入操作日志,查看请求方法、状态码和详情。

  4. 载入任务的问题应优先在载入任务中查看任务配置和运行信息;本页的作业入口不会汇总全部载入任务。

告警配置与处置

告警由告警规则、通知对象和告警记录组成。先建立通知对象,再创建规则,最后通过告警记录回看触发情况并调优阈值和通知周期。

收到告警后,先从告警记录确认规则、表达式和时间,再进入作业SQL 历史操作日志定位具体原因。已读只表示有人查看,不代表问题已经解决。

内容边界

本指南不介绍独立仪表盘、平台系统日志、Genesis 模型服务用量或 MatrixOne 实例监控。它只覆盖 AI Studio 工作区中的监控、告警和异常定位能力。

本指南包含

页面

内容

SQL 历史

查询列表、筛选、详情、执行计划、结果预览和下载

作业

工作流执行列表、详情、状态与重跑

操作日志

当前用户的接口操作记录、筛选和请求详情

告警

告警规则、通知对象、告警记录和处置流程

文档目录