MatrixOne 简介

MatrixOne 是面向 AI Agent 与智能应用的统一数据基础设施。它在一个数据库中连接业务表、JSON、文档与外部文件,组合事务处理、实时分析、全文检索和向量检索,并通过 Git for Data 为数据变更提供快照、分支、差异对比、选择性应用、合并和恢复能力。

AI Agent 不仅需要读取数据,还会持续检索上下文、生成结果、转换数据,甚至执行影响业务状态的操作。传统数据架构通常将业务数据、对象文件、关键词索引和向量索引分散在不同系统中,导致数据反复搬运、权限边界复杂,也难以审查或撤销 Agent 产生的变更。MatrixOne 将这些能力收敛到兼容 MySQL 的 SQL 数据层中,让 Agent 可以在统一接口下访问多种数据,并在受控的数据工作区内完成实验和变更。

面向 AI 的统一数据层

MatrixOne 将不同形态的数据及其上下文组织在同一数据系统中:

  • 结构化数据:使用事务、SQL 查询和实时分析处理订单、用户、设备、指标等业务数据。

  • 半结构化数据:使用 JSON 等类型保存事件、模型输出、工具调用结果和动态属性。

  • 非结构化数据:通过 Stage 与 DATALINK 连接对象存储、远程文件系统或本地文件系统中的文档、图片、音频、视频、数据集和模型文件,并在表中管理其引用与元数据。

  • 向量数据:保存文本、图片或其他内容经外部模型生成的 Embedding,并与原始对象、业务字段及权限信息关联。

MatrixOne 存储和查询结构化、半结构化及向量数据,并管理外部文件的引用、元数据及 SQL 访问;外部文件内容仍保存在底层对象存储或文件系统中。对图片、音频、视频等内容的解析和 Embedding 生成通常由外部模型或 AI 服务完成,处理结果可以写回 MatrixOne,供后续检索和业务计算使用。

为 Agent 提供统一检索上下文

Agent 的上下文通常同时包含精确事实、关键词相关内容和语义相似内容。MatrixOne 支持在同一 SQL 数据层中组合:

  • 结构化查询:通过过滤、关联、聚合和事务读取获得准确、实时的业务事实。

  • 全文检索:通过全文索引检索文档和文本字段中的关键词。

  • 向量检索:使用向量类型、距离函数和 IVF 索引进行语义相似度检索。HNSW 索引目前是实验特性,需要开启 experimental_hnsw_index。详情参见向量检索向量索引

  • 混合检索:将结构化条件、全文匹配和向量相似度组合起来,为 RAG、企业搜索、推荐和智能问答提供更完整的上下文。

应用可以通过 SQL、MySQL 兼容协议和常见开发工具访问这些能力。模型推理和 Agent 编排可以继续使用现有框架,而 MatrixOne 作为统一数据层负责保存事实、检索上下文和持久化执行结果。

Git for Data:Agent 的安全数据工作区

Git 管理代码变更,Git for Data 管理人和 Agent 产生的数据变更。Agent 可以先在隔离的数据分支中执行清洗、补全、分类或数据转换,再由应用策略或人工检查差异,决定接受哪些结果。

表级分支可以直接执行 Diff、Pick 和 Merge。数据库级分支用于一次创建包含多张表的隔离工作区,但需要针对其中的相关表逐表执行 Diff、Pick 或 Merge;MatrixOne 目前没有数据库级的 DATA BRANCH DIFFDATA BRANCH PICKDATA BRANCH MERGE 语句。

Git 概念

MatrixOne 能力

Agent 工作流中的作用

tag

Snapshot

在 Agent 执行任务前保存已知数据基线

branch

Data Branch

为不同 Agent、任务或实验创建相互隔离的数据工作区

diff

Data Branch Diff

逐行检查 Agent 新增、删除和修改的数据

cherry-pick

Data Branch Pick

对具有显式主键的表,只接受经过验证的部分结果

merge

Data Branch Merge

按冲突策略将批准的变更合并到目标表

restore

Snapshot / PITR

在操作不符合预期时恢复到可信状态

典型工作流如下:

  1. 使用 CREATE SNAPSHOT 保存任务执行前的数据基线,或者在任务执行前确认已配置覆盖相应对象和时间范围的 PITR。

  2. 使用 DATA BRANCH CREATE 为 Agent 创建表级或数据库级分支。

  3. Agent 在分支中读取数据、调用模型并写入处理结果,不影响源数据。

  4. 对表级分支使用 DATA BRANCH DIFF 审查行级变化;对于数据库级分支,逐表检查相关表。

  5. 对具有显式主键的表,使用 DATA BRANCH PICK 接受部分结果;没有显式主键的表不支持 Pick。也可以使用 DATA BRANCH MERGE 将表级分支的变更合并到目标表。

  6. 删除不再需要的分支;如果合并后的结果不符合预期,可以使用快照或任务执行前已配置且保留范围有效的 PITR 恢复。

这种模式使 Agent 的数据操作具备隔离、审查、审批和恢复机制。有关完整概念、权限和 SQL 操作,请参见 Git for DataGit for Data 教程

支撑生产级 AI 工作负载

AI 与 Agent 能力建立在 MatrixOne 的分布式数据库底座之上:

  • 事务与分析一体化:同一份数据支持实时写入、事务处理、复杂分析和检索,减少跨系统同步。

  • MySQL 兼容:应用可以使用熟悉的 SQL、协议和生态工具接入 MatrixOne。

  • 存算分离:计算、事务和对象存储解耦,可根据检索、写入和分析负载调整资源。

  • 多账号隔离:在同一集群中隔离不同团队、应用或 Agent 的数据与访问边界。

  • 高可用与数据恢复:通过分布式日志、快照、备份和 PITR 保护持续运行的智能应用。

  • 开放部署:支持本地、私有云和公有云环境,便于在数据所在地构建 AI 应用。

典型应用场景

  • 企业知识库与 RAG:连接业务表和外部文档,组合全文、向量与结构化检索,为模型提供实时、可追溯的上下文。

  • Agent 数据处理:让 Agent 在隔离分支中清洗、分类、补全或转换数据,经过 Diff 和审批后再应用到主数据。

  • 训练数据和评测集管理:对数据集建立快照和分支,比较不同版本,并复现实验使用的数据状态。

  • 多模态应用:统一管理图片、音频、视频等外部对象的引用、元数据和 Embedding,支持内容搜索与推荐。

  • 智能业务应用:在同一系统中组合交易数据、实时分析和 AI 检索,减少数据进入独立数据库和搜索系统的延迟。

相关信息