教程:把一门课的资料变成能回答问题的知识库

本教程用一批真实资料——李宏毅《生成式AI导论》第一讲课件(PDF 与 PPTX 各一份)——在 MOI 中完整走一遍:登录、安置数据、加工、建成知识库,直到问答。每一步写明您做什么、平台随即发生什么、您应看到什么;实际运行中遇到的失败与排查过程原样保留,它们和成功路径同样重要。

本教程的全部内容来自 2026-07-23 在 MOI 上的一次实际操作记录。

第 1 章 · 进门

打开 MOI,登录页提供手机号与邮箱两种方式,默认验证码登录,可切换密码登录。

登录后,顶栏分三个区:应用、智能体、数据,并显示当前工作区名称。本教程全程在「数据」区,它的左侧栏即数据工作的全部入口:数据连接(连接器、通道管理、载入任务、导出任务)、数据处理(工作流、SQL 编辑器)、资源中心(Catalog、计算资源、数据分享、知识库)、监测(SQL 历史、作业、操作日志)、用户权限。

首屏仪表盘显示四项资产计数:Catalog 数据对象、工作流、计算资源、知识库。

第 2 章 · 安置:给这批文档一个位置

您做:进入 资源中心 → Catalog,点「新建目录」,创建目录 genai_course;进入该目录,「新建数据库」创建 course_materials;进入该库,点「创建」下拉选「卷」,创建文件卷 lecture_docs

平台随即:三层对象在目录树中登记完毕。数据的归属层级为:工作区 → 目录 → 数据库 → 表 / 文件卷。系统目录不能存放用户数据卷,选择器中呈灰色。

您应看到:目录树出现 genai_course / course_materials / lecture_docs

上传文件

文件卷页面本身没有上传按钮——上传的入口在 数据连接 → 载入任务

您做:点「创建任务」。任务类型第一层就是数据形态的分岔:非结构化(文档、音视频、图片,载入到数据卷)或结构化(CSV/XLSX,导入表)。选非结构化;数据来源选「本地上传」;数据卷选 lecture_docs;把两份课件拖入上传区;点「创建并开始载入」。

限制与选项(本次实测值):单次最多 20 个文件、单个不超过 200MB;去重策略按文件名与 MD5 判断,可选跳过或覆盖;可按文件类型与路径正则筛选;来自连接器的持续载入支持周期执行。

平台随即:生成一条载入任务(本次 ID 700941000002),逐文件执行。

您应看到:任务详情页显示「已完成,共 2 个文件,成功 2 个,失败 0 个」,并逐文件列出状态与起止时间;回到 Catalog,lecture_docs 卷内出现两份文件,可下载、预览、删除。

第 3 章 · 做熟:一条加工工作流

您做:进入 数据处理 → 工作流,点「创建工作流」。创建方式有三种:系统模板(九个,覆盖文档知识库准备、信息提取、图纸解析、语音/视频转录问答等)、空白创建、导入 DSL 创建。选模板「文档知识库准备」——它的说明就是本教程的任务:将 PDF、Word、PPT 等资料解析、清洗、切分、向量化并写入知识库,为后续 RAG 问答提供可检索的数据基础。

模板展开为六步运行配置:

步骤

本次配置

说明

Catalog 数据源

lecture_docs

计算资源默认「跟随工作流默认」,发布后为共享 Worker

文档解析

默认 qwen3-vl-plus

VLM OCR 模型,处理图片、扫描件与复杂版式

按长度切分文档

默认 512 / 50

文本块最大字符数 / 相邻块重叠字符数

构建知识库索引

新建知识库,嵌入模型 bge-m3

三级索引(doc/section/chunk)默认开启,Section 大小 5

写出文档文件

无需配置

解析产物写为文件

保存到 Catalog

parsed_docs 卷(选择器内联新建)

解析结果文件的存放位置

另可配置完成通知 URL:工作流执行完成或失败时,平台向该地址 POST 通知。

平台随即:配置确认后进入画布——七个节点已连成一条链:读取源文件 → 解析 → 切分 → 构建索引 → 写出文件 → 保存目录 → 登记血缘。顶栏「预览 DSL」可随时查看这张图对应的工作流定义文件;画布、定义文件与模板产出的是同一份定义。点「完成」保存发布后,平台自动发起了第一次运行。

您应看到:工作流列表中状态为「可运行」,计算资源「共享 Worker」;监测 → 作业中出现运行记录——每个文件一条作业

本次实际运行:两次失败,各有一个明确病根

真实运行很少一次全绿。本教程第一次运行两个文件全部失败,排查与修复过程如下——排查入口都是同一个:作业列表 → 失败记录的详情页,那里有完整的错误信息、失败节点、Trace 标识链与「重跑」按钮,以及整条链路的节点状态拓扑图。

失败一:嵌入模型 404。 PDF 作业运行 19 秒后失败,拓扑图显示解析与切分已完成(切出 143 个文本块),失败在构建索引节点:

CreateEmbeddings(model=BAAI/bge-m3 ...): Embedding failed: OpenAI error:
status 404, {"code":"model_not_available"}

病根:建库时嵌入模型下拉中存在两个同名候选——「bge-m3 / BAAI/bge-m3」与「TaaS Embedding / bge-m3」,前者的注册名在模型服务端不存在。改用「TaaS Embedding / bge-m3」重建知识库后,该节点通过。

失败二:PPTX 缺少转换后端。 PPTX 作业启动约 1 秒即失败,错误信息:

parse v3 (type=pptx): convert pptx to pdf failed (primary + soffice):
soffice executable file not found in $PATH; parser_backends=[]

PPTX 的解析路径是先转换为 PDF 再解析;本环境的执行进程未接入任何解析后端,系统回退到本机 soffice,而它未安装。此问题属于部署环境配置,与工作流定义无关。本次实测保留 PDF 单轨继续。

修复嵌入模型后重新运行:PDF 作业 37 秒完成,全节点绿色——解析、切分、向量化、写入索引、登记血缘一次走通。

第 4 章 · 立库:知识库已经有了内容

知识库在第 3 章配置索引步骤时已经创建;工作流执行成功后,它不再是空壳。

您应看到:资源中心 → 知识库,知识库卡片显示「1 文件」。

知识库详情有三个部分:数据源(按结构化程度展示已关联的文件和表——知识库同时容纳两类数据)、语义配置(维度列、事实列、业务指标、表关联、标准问答、术语解释、规则注入等条目,供自然语言查询理解表数据时使用,可导入导出与校验)、智能体关联

卡片的编辑入口中有一栏备注说明内容(必填):填写这个知识库的用途与可回答的问题列表,供智能体在多个知识库之间精准选择。本次填写包含一条边界约定:「课件未涉及的内容,应如实说明材料中未找到,不要猜测。」

第 5 章 · 对答:当前的真实边界

您做:知识库 → 对话,新建对话;输入框上方挂载知识库「李宏毅生成式AI课程」;模型选择 glm-5.1;提问:「这门课的预修要求是什么?需要先修过人工智能或数学、会写程序吗?」——这是一道课件中有明确答案的题(课件「课程定位」页写明:预修课程无,三句「不预设」)。

实测结果(2026-07-23):回答未基于知识库。模型自述:「我当前的工具配置中没有知识库检索工具(如 RAG 搜索、SQL 查询等),因此无法从知识库中查找。」消息气泡上知识库标签在、开发者视图的调用记录显示输入 token 仅 1.95k——上下文中没有任何检索片段。即:知识库选择与传递成功,但对话侧的检索工具未接通,问答尚不能基于知识库作答。定位信息(trace_50b0a7ddc163ad8d54de4f338bd35c89)已可供排查。

知识库建成与问答联通之间的这最后一段,以产品修复为准;本教程将在联通后补全本章的验证方法——届时用两类问题验收:课件中确有答案的(检验答案与引用),课件中没有答案的(检验是否如实说明检索不到)。

本次教程覆盖的链路

环节

实测状态

登录、目录/数据库/文件卷创建

走通

本地上传(载入任务)

走通,2/2 成功

模板创建工作流、发布、运行

走通

PDF 解析 → 切分 → 向量化 → 索引 → 血缘

走通,37 秒

PPTX 解析

失败:环境缺转换后端(见第 3 章)

知识库成库

走通,1 文件

知识库问答

未通:对话侧缺检索工具(见第 5 章)

智能体使用知识库

未覆盖,待问答联通后继续

面向 AI 代理的说明:本页每一步的界面名词、默认值与错误信息均来自实际运行;执行同类任务时,以「作业」详情页的错误信息与 Trace 标识为排查起点;嵌入模型选择「TaaS Embedding / bge-m3」;PPTX 解析依赖部署环境的转换后端。

最后更新于