知识库
📖 适合谁:AI 产品经理 / 数据团队 / 业务运营 —— 想把公司文档/手册/合同/培训资料变成 AI 可检索的私有知识库的人
📖 阅读时长:4 分钟
📖 一句话:YingCore 内置的 RAG 核心模块,用于构建企业私有知识资产,覆盖 创建 → 上传 → 解析/切片 → 配置 → 检索测试 → 知识图谱 全流程。顶部导航「知识库」(路由
/knowledge) 即可进入,全员可访问,供工作台对话与智能应用检索引用。
一、主要能力
| 能力 | 说明 |
|---|---|
| 多源文档接入 | PDF / Word / Excel / Markdown / 网页爬取 / 数据库同步 / 飞书云文档 / 语雀 / 客户端同步工具 |
| 自动切片与向量化 | 上传后自动切分、Embedding(bge / bce / OpenAI text-embedding)、存入向量数据库 |
| 多模态知识 | 图片 OCR、图片 CLIP、表格逐单元格、公式识别——不仅限于纯文本 |
| 15 种解析方法 | 通用 naive / 问答 qa / 简历 resume / 手册 manual / 表格 table / 论文 paper / 图书 book / 法律 laws / 演示文稿 presentation / 图片 picture / 单图 one / 音频 audio / 邮件 email / 标签 tag / 知识图谱 knowledge_graph |
| 多检索维度 | 文本 / 表格逐单元格 / 图片 OCR / 图片 CLIP / 层级 / 图谱,可单选可组合 |
| 检索增强 (RAG) | 语义检索 + 关键词检索 + 混合检索,可设 Top-K / 相似度阈值 / Rerank 重排 |
| 知识图谱 (GraphRAG) | 抽取实体关系,力导向图可视化,支持图谱检索 |
| 检索测试 | 相似度阈值滑块 + Rerank + 检索范围 + 证件类型过滤 + 跨语言;双模式(指定文档 / 全库) |
| 文档全生命周期 | 上传、解析(实时进度可停)、切片、修改切片、启用/禁用、重新解析(全量/增量)、维度修复、删除、下载 |
| 权限与版本 | 我 / 团队可见范围;文档修改有版本号,可回退到任一历史版本 |
| 元数据管理 | 标签、分类、有效期、负责人等结构化字段,便于筛选 |
| 引用到工作台 | 在 工作台 助手输入框关联知识库,对话即可获得带 [ID:n] 引用的回答 |
二、典型应用场景
- 产品手册问答:客户问产品参数 → 助手在知识库中检索 → 返回准确答案 + 引用 PDF 角标,点击可在原文中高亮定位。
- 新人入职:HR 把制度、流程、福利文档入库,新员工通过对话快速自查,省去反复问 HR 的时间。
- 法务合同检索:律师在数十万份合同中检索「含对赌条款 + 2023 年签署」,秒级返回命中切片。
- 客服话术统一:所有客服数字员工共享同一知识库,保证口径一致,不依赖个人记忆。
- 网页知识自动入库:在「知识获取」页配置爬虫任务,把官网 / 政策页 / 产品页定时抓取入库,知识自动保鲜。
- 证件扫描件管理:身份证 / 营业执照 / 资质证书 / 安全生产许可证分类入库,检索时可按证件类型过滤,避免误召回其他证件。
- 跨语言检索:中文知识库里查英文问题也能命中(开启跨语言开关),外资/外贸场景必备。
- 图谱实体推理:开启 GraphRAG 后,「A 公司投资 B 公司」这类关系问题可通过图谱回答,不再依赖纯文本相似度。
三、界面与操作
1. 知识库列表页(/knowledge)
- 无限滚动卡片网格:每个知识库显示名称、更新时间、文档数、描述;支持搜索与删除。
- 顶部按钮:
- 创建知识库:输入名称即可创建,创建后自动进入配置页。
- 知识获取:跳转爬虫管理页(
/myCrawler),从网页抓取内容。 - 下载同步工具:下载客户端同步工具(
/sync-tool),把本地目录里的文件批量同步入库。
2. 知识库详情页(/knowledge/dataset?id=xxx)
顶部展示「当前 / 所有知识库今日新增文档数」。左侧四个页签:
| 页签 | 功能 |
|---|---|
| 数据集 | 文件夹树 + 文档列表 + 切片管理(默认页) |
| 检索测试 | 输入测试问题,验证召回效果 |
| 配置 | 基础信息 + 解析方法 + 高级参数 |
| 知识图谱 | 仅当知识库已有图谱数据时显示 |
3. 数据集 → 文件管理
- 文件夹树:新建、展开/折叠文件夹,支持把文档拖拽进文件夹或移动到文件夹。
- 工具栏:搜索、上传文件、网页爬取、新建空白文档、移动到文件夹、列表/网格视图切换。
- 文档列表列:文件名、切片数、上传时间、切片方法、启用开关、解析状态、操作。
- 文档操作:修改切片方法 / 设置元数据、重命名、取消解析、重新解析(全量/增量)、删除、维度修复、下载。
- 解析状态:未开始 / 运行中(实时进度,可停止)/ 完成 / 失败;悬浮可查看耗时与进度日志(错误高亮),可一键重新运行。
4. 切片(Chunk)管理
- 工具栏:全选、创建/编辑切片、批量删除、启用/禁用切片、文本展示模式切换、搜索。
- 切片卡片列表 + 分页;PDF 文档右侧有原文预览面板,选中切片时在原文中高亮定位。
- 创建/编辑切片可自定义内容与标签特征(手动标注)。
5. 解析/切片方法
| 方法 | 适用 |
|---|---|
| 通用 naive | 大多数普通文档(默认) |
| 问答 qa | 问答类内容 |
| 简历 resume | 简历文档 |
| 手册 manual | 操作手册 / 指南 |
| 表格 table | 表格型文档 |
| 论文 paper | 学术论文 |
| 图书 book | 书籍 |
| 法律 laws | 法规 / 合同 |
| 演示文稿 presentation | PPT |
| 图片 picture / 单图 one | 图片(多图 / 单图) |
| 音频 audio | 音视频转录 |
| 邮件 email | 邮件 |
| 标签 tag | 仅打标签、不参与对话检索 |
| 知识图谱 knowledge_graph | 图谱数据块 |
解析参数(在切片方法弹窗中可调):页面范围、布局识别、任务页大小、切分策略(token 数 / 分隔符)、自动关键词 / 自动问题、Excel 转 HTML、RAPTOR 解析、GraphRAG、实体类型,以及多检索维度开关(文本 / 表格逐单元格 / 图片 OCR / 图片 CLIP / 层级 / 图谱)和 RAG 增强项。
6. 配置(知识库设置)
- 基础项:名称、语言、头像、描述、权限(我 / 团队)。
- 根据所选切片方法动态显示对应的高级配置表单。
7. 检索测试
左侧控制面板:
| 控制项 | 作用 |
|---|---|
| 相似度阈值滑块 | 调召回严格度(0-1,越高越严) |
| Rerank 开关 | 启用后用重排模型二次排序 |
| 检索范围 | 按文件夹 + 是否含子文件夹 |
| 使用知识图谱 | 图谱召回 vs 纯文本召回 |
| 证件类型过滤 | 身份证 / 营业执照 / 资质证书 / 安全生产许可证 |
| 检索维度多选 | 文本 / 表格 / 图片 OCR / 图片 CLIP / 层级 / 图谱 |
| 跨语言 | 跨语种查询支持 |
| 测试问题 | 输入要召回的查询 |
右侧结果:可选文件集合、命中切片列表(展示混合/词项/向量相似度、来源维度标签、证件类型、图片预览),以及各维度的召回统计条。会同时测试「指定文档」与「全库」两种召回效果。
8. 知识图谱(知识库级)
- 力导向图可视化展示文档抽取出的实体与关系。
- 支持按实体类型筛选、聚焦、展开。
- 可一键删除整个图谱(不影响文档和切片)。
四、最佳实践
- 权限按需设置:知识库默认仅自己可见,需团队协作时在配置中改为「团队」权限;敏感知识库再叠加部门/角色二次鉴权。
- 多检索维度按内容开:表格类内容开「表格逐单元格」、图片类开「图片 OCR / CLIP」、含图谱需求开「图谱」,否则这些内容不会被检索到。
- 证件类型过滤:包含证件扫描件的知识库,在检索测试与对话中按证件类型过滤,避免混入错误证件导致误召回。
- 先检索测试再上线:新知识库上线前,至少跑 10 个真实问题在「检索测试」中验证召回效果——确认无误再让助手引用。
- 重新解析的两种姿势:内容微调用「增量解析」(快);切片方法改变或全量结构错误用「全量重做」(慢但稳)。
- 图谱能力按需开启:开启
knowledge_graph解析或 GraphRAG,实体关系类问题(如"哪些公司投资了 XX")才能用图谱回答;普通 FAQ 不用开。 - 元数据用起来:给重要文档打标签 + 分类 + 负责人 + 有效期,检索时按元数据筛选比纯文本相似度更准。
- 网页知识获取做兜底:政策、行情等会变的内容,用「知识获取」爬虫定时抓取入库,让知识自动保鲜,避免人工反复更新。