跳到主要内容

知识库

📖 适合谁:AI 产品经理 / 数据团队 / 业务运营 —— 想把公司文档/手册/合同/培训资料变成 AI 可检索的私有知识库的人

📖 阅读时长:4 分钟

📖 一句话:YingCore 内置的 RAG 核心模块,用于构建企业私有知识资产,覆盖 创建 → 上传 → 解析/切片 → 配置 → 检索测试 → 知识图谱 全流程。顶部导航「知识库」(路由 /knowledge) 即可进入,全员可访问,供工作台对话与智能应用检索引用。


一、主要能力

能力说明
多源文档接入PDF / Word / Excel / Markdown / 网页爬取 / 数据库同步 / 飞书云文档 / 语雀 / 客户端同步工具
自动切片与向量化上传后自动切分、Embedding(bge / bce / OpenAI text-embedding)、存入向量数据库
多模态知识图片 OCR、图片 CLIP、表格逐单元格、公式识别——不仅限于纯文本
15 种解析方法通用 naive / 问答 qa / 简历 resume / 手册 manual / 表格 table / 论文 paper / 图书 book / 法律 laws / 演示文稿 presentation / 图片 picture / 单图 one / 音频 audio / 邮件 email / 标签 tag / 知识图谱 knowledge_graph
多检索维度文本 / 表格逐单元格 / 图片 OCR / 图片 CLIP / 层级 / 图谱,可单选可组合
检索增强 (RAG)语义检索 + 关键词检索 + 混合检索,可设 Top-K / 相似度阈值 / Rerank 重排
知识图谱 (GraphRAG)抽取实体关系,力导向图可视化,支持图谱检索
检索测试相似度阈值滑块 + Rerank + 检索范围 + 证件类型过滤 + 跨语言;双模式(指定文档 / 全库)
文档全生命周期上传、解析(实时进度可停)、切片、修改切片、启用/禁用、重新解析(全量/增量)、维度修复、删除、下载
权限与版本我 / 团队可见范围;文档修改有版本号,可回退到任一历史版本
元数据管理标签、分类、有效期、负责人等结构化字段,便于筛选
引用到工作台工作台 助手输入框关联知识库,对话即可获得带 [ID:n] 引用的回答

二、典型应用场景

  • 产品手册问答:客户问产品参数 → 助手在知识库中检索 → 返回准确答案 + 引用 PDF 角标,点击可在原文中高亮定位。
  • 新人入职:HR 把制度、流程、福利文档入库,新员工通过对话快速自查,省去反复问 HR 的时间
  • 法务合同检索:律师在数十万份合同中检索「含对赌条款 + 2023 年签署」,秒级返回命中切片。
  • 客服话术统一:所有客服数字员工共享同一知识库,保证口径一致,不依赖个人记忆。
  • 网页知识自动入库:在「知识获取」页配置爬虫任务,把官网 / 政策页 / 产品页定时抓取入库,知识自动保鲜
  • 证件扫描件管理:身份证 / 营业执照 / 资质证书 / 安全生产许可证分类入库,检索时可按证件类型过滤,避免误召回其他证件
  • 跨语言检索:中文知识库里查英文问题也能命中(开启跨语言开关),外资/外贸场景必备
  • 图谱实体推理:开启 GraphRAG 后,「A 公司投资 B 公司」这类关系问题可通过图谱回答,不再依赖纯文本相似度。

三、界面与操作

1. 知识库列表页(/knowledge

  • 无限滚动卡片网格:每个知识库显示名称、更新时间、文档数、描述;支持搜索与删除。
  • 顶部按钮:
    • 创建知识库:输入名称即可创建,创建后自动进入配置页。
    • 知识获取:跳转爬虫管理页(/myCrawler),从网页抓取内容。
    • 下载同步工具:下载客户端同步工具(/sync-tool),把本地目录里的文件批量同步入库。

2. 知识库详情页(/knowledge/dataset?id=xxx

顶部展示「当前 / 所有知识库今日新增文档数」。左侧四个页签:

页签功能
数据集文件夹树 + 文档列表 + 切片管理(默认页)
检索测试输入测试问题,验证召回效果
配置基础信息 + 解析方法 + 高级参数
知识图谱仅当知识库已有图谱数据时显示

3. 数据集 → 文件管理

  • 文件夹树:新建、展开/折叠文件夹,支持把文档拖拽进文件夹或移动到文件夹。
  • 工具栏:搜索、上传文件网页爬取新建空白文档、移动到文件夹、列表/网格视图切换。
  • 文档列表列:文件名、切片数、上传时间、切片方法、启用开关、解析状态、操作。
  • 文档操作:修改切片方法 / 设置元数据、重命名、取消解析、重新解析(全量/增量)、删除、维度修复、下载。
  • 解析状态:未开始 / 运行中(实时进度,可停止)/ 完成 / 失败;悬浮可查看耗时与进度日志(错误高亮),可一键重新运行。

4. 切片(Chunk)管理

  • 工具栏:全选、创建/编辑切片、批量删除、启用/禁用切片、文本展示模式切换、搜索。
  • 切片卡片列表 + 分页;PDF 文档右侧有原文预览面板,选中切片时在原文中高亮定位。
  • 创建/编辑切片可自定义内容与标签特征(手动标注)。

5. 解析/切片方法

方法适用
通用 naive大多数普通文档(默认
问答 qa问答类内容
简历 resume简历文档
手册 manual操作手册 / 指南
表格 table表格型文档
论文 paper学术论文
图书 book书籍
法律 laws法规 / 合同
演示文稿 presentationPPT
图片 picture / 单图 one图片(多图 / 单图)
音频 audio音视频转录
邮件 email邮件
标签 tag仅打标签、不参与对话检索
知识图谱 knowledge_graph图谱数据块

解析参数(在切片方法弹窗中可调):页面范围、布局识别、任务页大小、切分策略(token 数 / 分隔符)、自动关键词 / 自动问题、Excel 转 HTML、RAPTOR 解析GraphRAG、实体类型,以及多检索维度开关(文本 / 表格逐单元格 / 图片 OCR / 图片 CLIP / 层级 / 图谱)和 RAG 增强项。

6. 配置(知识库设置)

  • 基础项:名称、语言、头像、描述、权限( / 团队)。
  • 根据所选切片方法动态显示对应的高级配置表单。

7. 检索测试

左侧控制面板:

控制项作用
相似度阈值滑块调召回严格度(0-1,越高越严)
Rerank 开关启用后用重排模型二次排序
检索范围按文件夹 + 是否含子文件夹
使用知识图谱图谱召回 vs 纯文本召回
证件类型过滤身份证 / 营业执照 / 资质证书 / 安全生产许可证
检索维度多选文本 / 表格 / 图片 OCR / 图片 CLIP / 层级 / 图谱
跨语言跨语种查询支持
测试问题输入要召回的查询

右侧结果:可选文件集合、命中切片列表(展示混合/词项/向量相似度、来源维度标签、证件类型、图片预览),以及各维度的召回统计条。会同时测试「指定文档」与「全库」两种召回效果

8. 知识图谱(知识库级)

  • 力导向图可视化展示文档抽取出的实体与关系。
  • 支持按实体类型筛选、聚焦、展开。
  • 可一键删除整个图谱(不影响文档和切片)。

四、最佳实践

  1. 权限按需设置:知识库默认仅自己可见,需团队协作时在配置中改为「团队」权限;敏感知识库再叠加部门/角色二次鉴权。
  2. 多检索维度按内容开:表格类内容开「表格逐单元格」、图片类开「图片 OCR / CLIP」、含图谱需求开「图谱」,否则这些内容不会被检索到
  3. 证件类型过滤:包含证件扫描件的知识库,在检索测试与对话中按证件类型过滤,避免混入错误证件导致误召回。
  4. 先检索测试再上线:新知识库上线前,至少跑 10 个真实问题在「检索测试」中验证召回效果——确认无误再让助手引用。
  5. 重新解析的两种姿势:内容微调用「增量解析」(快);切片方法改变或全量结构错误用「全量重做」(慢但稳)。
  6. 图谱能力按需开启:开启 knowledge_graph 解析或 GraphRAG,实体关系类问题(如"哪些公司投资了 XX")才能用图谱回答;普通 FAQ 不用开。
  7. 元数据用起来:给重要文档打标签 + 分类 + 负责人 + 有效期,检索时按元数据筛选比纯文本相似度更准
  8. 网页知识获取做兜底:政策、行情等会变的内容,用「知识获取」爬虫定时抓取入库,让知识自动保鲜,避免人工反复更新。