之前做了一个解析+记忆的小工具 Knowhere ,很多人都觉得跟 MinerU 有点像,其实 MinerU 只负责解析,Knowhere 还会把解析之后的 chunking 、embedding 一系列事情都做了,直接变成 AI agent 可以直接调用、检索、回溯、查找的记忆层。Knowhere 更偏现实场景一点,因为一开始弄这个项目,就是因为现实场景的文档太脏,普通解析更多面向办公场景的资料,对现实场景的脏文档解析效果不佳。 现在 Knowhere 又更新了一版,新增了一条纯视觉解析路线——vision-map ,更好地服务那些不便转化成文档的资料了。欢迎大家来试试: https://knowhereto.ai/github/?utm_source=v2ex 简单讲一下使用的场景。一份排版清晰的 Word 文档,转换成结构化文本以后,标题、段落和表格通常都能被准确保留下来。但如果面对的是扫描合同、复杂研报、演示文稿或者工程图纸,情况就不一样了。 这些文件中的信息不只存在于文字里,还存在于页面布局、表格关系、图形位置、颜色、标注和相邻内容之间。传统解析一旦读错顺序、漏掉数字或者拆散表格,错误就可能被写进知识库,并在之后被 Agent 反复使用。 VISION-MAP 采用了另一种思路:不急着把页面完全改写成文字,而是保留原始页面,让视觉模型从整个页面出发理解内容。系统会为页面建立章节归属、主题说明和必要的内容标注,再把它组织进文档地图。Agent 需要时,可以先找到相关页面,再直接查看原页。 到了 Knowhere 2.0 ,这条视觉路线与原有的文本解析组成了一套双轨架构。文本轨负责高效地读 Word 、Excel 、Markdown 、JSON 等结构比较清晰的资料,Knowhere 会尽可能保留准确的文字和原生结构。视觉轨负责完整地看 PDF 、PPT 等以页面为主要载体的文档,Knowhere 2.0 可以通过视觉模型理解完整页面,所以不需要转化成 Markdown ,直接保留原页面进入搜索。 两条轨道最终会进入同一套文档记忆。 对 Agent 来说,文本段落和视觉页面都会被组织成带有章节层级、来源位置、相关资产和文档关系的节点。Agent 可以在同一个知识库里查找它们,也可以在一次任务中同时读取文字和页面。 这给用户带来了几个直接变化: 不必为了建立知识库,先把所有资料手动转换成同一种格式; 干净文档依然可以使用高效、准确的文本解析; 图纸、扫描件和复杂报告不再因为难以完美转写而被挡在知识库之外; Agent 给出结论后,可以继续回到具体章节、页码和原始页面进行核验。 此外,Knowhere 2.0 还更新了 Agent 原生检索。上一个版本中,MapNav 已经开始利用文档结构进行导航,但它仍然是一套相对固定的检索流程。每个问题大致沿着预设路径完成查找,Agent 能够使用的策略仍然有限。 Knowhere 2.0 则进一步把这套能力开放成 Agent 可以自主使用的文档记忆底座。 系统会向 Agent 提供文档大纲、章节结构、精确搜索、模糊召回、全文阅读、图片和表格资产,以及跨文档关系等工具。至于先调用哪一个工具、以什么顺序调用、需要深入到哪一层,由 Agent 根据当前任务自己判断。 面对一个简单问题,Agent 可以直接搜索并返回答案。 面对一个复杂问题,它也可以先查看有哪些资料,再阅读相关文档的目录;找到可能相关的章节后继续向下查找,读取完整段落或者原始页面;如果证据不足,还可以转向其他文档,比较不同版本,或者顺着相关实体继续探索。 整个过程更接近一个人在资料库中的真实工作方式: 先了解资料范围; 判断答案可能出现在哪里; 沿着目录和线索缩小范围; 阅读相关段落、页面和资产; 对照其他文档补充或验证; 带着文档、章节和页码返回结论。 由此,Agent 获得了调整检索策略的能力,如果第一次没有找到足够证据,它可以换一种工具或者继续向下阅读;如果问题涉及多个文档,它可以主动建立联系;如果用户继续追问,它也不必每次都从几个孤立片段重新开始。 结果显示,相比直接使用原始文档,Agent 使用 Knowhere 后的首次回答准确率提高了 36%,召回率提高了 11%;加入用户反馈后,准确率达到 79%,而直接读取原始文档的结果约为 53%。 除了准确率,Agent 完成任务所需的循环次数、时间和 Token 使用量也有所下降。原因并不是 Agent “读得更快”了,而是它可以沿着已经建立好的文档结构寻找答案,不必反复通读大段无关内容。 如果你也在做工程类知识库、企业尽调与制度核验这种直面现实场景的业务,那欢迎来试试。有什么问题,也欢迎反馈~ Knowhere:: https://knowhereto.ai/github/?utm_source=v2ex


  • 情报分类:技术学习与提效
  • 分类依据:内容涉及技术、AI、软件工具或工程实践
  • 信息来源:服务器 / V2EX
  • 发布时间:2026/9/19 20:22:18