本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容: 我的帖子已经打上 开源推广 标签: 是 我的开源项目完整开源,无未开源部分: 是 我的开源项目已链接认可 LINUX DO 社区: 是 我帖子内的项目介绍,AI生成、润色内容部分已截图发出: 是 以上选择我承诺是永久有效的,接受社区和佬友监督: 是 以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出 加入论坛有一段时间了,每天愉快潜水,看各位佬聊技术谈模型,学到了不少 AI 新鲜事。最近小弟花了一些时间做了个类似 agentic search 的项目,鼓起勇气开源出来分享给各位佬友。 项目起因是:小弟感觉现在工作学习一直在不同平台和 AI 对话,虽然绝大多数内容不想再看第二遍,但总有某些时刻想复盘一下,这时候却只记得当初在某处聊过,不知道去哪里找回具体聊了什么。所以我想把这些对话收集起来,与平常散落各处的笔记和看到的网络文章一起,整理成 统一维护 的语料库。然后开放 MCP 接口,制定 skill,让 AI 去做 迭代检索 ,带着原文回答问题。 小弟把项目取名叫 Learn Corpus : github.com GitHub - def-a-name/learn-corpus: Personal corpus with source management, agentic... Personal corpus with source management, agentic search, and read-only MCP access. 目前已经实现: 导入 Codex/CC 会话,以及 Markdown 形式的 GPT / DS 网页会话、网页文章和个人笔记,导入过程有 skill-A 引导; Markdown 形式的网页会话和文章是借助 Chrome 插件获取的。 会话用的是 AI Exporter ,博客或文章用的是 Obsidian Web Clipper 构建、发布、更新检索索引,有 CI; MCP 可以通过 HTTP 或 stdio 连接,Codex 连接 MCP 后,根据 skill-B 所描述的状态转换规则,做搜索、读取和回答; 服务端做了一个账本,记录每次任务的调用次数、读取预算和检索单元,帮助审查检索过程; 小弟经验有限,又是第一次做这种项目,目前只是做到了 个人勉强够用 的状态,局限性其实挺明显,比如: 只做了 SQLite FTS5 词法检索,没引入语义检索和向量数据库; 需要自行导入和维护源文件,语料更新后索引需要重建,不能热更新; 数据库设计没有特别考虑多用户、多进程的并发读写; 项目用 Codex 开发,而且只在 Codex 下做了测试。非 OpenAI 的模型和 agent 效果未知; 所以也许项目不足以解决真实需求,但还是期盼各位佬有空能点进去看看文档,给点建议什么的(愿意赏 star 当然更好 ),希望某处局部设计真能引发佬的思考。感谢! 1 个帖子 - 1 位参与者 阅读完整话题


  • 情报分类:开源项目与落地
  • 分类依据:内容涉及项目实践、创业、副业或变现
  • 信息来源:服务器 / LINUX DO - 最新话题
  • 发布时间:2026/10/10 22:40:23