定的业务场景是企业公文写作,本地 Embedding/Rerank 和模型推理也一起整合进来了,不只是套一层 Agent 编排。 整体链路是文档解析 → Hybrid RAG 召回 → Rerank → Agent Tool 调用 → 证据约束生成,Web 端用 WebGPU 跑 Embedding/Rerank ,桌面端用 llama.cpp 跑本地模型。 llama.cpp 端还做了点优化,cuda 版本对块对角矩阵的计算有问题,原版全部计算了,浪费了大量时间。 这块是朋友帮助下 codex 帮忙改的,当时测试的时候发现同样一份测试用例 valkun 需要 3s 就能 rerank 完,cuda 版本居然要 10s 。 以下是核心功能演示视频。 https://cac.opple.com/yc-media/getFile?id=bc58421664e24de799260e7c677ebc8a#.mp4 项目地址: https://github.com/helpleness/openinkflow 网站地址: https://doc.inkflowai.top/ 项目目前仍在完善,具体架构、Eval 和 Benchmark 都在 README ,欢迎提 Issue / PR / 架构建议,觉得有价值也欢迎 Star 。


  • 情报分类:服务器与云资源
  • 分类依据:内容涉及服务器、云资源或网络线路
  • 信息来源:服务器 / V2EX
  • 发布时间:2026/10/10 17:32:00