免向量库,照样搜索:Sirchmunk 把 RAG 拉回“原始数据”

不是所有知识检索,都要先把文件切成向量、再建索引、再等召回。 Sirchmunk 想证明:直接把原始数据扔进去,系统也能越搜越聪明。

这不是又一个 RAG 优化项目

过去几年,RAG 几乎成了“企业知识库”的代名词:文档切块、Embedding、建向量索引、召回 rerank、最后喂给大模型。流程很成熟,但也很重——数据一变就要重建索引,向量近似总会丢上下文,ETL 和 GPU 成本并不低。

ModelScope 开源的 Sirchmunk 走了一条更激进的路:不做向量库,不做预索引,直接对原始文件做实时检索。它的口号也很直接:Raw data to self-evolving intelligence, real time.

如果这个方向成立,最直接的改变是:你不再需要维护一套“索引即真理”的基础设施;文件更新后,系统下一秒就能搜到最新内容。

它到底想解决什么问题

Sirchmunk 在官方文档里把传统 RAG 的核心痛点总结得很直接:

  • 建索引太贵,维护更贵;

  • 数据一变,索引就滞后;

  • 向量压缩后,很多细节已经失真。

所以它的解法也很明确:放弃向量库这个中间层,回到原始数据本身,靠文件路径元信息、关键词、知识聚类和少量 LLM 推理来完成检索与综合。

这种做法不是完全否定 Embedding,而是把“语义理解”尽量后置,只在证据提炼和知识整理时才调用模型,从而控制成本。

核心工作流:六阶段检索管线

Sirchmunk 的搜索过程分成六个阶段,官方文档给了一张很清晰的管线图:

Query | v +----------------------------------------------+ | Phase 0: Knowledge Reuse | | "Have we seen a similar question before?" | | YES -> return immediately | NO -> continue | +-------------------+--------------------------+ v +----------------------------------------------+ | Phase 1: Parallel Probing | | - LLM keyword extraction | | - Directory structure scan | | - Knowledge cache lookup | | - Spec-path context cache load | +-------------------+--------------------------+ v +----------------------------------------------+ | Phase 2: Retrieval & Ranking | | - Keyword-based content retrieval (IDF) | | - LLM-guided file candidate ranking | +-------------------+--------------------------+ v +----------------------------------------------+ | Phase 3: Knowledge Cluster Construction | | - Merge & deduplicate | | - Monte Carlo evidence extraction | | - LLM synthesis -> cluster | +-------------------+--------------------------+ v +----------------------------------------------+ | Phase 4: Output & Refinement | | - Evidence found -> LLM summarization | | - No evidence -> ReAct agent refinement | +-------------------+--------------------------+ v +----------------------------------------------+ | Phase 5: Persist | | - Save cluster for future reuse | +----------------------------------------------+

几个关键设计值得单独看:

  • Phase 0 知识复用:先问一句“这个问题以前见过吗”。如果命中相似查询,直接复用已有知识簇,不用重新走完整检索。这是整个系统“越用越省”的起点。

  • Phase 1 并行探测:关键词抽取、目录结构扫描、知识缓存、路径上下文缓存四路并行。也就是说,它同时从“内容”和“文件结构”两个角度猜答案在哪里。

  • Phase 2 双向检索:一边做关键词内容检索,一边让 LLM 根据文件路径和摘要做候选排序。这相当于把“全文检索”和“结构推断”叠在一起用。

  • Phase 3 证据聚类:不是把检索结果直接丢给模型,而是先合并去重,再用 Monte Carlo Evidence Sampling 抽取最相关片段,最后 LLM 汇总成一个知识簇。

  • Phase 4 失败兜底:如果前面没找到证据,系统不会直接认输,而是触发 ReAct Search Agent 继续多轮探索。

下面这张图把六阶段串了起来,省略了细节,方便快速理解整体流程:

Sirchmunk 检索管线总览

Sirchmunk 提供了两种速度档:

  • FAST 模式:默认档,2 级关键词级联 + 上下文窗口采样 + 早停,通常 2–5 秒返回,只消耗约 2 次 LLM 调用。

  • DEEP 模式:完整管线,包含 Monte Carlo 证据采样和多轮 ReAct 精修,适合复杂问题,耗时 10–30 秒,召回率更高。

这意味着同一个系统既能做日常轻量问答,也能接住高难度检索任务。

没有向量库,它靠什么找答案

这是整篇技术文章里最值得展开的部分。Sirchmunk 的检索基础不是向量相似度,而是几件事的组合:

  • 路径元信息:文件名、目录结构、修改时间、文件类型,这些本来就在文件系统里,不需要额外建表。

  • IDF 加权关键词检索:把 LLM 提取的多粒度关键词喂给全文检索,用词频稀缺度做排序,而不是靠语义向量。

  • 结构推断:LLM 不是只读内容,还会根据文件路径、目录层级、文件预览去判断“这个文件像不像答案”。

  • 知识簇复用:以前搜过的答案不是垃圾,而是会被压缩成知识簇。下次遇到相近问题,直接命中缓存。

换句话说,它更像是“把检索模型从向量空间搬回了文本和元数据空间”,再在上面叠加一层 LLM 推理。

Monte Carlo Evidence Sampling:少读文件,也能找对证据

很多 RAG 系统的通病是:为了找一段证据,先读大文件,再让模型总结。Sirchmunk 的思路是,能不能只读取最像答案的那部分?

它的做法很像统计采样:不是通读全文,而是根据候选文件做有策略的抽样,只读取最相关区域,再用 LLM 提炼证据。官方文档里把这套方法叫做 Monte Carlo Evidence Sampling

这种方式的核心收益是 Token 效率:模型不需要每次都吞整份文档,尤其适合代码库、论文集、日志目录这类大体量文件集合。

自进化:知识簇会随时间变厚

如果说“免向量库”是 Sirchmunk 的起点,那么“自进化”就是它想长期建立的壁垒。

系统会把每次检索结果沉淀成知识簇。随着使用次数增加:

  • 相近查询会命中已有簇,返回更快;

  • 簇内部会记录哪些问题曾催生哪些答案,形成查询历史;

  • 2026 年 7 月发布的 v0.0.9 还引入了 KnowledgeEvolver:知识图谱会自动做连接合并、边刷新、元聚类发现和全局更新。

也就是说,系统不是“静态检索工具”,而是会随着数据和使用一起成长。

集成方式:不止一个 CLI

Sirchmunk 并不仅仅是个命令行玩具。它现在覆盖了六类接口:

  • MCP Server

  • OpenClaw Skill

  • REST API

  • WebSocket 实时对话

  • CLI

  • Web UI

其中对 AI Agent 场景最直接的是 MCPOpenClaw Skill。也就是说,它已经设计成可以被 Claude Desktop、Cursor、OpenClaw 这类宿主直接调用,而不是让你先搞一套独立服务。

对于公众号读者来说,这意味着:如果你想给自己的 AI 助手接一个“本地文件智能问答”,现在有了一条比传统 RAG 更轻的路线。

从 RAG 到 In-Context Search,搜索范式正在变

Sirchmunk 官方博客里有一篇值得一读的文章:《From Index-Centric Retrieval to In-Context Reasoning》。它把当前趋势总结成一句话:传统 RAG 依赖静态索引,下一代搜索更像“实时上下文推理”。

Sirchmunk 不是唯一这么想的产品,但它把“无向量库”这条路线做成了一个完整系统,而不是概念验证。它既有论文,也有 Web UI、Docker、MCP 和 OpenClaw 接入,说明团队不是只发 Paper,而是在认真做工程化。

它适合谁

如果你符合下面任何一种情况,Sirchmunk 值得试:

  • 本地文件很多,但不想折腾向量库、图数据库和 ETL;

  • 数据更新频繁,受不了“改完文档还要重建索引”;

  • 希望把本地知识检索直接接给 AI Agent / MCP 宿主;

  • 更关心“原始上下文保真”而不是“近似语义匹配”。

如果你已经在用 Chroma、Milvus、Weaviate 这类向量数据库,也未必需要立刻迁移。但如果你想看看“去掉向量层之后,检索还能不能成立”,Sirchmunk 是目前最有代表性的开源样本之一。

相关链接

  • Sirchmunk 官方仓库[1]

  • Sirchmunk 官方文档与 Web UI[2]

  • Sirchmunk 技术长文博客[3]

  • Sirchmunk 论文:arXiv 2608.16185[4]

  • Sirchmunk Web 前端仓库[5]

引用链接

[1]Sirchmunk 官方仓库: https://github.com/modelscope/sirchmunk

[2]Sirchmunk 官方文档与 Web UI: https://modelscope.github.io/sirchmunk-web/

[3]Sirchmunk 技术长文博客: https://modelscope.github.io/sirchmunk-web/blog/technical-deep-dive/

[4]Sirchmunk 论文:arXiv 2608.16185: https://arxiv.org/pdf/2608.16185

[5]Sirchmunk Web 前端仓库: https://github.com/modelscope/sirchmunk-web


免向量库,照样搜索:Sirchmunk 把 RAG 拉回“原始数据”
https://maoyu92.github.io/2026/09/02/07 AI笔记/AI工具与模型/a017_免向量库,照样搜索:Sirchmunk 把 RAG 拉回“原始数据”/
作者
陈文茂
发布于
2026年9月2日
许可协议