RAG还没死,SmartRAG更聪明了
今天分享的是SmartRAG–把云端GraphRAG那套百亿大模型现场建图的范式拆掉改成四个轻量模块分工让1.7B量化模型在一加手机上跑多跳QA追平18倍大模型。手机端跑GraphRAG的痛点不在模型小是云端让大模型建图那套范式搬不上手机–4B都卡分钟级TTFT。让我们一起看看SmartRAG是如何克服的。四模块分工SmartRAG的核心动作是把结构化知识能力从LLM能力问题重构为系统架构问题。四个模块协同PerceptionEvoNER持续学习NER 轻量关系分类器把文本抽成entity-relation三元组MemoryMRGraph三层图持久化绑定源段落做溯源Focus混合检索图遍历词法稠密语义Thinkingon-device LLM仅做labeling/summarization/planning/answering四角色高频写图交给轻量可训练组件LLM保留给低频高价值语义操作。EvoNER三件套EvoNER是整套架构的引擎三件套让轻量NER能持续吃新实体Span-based NER字符注入枚举候选span时只从word-start走到最大宽度W10O(nW)候选而非O(n²)。每个word首subword注入字符级特征 h_t [e_t ; m_t·c(t)]m_t是首subword指示位c(t)是字符级embedding增强对错拼和罕见surface form的鲁棒性。Reserved-label机制分类器预分配固定标签容量切分为base headno-entity已部署类型和reserved rows未来类型。reserved初始化为 b≪0, W≈0 的不激活态新类型直接占位不用重训分类器输出维度不变。Teacher distillation只在base子空间增量目标 L_inc L_task λ_KD·L_KD。蒸馏gate m_rI[max softmax(ℓ_T_base/T_kd) ≥ τ]即老师在base类上峰值概率超τ才蒸馏。reserved logits不被蒸馏新类型保持可塑性老边界由老师锚定。配套三阶段参数高效更新 Θ1Θ_head - Θ2Θ_head∪Θ_topK - Θ3Θ设备预算耗尽可在任意阶段停。未识别实体先冻结轻量embedder抽向量存本地向量库攒够数量后用Ward linkage做agglomerative聚类 d(A,B) (|A|·|B|)/(|A||B|)·||µ_A-µ_B||²凝聚出大簇再交给Thinking模块打标签。MRGraph三层图MRGraph是三层溯源知识图Layer 1 Entity-paragraph graph段落是写入和检索的原子单位。段落节点存原文文档指针in-document indexembedding实体节点用稳定name hash去重关系边带observation count防图爆炸。Ingestion走evidence-first, structure-second–三元组先对齐到best-matching段落再materialize为关系边保证每条结构化事实都可追溯。Layer 2 Abstraction layer在实体之上维护语义簇centroid平滑更新anchor-centroid drift metric检测并阻止主题漂移。簇摘要在正常运行时增量维护idle-and-charging时段做高质量refinement。Layer 3 Runtime raw-text viewquery时把命中的段落证据和局部图邻居按token budget组装成context同时给Thinking模块结构化和非结构化两类证据。三阶段混合检索Thinking模块先把问题分解成retrieval plan P(e_0, {(r_h, t_h)}^H_{h1})e_0是seed entity每跳r_h是自然语言关系短语如published int_h是目标实体类型。Stage 1按plan多跳文本检索每跳把当前center entity和关系短语拼成local query用fused lexicaldense相似度召回段落MMR在token预算下选证据再用命中段落推下一跳的entity center。Stage 2Stage 1的bridge entity做图遍历种子。每个节点把自身拼接query后跟abstraction层摘要比对选top-ranked簇做top-down扩展。Personalized PageRank估节点重要性连通子图块配段落证据组装。Stage 3前两阶段证据不足时全文检索兜底解决实体跨段落切分的边界问题。最后做entity mention局部窗口抽取句子级压缩hash去重再喂给LLM。LLM稀疏叫醒on-device LLM被当作可复用语义引擎只在4个高价值语义操作上被叫醒Labeling对置信度不够的实体簇LLM提出新类型名 ∆T LLM(cluster(M))语义发散的簇被拒绝以防污染类型空间SummarizationKG周期性聚成communityLLM产出摘要重插回上层段落形成自压缩记忆环Planning复杂问题在取证据前先被分解成多跳retrieval planAnsweringLLM基于检索证据生成答案约束在结构化schema上偏抽取式grounding降低幻觉建图、关系抽取、聚类、检索这些高频操作都不走LLM。实验对比4个QA benchmark上跑Qwen3-1.7BSmartRAGQ6_K量化llama.cpp后端OnePlus 13/15真机BenchmarkSmartRAG (1.7B) Cr%Qwen3-32B LLM-only Cr%Ministral3-14B LLM-only Cr%TriviaQA50.0051.4560.70NQ66.6840.1537.80HotpotQA63.9333.2522.40MultiHopQA50.1731.5420.12NQ/HotpotQA/MultiHopQA三局1.7BSmartRAG全面反超32B和14B这两组大模型参考。TriviaQA上简单事实问题大模型parametric memory仍有优势。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】