问题
不同 Agent 应按任务读取最少必要资料,同时区分当前事实、历史资料、待确认内容和私密信息。
CASE STUDY · LEARNING PROTOTYPE
从本地 Markdown 知识库到可评估的最小 RAG 闭环。
这个项目证明的是一条已经运行并观察过的最小检索闭环、统一评估意识和边界判断,不是生产级 RAG 服务。
本地检索、统一评估与 Agent 上下文闭环已经实际运行并观察。
页面交互只切换预生成的虚构数据,不执行在线检索。
生产服务、浏览器实时 Embedding、持久化索引和候选重排。
OVERVIEW
不同 Agent 应按任务读取最少必要资料,同时区分当前事实、历史资料、待确认内容和私密信息。
比较人工路由、LLM Router 和向量检索的职责,用本地 Embedding 建立可重复基线,并让结果进入 Agent 上下文。
问题经过本地向量召回,以 Tool Result 进入 Agent 上下文,再由 Agent 基于结果回答或分析。这条最小闭环已经真实完成。
ARCHITECTURE
下面是两个分别跑通的学习链路,不把它们拼成尚不存在的生产架构。
远程 Router 只接收文档 ID、职责、状态与敏感级别;正文在候选 ID 返回后由本地程序读取。
确定性过滤先于语义排序;普通索引只读取 normal 且状态为 current 或 confirmed 的文档。
SANITIZED RETRIEVAL DEMO
离线搜索原型下一步应该验证什么?
先收集同类失败,再决定是否加入项目范围过滤、关键词融合或候选重排。
使用固定查询集比较改动前后的召回结果,不以单次搜索替代统一评估。
当前版本在进程内生成向量,没有持久化索引、ANN 或候选重排。
观察:查询明确包含项目与阶段,正确的项目状态文档位于首位。以下排名和分数仅用于静态演示。
EVALUATION
2026-07-30 运行快照:17 份普通文档、121 个文本块。
评估口径:以一个文档得分最高的文本块作为该文档排名;一条查询有多个普通索引内预期文档时,全部进入 Top-k 才算命中。
Hit@k 是一次学习基线,不代表生产准确率、稳定性承诺或永久规模。
FAILURE CASE · Q12
“如何向一名偏好分阶段学习的开发者讲解一组相关的新编程概念?”
描述教学与协作方式的文档进入 Top 3。
目标文档首次出现于第 8 位,没有进入 Top 3。
稠密向量优先匹配“编程、概念、学习”等表面主题,没有稳定识别“应该如何讲”的协作意图。
先由 Router、目录职责或元数据限定任务范围,再按需向量召回;只有同类失败反复出现时才验证混合检索或重排。
TRADEOFFS
当前规模小,Markdown 易于人工审阅、版本控制和维护权威位置;数据库不会自动解决事实状态和隐私边界。
复用人为组织的章节语义,避免把不同主题机械截断在同一个文本块中。
普通正文无需发送给远程 Embedding 服务;模型缓存缺失时直接失败,不在运行时自动联网修复。
百余文本块尚未形成近似最近邻索引的必要性,第一版优先保持数据流简单、可观察。
状态和敏感级别不是相似度问题,应由确定性代码处理,不能要求向量模型自行理解权限。
一个 q12 不足以证明必须立即增加混合检索和重排,复杂度应由重复出现的问题触发。
CAPABILITY BOUNDARY
这个里程碑证明我在 AI 辅助下跑通并能够解释最小检索闭环、统一评估和失败边界;它不证明我已经独立从零实现或运营生产级 RAG。