这个工具是为哪四种文档工作准备的
SecureRAG 在单个浏览器标签页里,对 PDF、Word、Markdown、CSV 等文件回答问题。这一栏目把四类用法写细:会碰到什么文件、哪些提问能检索到东西、以及什么时候该换别的工具。文件永不离开你的设备。
最后更新:
不用把合同发给服务器,也能把它问一遍
律师、律师助理或合规人员可以一次对最多 40 份 PDF 或 DOCX 提问,解析、向量化、检索全部在浏览器里完成。文件永不离开你的设备。这一页写明哪些格式靠得住、哪些提问能检索到内容,以及什么时候本地工具就是选错了。
不把论文传出去,也能把它们筛一遍
研究者可以一次对最多 40 份 PDF 提问,不用把任何文件发出去:解析、向量化、检索都跑在浏览器标签页里。这一页讲解析器对预印本 PDF 的实际表现、超过 40 篇的综述怎么分批,以及本地小模型在哪里就不够用了。
用讲义、教材章节和历年真题复习
课程材料不用上传也能提问:最多 40 份文件、单份 ≤25MB,解析和索引都在浏览器标签页里完成。这一页讲一个学期该导入哪些文件、怎么问出能跳回幻灯片和页码的答案,以及哪些用法会越过学校划的那条线。
在本地回答制度与报销类问题
人事或财务可以把最多 40 份文件——员工手册、报销制度、供应商合同、导出为 CSV 的发票——放进一个浏览器本地的库,一起提问。什么都不上传。这一页讲支持哪些格式、哪些提问方式管用,以及一个本地工具回答不了的管控问题。
先挑一页和你手上活儿最像的看。每页都会写明文件类型、能检索到内容的提问方式,以及在哪一步它就不再是最合适的工具。
四种用法的共同点
它们跑的是同一条管线:用魔数嗅探而不是看扩展名,解析时保留 PDF 页码与 Word 标题层级,按约 700 字符、15% 重叠切块,在 Web Worker 里本地向量化,索引写进 IndexedDB,再做混合检索——向量检索与 BM25 用 RRF(k=60)融合,MMR 取 λ=0.7,返回前 6 段。默认回答档直接摘取检索到的原句并保留编号引用。可选的生成档会加载本地 Qwen2.5 0.5B–1.5B(4-bit),下载前需要你点一次确认。
| 用法 | 典型的文件库 | 好用的提问 | 在哪里失效 |
|---|---|---|---|
| 法律 | 30–40 份合同、制度、诉讼文书,PDF 或 DOCX | “通知期是在哪一条定义的?触发条件是什么?” | 没有文字层的扫描附件;条款最终仍要人来读 |
| 科研 | 最多 40 篇预印本,外加 CSV 或 JSON 数据附录 | “这些论文里,哪几篇对解码器层数做了消融实验?” | 公式是图片;双栏 PDF 偶发阅读顺序错乱 |
| 学生 | 课堂讲义 PDF、教材章节、历年真题、自己的笔记 | “2024 年那份卷子的第 2 题考的是第 3 周的哪个定义?” | 课程规定必须独立完成的环节 |
| 人事与财务 | 员工手册、报销制度、供应商合同、导出成 CSV 的发票 | “打车 800 元要什么凭证?” | 单库 200MB 上限;没导出成 CSV 的表格 |
决定这套方案能不能用的几个上限
| 上限 | 数值 | 实际什么时候会撞到 |
|---|---|---|
| 单个文件 | ≤25MB | 纯文字 PDF 很少撞到(300 页常常只有 3–8MB);图片多的 PDF 很容易顶到 |
| 单库文件数 | ≤40 份 | 一个学期的课程材料、一次 40 篇的初筛装得下;200 篇的综述装不下,得分批 |
| 单库总量 | ≤200MB | 大约 30–40 份中等体量的 PDF;扫描件最耗这个额度 |
| 单库块数 | ≤20,000 | 按每块约 700 字符算,约合 1400 万字符,所以通常先撞到体积上限 |
| 首次模型下载 | all-MiniLM-L6-v2 约 23MB(英文)、bge-small-zh-v1.5 约 25MB(中文)、multilingual-e5-small 约 120MB(中英混排) | 只发一个请求,载荷只有模型文件名,之后走缓存、可离线 |
| 可选生成档 | 400MB–1.0GB,需点击确认 | Qwen2.5 0.5B–1.5B(4-bit);有 WebGPU 走 WebLLM,否则 CPU 约 3–8 token/s |
哪类活儿通常需要哪一档
- 合同与制度类的活儿多半是「找出准确的那一条」,默认的抽取档就够:它摘取原句并保留编号引用,不写一个字。
- 文献初筛在需要跨段落串成一段话时,生成档更省事。没有 WebGPU 时,CPU 上每秒只有几个 token,长答案要等。
- 课程材料基本不需要生成档。问题多是「这句话出自哪里」,带页码或幻灯片号的原文才是你要复习的东西。
- 中英混排的资料用 multilingual-e5-small(约 120MB)更合适,比装两个单语模型省事。
这几页都用不上的情况
- 需要一个团队共用、带权限的文档库。这里没有后端也没有共享索引:每个人导入自己的副本,索引存在各自的浏览器配置里。
- 资料超过 40 份或 200MB,而且没法分批。
- 素材全是没有文字层的扫描件,手头也没有 OCR 环节。
- 需要跨大量文档自动算数,或者需要「谁看过什么」的审计日志。这里什么都不记录。
- 答案会被直接采信,而没有人去读引用的那一段。检索返回的是段落,不是核对过的结论。
拿自己的文件试三步
- 打开工具页,另开一个窗口打开开发者工具的 Network 面板并清空日志。
- 添加两份你电脑上已有的文件——一份 PDF、一份 DOCX——看着索引进度走,同时确认没有任何请求发出。
- 问一个你已知答案的问题,点一下引用编号跳转;再把 DevTools 切到 Offline,确认回答照常给出。