不把论文传出去,也能把它们筛一遍
研究者可以一次对最多 40 份 PDF 提问,不用把任何文件发出去:解析、向量化、检索都跑在浏览器标签页里。这一页讲解析器对预印本 PDF 的实际表现、超过 40 篇的综述怎么分批,以及本地小模型在哪里就不够用了。
最后更新:
这里好用的单位是你自己整理过的一个文件夹,而不是整个数据库。40 份 PDF、每块约 700 字符,算下来几千个块,在笔记本上向量化大约一分钟,之后断网也能继续检索。
解析器能从预印本里留下什么
| 元素 | 能拿到什么 | 你该怎么办 |
|---|---|---|
| 单栏正文 | 顺序正确,每块都带页码 | 不用处理,引用直接写「第 6 页」 |
| 双栏排版 | 多数正确,偶尔出现跨栏串行 | 引用前把那段在 PDF 里看一眼 |
| 行内数学符号 | 部分保留:简单符号会变成文字 | 推导过程回原始 PDF 读 |
| 公式以图片形式嵌入 | 什么都没有 | 自己截图保存 |
| 表格 | 单元格文字按阅读顺序排,网格丢失 | 问页码,然后在 PDF 里读表 |
| 参考文献表 | 纯文本,作者名可被检索 | 适合「哪篇引用了 X」这类问题 |
| 补充材料 CSV | 按行解析,提问可以针对某一列 | 和 PDF 一起导入 |
什么样的提问能检索到内容
- “这些论文里,哪几篇的训练样本少于 1 万?”——前提是这个数字在正文里写出来了。
- “这篇论文在哪一段说明它的主要局限?”——局限段落大量复用自己的术语,排序会靠前。
- “哪几篇用了同一个基线做对比?”——基线名是精确词元命中,单靠向量检索容易把不同基线混在一起。
- “这批论文里出现了哪些评价指标?”——会把每处提法和文件、页码一起返回,汇总表由你来拼。
- “有没有提到复现研究?”——把严格度设为「仅依据文档」时,返回空本身就是有用的结论。
把 200 篇的初筛拆成几批
按子主题分组,不要按字母序
术语相同、能互相竞争的 40 篇,检索效果远好于 40 个彼此无关的标题:问基线时,排序里才有真正的候选互相比较。
在自己的笔记里给每批起名
一个浏览器配置对应一个库。「主题 A」「主题 B」「方法」分开跑,等于用「导入了什么」给提问划范围,所以要记清当前在哪一批。
腾地方之前先导出
在清除站点数据、为下一批让位之前,把问题清单和引用集合导出成 CSV 或 Markdown。导出的是纯文本,以后仍然可读。
每条结论都回 PDF 核对
每个检索到的段落都带文件名和页码。核对要在那里做,而不是对着那段总结做。
本地小模型不够用的地方
- 跨论文综合。生成档在你的设备上跑 0.5B–1.5B(4-bit)模型,能把检索到的三段拼成一句话,但装不下一个两百篇的领域。
- 非文字证据。只存在于图、图片公式或热力配色里的结论,文字管线看不见。
- 只能扫描的资料。老期刊没有 OCR 层就抽不出文字,解析器会直接告诉你,而不是建一个空索引。
- 数学验算。工具能帮你找到证明写在哪一页,不会去验证这个证明。
这个方案不适合你的时候
- 你要检索的是整个领域,而不是一个文件夹。这里没有远端语料,只有你导入的文件可查。
- 两位合作者需要同时查同一个实时索引。索引只在一个浏览器配置里,从不跨设备同步。
- 初筛集超过 40 份或 200MB,而且没法按主题合理拆分。
- 你需要的证据在图里、扫描页里,或者排版的公式里。
- 需要一份可复核、带时间戳的检索记录。这里什么都不记录,这是设计选择。
- 问题需要对很多论文做算术,比如合并样本量。检索返回段落,加总由你来做。
模型、离线使用,以及到底什么会离开这台机器
- 英文库用 all-MiniLM-L6-v2(约 23MB);中文库用 bge-small-zh-v1.5(约 25MB);中英混排用 multilingual-e5-small(约 120MB)。
- 可选生成档会下载 Qwen2.5 0.5B–1.5B(4-bit),400MB 到 1.0GB,且必须你点击确认后才会开始。
- 整个应用只有一个外发请求:首次拉取模型权重,载荷是文件名。之后可离线工作。
- 无账号、无追踪像素,也就没有地方把一份没写完的综述和某个人挂上关系。
- 单库上限:40 份文件、单份 ≤25MB、总量 ≤200MB、≤20,000 个块。
能一次检索整个文献管理软件吗?
这个工具做不到。单库最多 40 份文件,整个语料必须按你自己划的批次来做。
LaTeX 源文件或 arXiv 的 HTML 版本能处理吗?
HTML 和纯文本都在支持列表里,arXiv 的 HTML 导出可以解析。LaTeX 源码也是纯文本,但宏用得多的话,切出来的块会很碎。
能把各篇的数字汇总成一张表吗?
它会把每处提到数字的地方连同页码返回,可选的生成档能把它们排成列表。数字本身建议你自己誊,本地小模型看错数字的概率比看错句子的概率更高。
双栏 PDF 会乱吗?
阅读顺序多数正确,但不保证。发现引用看起来串行时,回 PDF 里确认那一段;引用里带页码,核对很快。
没有显卡的机器能用吗?
可以。向量化和检索都是 CPU 的活儿。只有可选的生成档能从 WebGPU(走 WebLLM)里受益;纯 CPU 大约每秒 3–8 个 token。