不把论文传出去,也能把它们筛一遍

研究者可以一次对最多 40 份 PDF 提问,不用把任何文件发出去:解析、向量化、检索都跑在浏览器标签页里。这一页讲解析器对预印本 PDF 的实际表现、超过 40 篇的综述怎么分批,以及本地小模型在哪里就不够用了。

最后更新:

这里好用的单位是你自己整理过的一个文件夹,而不是整个数据库。40 份 PDF、每块约 700 字符,算下来几千个块,在笔记本上向量化大约一分钟,之后断网也能继续检索。

解析器能从预印本里留下什么

表 1 — 预印本 PDF 的真实表现
元素能拿到什么你该怎么办
单栏正文顺序正确,每块都带页码不用处理,引用直接写「第 6 页」
双栏排版多数正确,偶尔出现跨栏串行引用前把那段在 PDF 里看一眼
行内数学符号部分保留:简单符号会变成文字推导过程回原始 PDF 读
公式以图片形式嵌入什么都没有自己截图保存
表格单元格文字按阅读顺序排,网格丢失问页码,然后在 PDF 里读表
参考文献表纯文本,作者名可被检索适合「哪篇引用了 X」这类问题
补充材料 CSV按行解析,提问可以针对某一列和 PDF 一起导入

什么样的提问能检索到内容

  1. “这些论文里,哪几篇的训练样本少于 1 万?”——前提是这个数字在正文里写出来了。
  2. “这篇论文在哪一段说明它的主要局限?”——局限段落大量复用自己的术语,排序会靠前。
  3. “哪几篇用了同一个基线做对比?”——基线名是精确词元命中,单靠向量检索容易把不同基线混在一起。
  4. “这批论文里出现了哪些评价指标?”——会把每处提法和文件、页码一起返回,汇总表由你来拼。
  5. “有没有提到复现研究?”——把严格度设为「仅依据文档」时,返回空本身就是有用的结论。

把 200 篇的初筛拆成几批

01

按子主题分组,不要按字母序

术语相同、能互相竞争的 40 篇,检索效果远好于 40 个彼此无关的标题:问基线时,排序里才有真正的候选互相比较。

02

在自己的笔记里给每批起名

一个浏览器配置对应一个库。「主题 A」「主题 B」「方法」分开跑,等于用「导入了什么」给提问划范围,所以要记清当前在哪一批。

03

腾地方之前先导出

在清除站点数据、为下一批让位之前,把问题清单和引用集合导出成 CSV 或 Markdown。导出的是纯文本,以后仍然可读。

04

每条结论都回 PDF 核对

每个检索到的段落都带文件名和页码。核对要在那里做,而不是对着那段总结做。

本地小模型不够用的地方

  • 跨论文综合。生成档在你的设备上跑 0.5B–1.5B(4-bit)模型,能把检索到的三段拼成一句话,但装不下一个两百篇的领域。
  • 非文字证据。只存在于图、图片公式或热力配色里的结论,文字管线看不见。
  • 只能扫描的资料。老期刊没有 OCR 层就抽不出文字,解析器会直接告诉你,而不是建一个空索引。
  • 数学验算。工具能帮你找到证明写在哪一页,不会去验证这个证明。
关于署名: 生成档是阅读辅助。用它产出你署名提交的文字,或者不加出处地改写别人的表达,都属于你所在机构的规则范围——在本地运行并不改变成果被评价的方式。

这个方案不适合你的时候

  • 你要检索的是整个领域,而不是一个文件夹。这里没有远端语料,只有你导入的文件可查。
  • 两位合作者需要同时查同一个实时索引。索引只在一个浏览器配置里,从不跨设备同步。
  • 初筛集超过 40 份或 200MB,而且没法按主题合理拆分。
  • 你需要的证据在图里、扫描页里,或者排版的公式里。
  • 需要一份可复核、带时间戳的检索记录。这里什么都不记录,这是设计选择。
  • 问题需要对很多论文做算术,比如合并样本量。检索返回段落,加总由你来做。

模型、离线使用,以及到底什么会离开这台机器

  • 英文库用 all-MiniLM-L6-v2(约 23MB);中文库用 bge-small-zh-v1.5(约 25MB);中英混排用 multilingual-e5-small(约 120MB)。
  • 可选生成档会下载 Qwen2.5 0.5B–1.5B(4-bit),400MB 到 1.0GB,且必须你点击确认后才会开始。
  • 整个应用只有一个外发请求:首次拉取模型权重,载荷是文件名。之后可离线工作。
  • 无账号、无追踪像素,也就没有地方把一份没写完的综述和某个人挂上关系。
  • 单库上限:40 份文件、单份 ≤25MB、总量 ≤200MB、≤20,000 个块。
能一次检索整个文献管理软件吗?

这个工具做不到。单库最多 40 份文件,整个语料必须按你自己划的批次来做。

LaTeX 源文件或 arXiv 的 HTML 版本能处理吗?

HTML 和纯文本都在支持列表里,arXiv 的 HTML 导出可以解析。LaTeX 源码也是纯文本,但宏用得多的话,切出来的块会很碎。

能把各篇的数字汇总成一张表吗?

它会把每处提到数字的地方连同页码返回,可选的生成档能把它们排成列表。数字本身建议你自己誊,本地小模型看错数字的概率比看错句子的概率更高。

双栏 PDF 会乱吗?

阅读顺序多数正确,但不保证。发现引用看起来串行时,回 PDF 里确认那一段;引用里带页码,核对很快。

没有显卡的机器能用吗?

可以。向量化和检索都是 CPU 的活儿。只有可选的生成档能从 WebGPU(走 WebLLM)里受益;纯 CPU 大约每秒 3–8 个 token。