用讲义、教材章节和历年真题复习

课程材料不用上传也能提问:最多 40 份文件、单份 ≤25MB,解析和索引都在浏览器标签页里完成。这一页讲一个学期该导入哪些文件、怎么问出能跳回幻灯片和页码的答案,以及哪些用法会越过学校划的那条线。

最后更新:

一个学期的材料通常 15–30 份,40 份的上限一次就够用。所以要决定的是放进哪些文件,而不是怎么把它们塞进去。

一个学期该导入什么

表 1 — 值得导入的材料
你手上的东西格式值得导入吗说明
课堂讲义导出为 PDF值得——文字和幻灯片号都在整页是一张大图的幻灯片只会留下图注
教材章节带文字层的 PDF值得纯扫描版一点文字都抽不出来
历年真题DOCX 或 PDF全部导入常常是价值最高的一批,能看出重复的题型
自己的笔记Markdown 或 TXT值得你自己的用词有助检索,因为你也是用自己的话提问
扫描版教材纯图片 PDF先做 OCR 再说解析器会把这份文件报出来,而不是建空索引
成绩表格导出为 CSV基本用不上检索基于文字,孤零零的数字缺少可匹配的上下文

靠引用跑起来的复习循环

  1. 把一个学期的材料放进一个库,等索引建完;进度是按文件显示的。
  2. 先问一个你已经会答的定义题,比如「这门课里机会成本是怎么定义的」,确认引用落在正确的幻灯片上。
  3. 再问缺口:「第 3 周的哪些内容出现在 2024 年那份卷子里?」把检索出来的题目先在脑子里答一遍,再翻讲义核对。
  4. 问跨材料的比对题:「讲义和教材对「方差」的定义一样吗?」两段原文都会返回,由你判断你们老师按哪个讲。
  5. 把你用过的引用记到一个 Markdown 文件里。重读自己的问题清单,比重读一整章快。

材料会怎么跟你作对

  • 图表和时间轴承载的信息文字管线看不到,问一张图只会返回图注里的那几个字。
  • 公式密集的页面通常丢掉上下标,表达式的含义因此变化。公式回原文读。
  • 扫描件里的手写笔记完全解析不出来。
  • 一个 40 份的库装一个学期很宽松。读完整学位要在学期之间清除站点数据,索引也会一起删掉——想留的先导出。

20,000 块的上限放在这里是什么意思

每块约 700 字符、15% 重叠,20,000 块大约是 1400 万字符。一份 60 页幻灯片的讲义常常不到 3 万字符,所以通常先是 40 份的数量上限到顶,块数上限还远着。

这个方案不适合你的时候

  • 你想要一整本书、按章节逐章生成的总结。检索返回的是最相关的前六段,不是一份缩编。
  • 这份作业要计分,而且要求独立完成。先看课程的规定:在本地运行并不改变「是否允许借助工具」这件事。
  • 你需要在手机和笔记本上共用同一个库。索引在某个浏览器配置里,不会同步。
  • 你想把复习资料打包给小组。文件永不离开设备,索引也就没法分享——要么共享问题清单和引用,要么各自导入同一批文件。
  • 设备可用内存很小。移动浏览器会把文档数量上限调低,工具会明确告诉你,而不是建索引建到一半崩掉。
学术诚信: 这是一个检索工具。用可选的生成档产出你署名提交的段落,不是它的用途;在你自己设备上运行,也不会改变学校对这件事的处理方式。

适合复习的设置

  • 留在默认的抽取档:它摘取检索到的原句并保留编号引用,正是用来背材料的那一档。
  • 严格度设为「仅依据文档」。没有任何段落越过相似度阈值时,你会看到「文档中未找到」,而不是一个编得像那么回事的答案。
  • 只有有 WebGPU 时才开生成档;没有的话,CPU 大约每秒 3–8 个 token,而且要下载 400MB 到 1.0GB。
  • 文件永不离开你的设备,无账号、无追踪像素;向量缓存之后整个库可以离线使用。
手机能用吗?

能,但文档数量上限更低,因为移动浏览器允许的内存更少。界面会直接给出调低后的上限,而不是建索引到一半失败。

能把整本教材总结出来吗?

不能。它针对一个问题返回最相关的前六段。想要章节摘要,等于在赌模型不乱写,而不是在读来源。

小组能共用一个库吗?

不能直接用。没有服务器也没有共享索引;每个人各自导入同一批文件,索引留在各自的浏览器配置里。

这算作弊吗?

那由你的课程规定来界定,不由这一页来界定。检索你自己的课程材料,最接近「给自己的笔记建了个搜索索引」;把生成的文字当成自己写的提交,是另一回事。

为什么我的教材 PDF 导进去是空的?

几乎肯定是没有文字层的扫描件。解析器会识别出来并报出这份文件,库里其他材料照常可用。