在本地回答制度与报销类问题
人事或财务可以把最多 40 份文件——员工手册、报销制度、供应商合同、导出为 CSV 的发票——放进一个浏览器本地的库,一起提问。什么都不上传。这一页讲支持哪些格式、哪些提问方式管用,以及一个本地工具回答不了的管控问题。
最后更新:
价值主要集中在三个反复出现的问题上:制度怎么规定的、适用哪一条合同条款、这张发票的价格和约定是否一致。前两个是检索问题,第三个要求数字以文字形式存在。
支持哪些格式,以及一个值得提前知道的缺口
PDF、DOCX、TXT、Markdown、CSV、HTML、JSON 都是直接支持。表格文件不会按 .xlsx 解析,报销流水要先用 CSV 导出——在多数办公套件里就是点一下,但常常被忽略,直到库建好之后发现最大的那个文件什么都没搜出来。
| 来源 | 怎么导进去 | 为什么要注意 |
|---|---|---|
| 员工手册 .docx | 直接导入 | 标题层级会保留,第 4.2 节能挂住它的上级标题 |
| 报销制度 .pdf | 直接导入 | 页码会带出来,引用能写成「第 3 页」 |
| 发票汇总 .xlsx | 每个工作表导出成 CSV | 表格不参与解析;CSV 保留行边界 |
| 在线维护的供应商台账 | 下载为 CSV | 导出之后离线也能用 |
| 纯扫描的票据 PDF | 先做 OCR | 纯图片页抽不出任何文字 |
| 混在一起的审计底稿 | 尽量合并成一个 PDF | 文件少一点,才不容易撞到 40 份上限 |
三种提问方式,各带例子
- 找制度——“打车 800 元要什么凭证?写在哪一节?”答案会连标题路径和页码一起给出。
- 找条款——“哪些供应商合同里有 30 天无理由解约条款?”两个词都是精确词元,关键词排序就能捞出来,答案会各自带上文件名并引用条款原文。
- 做核对——“这里哪些发票的单价高于合同约定?”需要把 CSV 和合同放在同一个库里。检索会把两边的数字都返回,减法由你来做。
两小时的审计准备,一步一步
把纸质对应物收进一个文件夹
员工手册、报销制度、这次要看的三个供应商合同,再加一个季度的发票导出成 CSV。十份文件,远不到 200MB。
导入,看着索引建起来
解析先做魔数嗅探(不看扩展名),再做格式相关的抽取,然后按约 700 字符、15% 重叠切块。进度面板会逐个点名文件,读不了的也会报出来。
用同事平时说的那句话提问
员工问的是「晚上 9 点以后打车回家能报吗」,制度里写的是「深夜交通费」。两种问法都试一遍:混合检索就是为这种用词错位准备的。
挑两条答案回原文核对
点开每个引用,确认条款号和制度版本日期。系统不会替你检查导入的是不是最新版。
表格单独处理
导出 CSV 再导入,并确认分隔符识别正确;分隔符认错时,六列的文件会变成一列噪声。
留下结果,而不是索引
把问答记录连引用导出成 Markdown 放进底稿。索引本身是一次性的,清除站点数据就没了;导出件还在。
本地工具解决不了的事
- 数据分类。哪些类别的员工数据可以被处理,是制度层面的决定,不因为计算发生在哪里而改变。
- 权限控制。这里没有账号,也没有权限层:谁拿到没锁的设备和那个浏览器配置,谁就能打开这个库。
- 设备丢失。清除站点数据会删掉索引,这对处置是好事,但如果你的笔记只存在那里,就是坏事。
- 共用电脑。共用浏览器配置里的库,下一个打开的人就能读。用独立的系统账号,或者用完清除站点数据。
- 留存规则。这里什么都不记录,也就没有「某次核查做过」的自动凭证。记录要自己留。
这个方案不适合你的时候
- 你需要一个集中的、带权限的文档库和审计日志。那是另一类系统,这里的缺席是有意的。
- 文件超过 40 份或 200MB。整个发票归档装不下:按季度拆开,或者用账务系统自带的检索。
- 工作核心就是扫描票,而流程里没有 OCR 环节。
- 两个人必须同时用一个实时索引。
- 需要自动把数字抽出来并加总。检索返回的是段落,加总由你来做;语言模型给出的错误合计比没有合计更麻烦。
- 答案会被当作控制测试的证据归档,而没有人去读被引的原文。
自己核对这条隐私说法
- 打开工具页,旁边开着开发者工具的 Network 面板,先清空日志。
- 添加一份制度 PDF。解析、分块、建索引,全程没有任何请求。
- 在默认抽取档里问三个问题。依然没有请求。
- 只有你主动开启生成档时,才会出现一次模型下载——400MB 到 1.0GB,前面有确认弹窗——之后把 DevTools 切到 Offline,继续提问。
- 清除站点数据,确认库已空。
能直接读我们的报销表格吗?
不能按 .xlsx 读。把工作表导出成 CSV 再导入:解析器支持 CSV 和 JSON,而 CSV 保留的行边界,正是「把 500 元以上的金额加起来」这类问题能用得上的前提。
索引存在哪里?谁能读到?
存在你使用的那个浏览器配置的 IndexedDB 里。拿到这台设备和这个配置的人都能打开,所以在共用电脑上要用独立的系统账号,或者用完清除站点数据。
用了这个就算符合 GDPR 或个人信息保护法了吗?
任何工具都不能让流程「符合」。把处理放在本地改变的是数据流向哪里;合法性基础、留存期限、访问权限这些判断仍然在你这边。
能放多少份文件?
单库 40 份文件、单份 ≤25MB、总量 ≤200MB、≤20,000 个块。制度类文件很宽松;发票归档需要按季度拆。
两位同事能查同一个库吗?
不能。索引按浏览器配置存放,背后没有服务器。要么共享带引用的问答导出件,要么各自导入同一批文件。