在本地回答制度与报销类问题

人事或财务可以把最多 40 份文件——员工手册、报销制度、供应商合同、导出为 CSV 的发票——放进一个浏览器本地的库,一起提问。什么都不上传。这一页讲支持哪些格式、哪些提问方式管用,以及一个本地工具回答不了的管控问题。

最后更新:

价值主要集中在三个反复出现的问题上:制度怎么规定的、适用哪一条合同条款、这张发票的价格和约定是否一致。前两个是检索问题,第三个要求数字以文字形式存在。

支持哪些格式,以及一个值得提前知道的缺口

PDF、DOCX、TXT、Markdown、CSV、HTML、JSON 都是直接支持。表格文件不会按 .xlsx 解析,报销流水要先用 CSV 导出——在多数办公套件里就是点一下,但常常被忽略,直到库建好之后发现最大的那个文件什么都没搜出来。

表 1 — 每种来源怎么变成可解析的形式
来源怎么导进去为什么要注意
员工手册 .docx直接导入标题层级会保留,第 4.2 节能挂住它的上级标题
报销制度 .pdf直接导入页码会带出来,引用能写成「第 3 页」
发票汇总 .xlsx每个工作表导出成 CSV表格不参与解析;CSV 保留行边界
在线维护的供应商台账下载为 CSV导出之后离线也能用
纯扫描的票据 PDF先做 OCR纯图片页抽不出任何文字
混在一起的审计底稿尽量合并成一个 PDF文件少一点,才不容易撞到 40 份上限

三种提问方式,各带例子

  1. 找制度——“打车 800 元要什么凭证?写在哪一节?”答案会连标题路径和页码一起给出。
  2. 找条款——“哪些供应商合同里有 30 天无理由解约条款?”两个词都是精确词元,关键词排序就能捞出来,答案会各自带上文件名并引用条款原文。
  3. 做核对——“这里哪些发票的单价高于合同约定?”需要把 CSV 和合同放在同一个库里。检索会把两边的数字都返回,减法由你来做。

两小时的审计准备,一步一步

01

把纸质对应物收进一个文件夹

员工手册、报销制度、这次要看的三个供应商合同,再加一个季度的发票导出成 CSV。十份文件,远不到 200MB。

02

导入,看着索引建起来

解析先做魔数嗅探(不看扩展名),再做格式相关的抽取,然后按约 700 字符、15% 重叠切块。进度面板会逐个点名文件,读不了的也会报出来。

03

用同事平时说的那句话提问

员工问的是「晚上 9 点以后打车回家能报吗」,制度里写的是「深夜交通费」。两种问法都试一遍:混合检索就是为这种用词错位准备的。

04

挑两条答案回原文核对

点开每个引用,确认条款号和制度版本日期。系统不会替你检查导入的是不是最新版。

05

表格单独处理

导出 CSV 再导入,并确认分隔符识别正确;分隔符认错时,六列的文件会变成一列噪声。

06

留下结果,而不是索引

把问答记录连引用导出成 Markdown 放进底稿。索引本身是一次性的,清除站点数据就没了;导出件还在。

本地工具解决不了的事

  • 数据分类。哪些类别的员工数据可以被处理,是制度层面的决定,不因为计算发生在哪里而改变。
  • 权限控制。这里没有账号,也没有权限层:谁拿到没锁的设备和那个浏览器配置,谁就能打开这个库。
  • 设备丢失。清除站点数据会删掉索引,这对处置是好事,但如果你的笔记只存在那里,就是坏事。
  • 共用电脑。共用浏览器配置里的库,下一个打开的人就能读。用独立的系统账号,或者用完清除站点数据。
  • 留存规则。这里什么都不记录,也就没有「某次核查做过」的自动凭证。记录要自己留。
这一页不是什么: 它讲的是一个文档工具怎么用,不是人事、税务、会计或法律意见;使用 SecureRAG 本身也不会让某个流程符合任何法规。这件事该由你们机构里负责的人来定。

这个方案不适合你的时候

  • 你需要一个集中的、带权限的文档库和审计日志。那是另一类系统,这里的缺席是有意的。
  • 文件超过 40 份或 200MB。整个发票归档装不下:按季度拆开,或者用账务系统自带的检索。
  • 工作核心就是扫描票,而流程里没有 OCR 环节。
  • 两个人必须同时用一个实时索引。
  • 需要自动把数字抽出来并加总。检索返回的是段落,加总由你来做;语言模型给出的错误合计比没有合计更麻烦。
  • 答案会被当作控制测试的证据归档,而没有人去读被引的原文。

自己核对这条隐私说法

  1. 打开工具页,旁边开着开发者工具的 Network 面板,先清空日志。
  2. 添加一份制度 PDF。解析、分块、建索引,全程没有任何请求。
  3. 在默认抽取档里问三个问题。依然没有请求。
  4. 只有你主动开启生成档时,才会出现一次模型下载——400MB 到 1.0GB,前面有确认弹窗——之后把 DevTools 切到 Offline,继续提问。
  5. 清除站点数据,确认库已空。
能直接读我们的报销表格吗?

不能按 .xlsx 读。把工作表导出成 CSV 再导入:解析器支持 CSV 和 JSON,而 CSV 保留的行边界,正是「把 500 元以上的金额加起来」这类问题能用得上的前提。

索引存在哪里?谁能读到?

存在你使用的那个浏览器配置的 IndexedDB 里。拿到这台设备和这个配置的人都能打开,所以在共用电脑上要用独立的系统账号,或者用完清除站点数据。

用了这个就算符合 GDPR 或个人信息保护法了吗?

任何工具都不能让流程「符合」。把处理放在本地改变的是数据流向哪里;合法性基础、留存期限、访问权限这些判断仍然在你这边。

能放多少份文件?

单库 40 份文件、单份 ≤25MB、总量 ≤200MB、≤20,000 个块。制度类文件很宽松;发票归档需要按季度拆。

两位同事能查同一个库吗?

不能。索引按浏览器配置存放,背后没有服务器。要么共享带引用的问答导出件,要么各自导入同一批文件。