ChatGPT 在 OpenAI 的服务器上读你上传的文件。这篇讲这意味着什么。

把一份 PDF 上传给 ChatGPT,它会在 OpenAI 的基础设施上被解析、切分、检索,答案由前沿模型写成。SecureRAG 把解析、切分、检索放在浏览器标签页里完成,用你自己的检索结果作答,文件不离开设备。值得比的不只是能力——纯能力 ChatGPT 完胜——而是这份文档之后会怎样、由哪个开关决定,以及哪些活只有云端模型干得了。

最后更新:

一句话结论:上传的文件在 OpenAI 服务器上解析,消费级套餐默认会用于改进模型,除非你主动关掉;SecureRAG 把这一切留在本地。

ChatGPT 更强的地方

  • 拿到文件之后它能做的事更多:改写、翻译、整理成表格、生成读取该文件的代码、把数字画成图,然后接着往下做。
  • 文件上传在免费与付费套餐上都能用,网页版和受支持的手机应用都有,各自有用量限制——不用下载、不拉模型。
  • ChatGPT 企业版有 PDF 视觉检索,能读取 PDF 的版式与图表;其他套餐只抽取文字层,图像会被丢弃。SecureRAG 也只读文字:扫描件或图多的 PDF 里的印章、签名、图表都读不到。
  • 同一个对话里可以把文件与联网搜索、代码执行和模型自身知识结合起来用。本地检索工具刻意只做检索这一件事。
  • 前沿模型的文笔与长上下文处理能力,0.5B–1.5B 量化模型比不了。

决定你文档去向的那个开关

OpenAI 帮助中心写明:ChatGPT 会进一步在用户的对话上训练,除非你选择退出;退出入口在「设置 → 数据控制 → 为所有人改进模型」(隐私门户里对应「不要用我的内容进行训练」)。内容可以包括你上传的文件。同一份帮助文档也写明:面向企业的产品(API、ChatGPT Business、Enterprise)默认不使用客户提交的内容改进模型性能。同一个问题有三个不同答案,适用哪一个取决于你用的是消费级 ChatGPT、API,还是企业工作区。请读你所用的那份政策原文,而不是任何二手概述,包括这一页。

表 1 — 上传路线与本地路线
问题ChatGPT 文件上传SecureRAG
文件在哪里被解析OpenAI 的服务器你的浏览器标签页
账号需要 OpenAI 账号不需要——无账号、无追踪像素
是否用于训练消费级套餐默认会用于训练,除非主动退出;企业产品默认不训练不用于训练——不存在可以被训练的服务器
离线不能缓存后可离线
引用指向什么回答里摘录原文片段;上传的 PDF 没有页码锚点每句话一个编号引用指回具体文本块,PDF 保留页码、DOCX 保留标题层级
回答引擎云端前沿模型默认抽取式选句;可选 Qwen2.5 0.5B–1.5B 4-bit,400MB–1.0GB,CPU 上约 3–8 token/s
上限按套餐限定文件大小与 token 数;以 OpenAI 帮助中心为准单文件 ≤25MB、≤40 份、单库 ≤200MB、≤20,000 个文本块
支持格式常见文档、表格、演示与文本格式;以帮助中心为准PDF、DOCX、TXT、Markdown、CSV、HTML、JSON。不支持加密 PDF、无文字层扫描件、旧版 .doc

引用是从哪儿来的

ChatGPT 会在回答里摘录文件原文,读个大概通常够用。它不是一套引用机制:没有指回第 14 页的逐句锚点,而一段通顺的文字可以把原文摘录和模型自己的改写揉在一起。SecureRAG 把这两件事分开。默认抽取档从检索到的文本块里挑句子,按原文顺序排列,每句挂一个编号链接,改写不会被当成原文引用。生成档会写句子,但引用是在文本到达你眼前之前就挂好的——我们不会让模型自己产出引用,因为模型会编造引用。

SecureRAG 输给 ChatGPT 上传文件的地方

  • 它不会写作。0.5B–1.5B 量化模型写出的句子简短、字面,放在前沿模型旁边差距明显;开启这一档要下载 400MB–1.0GB,在没有 WebGPU 的机器上大约 3–8 token/s。
  • 不理解图像。图表、手写批注、印章都读不到。一份以图片为主的 PDF,抽出来的东西也基本为零。
  • 不能执行代码、不能联网、没有插件。索引里有什么,系统就知道什么。
  • 上限更紧:单文件 25MB、40 份、单库 200MB、20,000 个文本块;移动浏览器内存更紧张,上限还会调低。
  • 没有跨设备的会话记忆。索引留在 IndexedDB 里,对话不会跟着你去另一台设备。
  • 首次使用更慢。解析一份 20MB 的 PDF、把 900 个文本块向量化,在笔记本上要实打实等上几秒;托管服务则是在别人的机器上转圈。

用你手边已有的文档做五分钟测试

  1. 挑一份你熟悉的合同或报告,大小在 10–25MB 之间以便落在 25MB 上限内,并记住一个你能背出来的条款号。
  2. 在两边问同一个问题:「哪一条规定了提前终止,要求多长通知期?」
  3. 看答案凭什么成立。ChatGPT 会在回答里摘一段原文;SecureRAG 是每句话都挂编号引用,点开是具体文本块并显示页码。
  4. 再问一个文档里答不出的问题。本地把严格度设为「仅依据文档」,确认返回的是「文档中未找到」,而不是一个推断出来的条款号。
  5. 两边都打开开发者工具的 Network 面板。一个是携带文件的多部分 POST;另一个只有一次下载模型权重的 GET,之后什么都没有。
数据政策按产品和套餐而异。 消费级 ChatGPT、API、ChatGPT Business 与 Enterprise 的数据使用默认值各不相同,而且会变。权威说法在 OpenAI 自己那里:它所服务产品的数据控制帮助页与隐私政策。本文写于 2026 年 9 月。
一个务实的中间路线: 能随便分享的文本用 ChatGPT 起草,不能往外发的文件用 SecureRAG——没签的合同、体检报告、人事档案、客户还没公开的财务数据。两者不必抢同一个文件夹。
ChatGPT 会拿我上传的文件训练吗?

对消费级套餐,OpenAI 帮助中心写明:除非主动退出,它会进一步在用户的对话上训练,上传的内容也可能被包含在内。退出入口在「设置 → 数据控制 → 为所有人改进模型」,或走隐私门户。API、ChatGPT Enterprise 这类企业产品默认不用于训练。请以你所用的那档套餐对应的页面为准,答案随套餐变化。

SecureRAG 能回答需要跨文档推理的问题吗?

它可以一次在最多 40 份文件上检索并引用其中几份的段落,也能把这些段落按原文顺序拼接起来。它不会做的事情是编出一个这些段落并不支持的结论——「仅依据文档」模式下会直接回答「文档中未找到」。

为什么本地的回答更短?

因为它是用你文件里已有的句子拼起来的。抽取式回答没法像生成式那样把论述展开,而正是这个机制把编造出来的条款号挡在答案之外。

开启生成档就能得到 ChatGPT 级别的文笔吗?

不能。它得到的是一个 0.5B–1.5B 量化模型写出的通顺文字,比抽取式拼接好,但仍明显低于前沿模型。而且任何下载都必须由你先点确认才会开始,也随时可以关掉。