博客
关于本地 AI 的实测记录
这里的文章不推销产品,只记录我们在浏览器里跑 RAG 时量到的数字、踩到的限制,以及那些"看起来能行其实不行"的做法。
不上传前提下的文档合规
把数据不离开设备当作技术事实陈述,而不是合规承诺。讨论适用与不适用的场景、仍然存在的残余风险,并给出一份内部评估可以直接照问的问题清单。
浏览器里跑大模型的硬限制
内存天花板、静态托管下没有 SharedArrayBuffer 所以只能单线程 WASM、WebGPU 支持参差不齐,以及 3–8 token/s 对 0.5B 模型意味着什么。
分块如何决定回答质量
固定长度切分为什么会把定义和例外条款拆开、结构感知分块与 15% 重叠各自解决什么、表格为什么要整块保留,以及召回成功但答案仍然出错的典型情形。
向量检索到底在算什么
用大白话讲余弦相似度、L2 归一化和点积,解释向量检索为什么栽在合同编号上,BM25 怎么补上,RRF 如何合并两份排名,以及阈值为什么不能省。
本地嵌入模型怎么选
25MB 中文优先、23MB 英文优先、120MB 中英混排,三档怎么取舍。附维度与体积的关系、量化带来的精度代价,以及换模型为什么必须重建索引。
为什么不该把文档上传到云端
上传一份文件,等于在别人的磁盘上留下副本。本文拆解文件上传之后经过哪些存储、为什么删除不等于撤回,并给出一套十分钟就能自己动手的验证方法。