知识蒸馏通过小模型模仿大模型的概率分布吸收暗知识,实现降本增效;文档切割利用加载器读取多格式文件并用分块器切分成语义块,是RAG应用的基础。两者分别为模型训练与数据应用的关键技术。
2025年,AI领域发生了一件大事。

长期稳定更新的攒劲资源: >>>点此立即查看<<<
DeepSeek 仅花费600万美元的训练成本,便打造出一个能与 OpenAI 相抗衡的模型。这一消息引发业界震动。随后,OpenAI 公开指责 DeepSeek 使用了名为“蒸馏”(Distillation)的技术,相当于走了捷径。
这项指控看似严厉,但“蒸馏”究竟指什么?
与此同时,在开发 AI 应用(尤其是 RAG 知识库)时,开发者经常需要处理各类 Word、PDF 和网页文件。如何将这些格式各异的源文件有效输入给 AI? 这涉及另一项关键技术——文档切割(Document Chunking)。
本文将一次性讲解模型训练中的知识蒸馏与应用开发中的文档切割,力求通俗易懂。
“蒸馏”一词,在初中化学中已有涉及。
例如酿造白酒,利用不同成分沸点差异,加热使酒精先汽化,再冷凝收集。其核心可概括为四个字:取其精华。
大模型中的知识蒸馏,思路与此类似,只是对象从“酒精”换成了“知识”。其目标是将一个大模型(教师模型)中的精华知识“提纯”,并注入一个小模型(学生模型)中。
简而言之,就是让小模型从大模型那里“偷师”学艺。
试想,若要快速教会一名学徒,最直接的方式是什么?
常见的做法是:直接给出答案。
例如,将一张猫的图片展示给大模型(教师),大模型输出“这是猫”。随后,我们将“猫”这个标准答案告诉小模型(学生),让其记住。在AI领域,这种标准答案被称为硬标签(Hard Label)。
这就好比给新厨师一本菜谱,写着“盐3克,糖5克”。
新手照做,确实能做出菜,但无法理解为何放3克盐而非5克。他们学到的只是步骤,而非精髓。
真正的知识蒸馏,并非如此简单粗暴。它不关心大模型给出了“什么答案”,而是关注大模型是“如何得出这个答案的”。
大模型在回答问题时,并非只输出一个单一结果,而是为所有可能答案分配一个概率。
例如,给大模型展示一张图片,它可能输出:
这组概率分布,就是软标签(Soft Label)。
可见,软标签包含的信息量远超单纯的硬标签(猫)。软标签告诉小模型:猫和狗虽有差异,但存在相似特征;猫与老虎更为接近。这种大模型从海量数据中领悟到的“类比关系”,便是所谓的暗知识。
三大优势:
三大局限(需清醒认识):
聊完模型训练,再将视线转向日常开发。
当前最热门的应用是什么?RAG(检索增强生成),即构建知识库问答系统。但知识库中的知识从何而来?如何输入给AI?这就涉及文档切割。
知识的来源多种多样:可能是本地Word文档、PDF文件,也可能是B站视频字幕、某个网页URL,甚至是一条可靠的Twitter。
这些格式各异的文件,如何统一转换为向量数据库可存储的格式?
在 Langchain 中,第一步是通过 Loader(加载器)。其输入为原始文件,输出为标准 Document 对象(包含 pageContent 内容和 metadata 元数据)。
Langchain 社区提供了 180 多种加载器,基本覆盖了所有常见格式。
下面是一段真实代码示例,演示如何将掘金上的一篇文章存入知识库:
ja vascript
复制代码import "dotenv/config";
import { CheerioWebBaseLoader } from "@langchain/community/document_loaders/web/cheerio";// 访问网址并提取文档内容
// cheerio 可以传递 css 选择器来精准定位,把网页里无关的侧边栏、广告统统过滤掉
const cheerioLoader = new CheerioWebBaseLoader(
"https://juejin.cn/post/7660707431753678854",
{
selector: '.main-area p' // 只抓取文章的主体段落
}
);// 加载!输出是一组 Documents
const documents = await cheerioLoader.load();
console.log(documents);
文件加载完成后,是否可以直接向量化存入数据库?
千万不可!
一个PDF可能长达几十页,一篇文章可能数千字。若将整篇文章作为一个向量进行检索,无异于大海捞针。用户的提问通常只针对其中一小段,若将整个大文件直接存入,检索出的内容噪音极大,AI难以找到精确答案。
因此,必须进行切割。这就是 Splitter(分块器) 的任务。
需要将长文档切割成一个个具有语义、大小适中的 Chunk(块)。这样,当用户提问时,向量数据库就能精准地捞出最相关的一小块内容,输入给大模型。
切割的核心原则:
本文一次性讲解了两件事:
一个涉及“模型如何学聪明”,一个涉及“数据如何喂进去”。两者虽处于不同环节,但均是 AI 工程化落地不可或缺的“手术刀”。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述