<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>大模型微调 on 文艺技术笔记</title>
        <link>https://wenyiblog.top/tags/%E5%A4%A7%E6%A8%A1%E5%9E%8B%E5%BE%AE%E8%B0%83/</link>
        <description>Recent content in 大模型微调 on 文艺技术笔记</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <copyright>文艺技术笔记 | 软件工程师文艺</copyright>
        <lastBuildDate>Wed, 26 Aug 2026 14:30:00 +0800</lastBuildDate><atom:link href="https://wenyiblog.top/tags/%E5%A4%A7%E6%A8%A1%E5%9E%8B%E5%BE%AE%E8%B0%83/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>开源大模型在企业内部知识库问答场景的微调实战：从数据准备到效果评估全流程</title>
        <link>https://wenyiblog.top/2026/08/llm-finetune-enterprise-kb-qa/</link>
        <pubDate>Wed, 26 Aug 2026 14:30:00 +0800</pubDate>
        
        <guid>https://wenyiblog.top/2026/08/llm-finetune-enterprise-kb-qa/</guid>
        <description>&lt;h1 id=&#34;开源大模型在企业内部知识库问答场景的微调实战从数据准备到效果评估全流程&#34;&gt;&lt;a href=&#34;#%e5%bc%80%e6%ba%90%e5%a4%a7%e6%a8%a1%e5%9e%8b%e5%9c%a8%e4%bc%81%e4%b8%9a%e5%86%85%e9%83%a8%e7%9f%a5%e8%af%86%e5%ba%93%e9%97%ae%e7%ad%94%e5%9c%ba%e6%99%af%e7%9a%84%e5%be%ae%e8%b0%83%e5%ae%9e%e6%88%98%e4%bb%8e%e6%95%b0%e6%8d%ae%e5%87%86%e5%a4%87%e5%88%b0%e6%95%88%e6%9e%9c%e8%af%84%e4%bc%b0%e5%85%a8%e6%b5%81%e7%a8%8b&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;开源大模型在企业内部知识库问答场景的微调实战：从数据准备到效果评估全流程
&lt;/h1&gt;&lt;blockquote&gt;
&lt;p&gt;有句话说：RAG 解决的是&amp;quot;模型不知道&amp;quot;，微调解决的是&amp;quot;模型不会用&amp;quot;。企业知识库问答，这两件事缺一不可。&lt;/p&gt;
&lt;p&gt;本文不是理论综述，而是一份可以直接照着做的实战流程：从基座选型、LoRA 方案，到数据准备、训练配置、效果评估、上线迭代，一步步讲清楚开源大模型微调在企业知识库问答场景怎么落地。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id=&#34;一先想清楚rag-都上了为什么还要微调&#34;&gt;&lt;a href=&#34;#%e4%b8%80%e5%85%88%e6%83%b3%e6%b8%85%e6%a5%9arag-%e9%83%bd%e4%b8%8a%e4%ba%86%e4%b8%ba%e4%bb%80%e4%b9%88%e8%bf%98%e8%a6%81%e5%be%ae%e8%b0%83&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;一、先想清楚：RAG 都上了，为什么还要微调
&lt;/h2&gt;&lt;p&gt;很多团队在做企业知识库问答时，第一反应是上 RAG（检索增强生成）：把文档切片、向量化、建索引，用户提问时检索相关片段拼进 Prompt，让大模型基于检索结果回答。这套方案见效快，但用过一段时间就会发现它的天花板：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;风格不像自己人&lt;/strong&gt;：模型生成的回答措辞是&amp;quot;通用客服味&amp;quot;，跟企业内部的文档风格、术语习惯对不上；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;专业术语答不准&lt;/strong&gt;：企业内部特有的缩写、产品名、内部口径，模型不&amp;quot;懂行&amp;quot;，即使检索到了也可能表达得别扭；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;私有知识记不住&lt;/strong&gt;：很多企业知识是&amp;quot;约定俗成&amp;quot;的规则，散落在文档字里行间，单纯靠检索片段拼不出来；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;指令跟随不稳定&lt;/strong&gt;：要求按固定格式（比如先给结论再给依据、带编号分条）输出时，通用模型经常&amp;quot;不听话&amp;quot;。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;RAG 解决的是&amp;quot;模型不知道&amp;quot;（知识外挂），微调解决的是&amp;quot;模型不会用&amp;quot;（行为内化）。&lt;strong&gt;两者是互补关系，不是替代关系&lt;/strong&gt;：RAG 负责把对的知识片段喂进来，微调负责让模型用企业的语气、术语和格式把答案组织好。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;关键认知：企业知识库微调的目标不是让模型&amp;quot;记住所有文档&amp;quot;，而是让它&amp;quot;学会像企业专家那样思考和表达&amp;quot;。记忆交给 RAG，行为交给微调。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id=&#34;二方案选型基座模型与微调方式怎么定&#34;&gt;&lt;a href=&#34;#%e4%ba%8c%e6%96%b9%e6%a1%88%e9%80%89%e5%9e%8b%e5%9f%ba%e5%ba%a7%e6%a8%a1%e5%9e%8b%e4%b8%8e%e5%be%ae%e8%b0%83%e6%96%b9%e5%bc%8f%e6%80%8e%e4%b9%88%e5%ae%9a&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;二、方案选型：基座模型与微调方式怎么定
&lt;/h2&gt;&lt;h3 id=&#34;基座模型怎么选&#34;&gt;&lt;a href=&#34;#%e5%9f%ba%e5%ba%a7%e6%a8%a1%e5%9e%8b%e6%80%8e%e4%b9%88%e9%80%89&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;基座模型怎么选
&lt;/h3&gt;&lt;p&gt;开源模型选择，主要看三个维度：&lt;strong&gt;中文能力、上下文长度、部署成本&lt;/strong&gt;。&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th style=&#34;text-align: left&#34;&gt;维度&lt;/th&gt;
					&lt;th style=&#34;text-align: left&#34;&gt;考量点&lt;/th&gt;
					&lt;th style=&#34;text-align: left&#34;&gt;建议&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;中文能力&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;企业内部知识以中文为主，模型的中文理解与生成质量直接决定效果&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;优先选择中文语料占比高的开源模型&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;上下文长度&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;知识库问答常伴随长文档片段，上下文要够用&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;8K 起步，条件允许选 32K 以上的版本&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;部署成本&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;微调后要长期服务，显存和推理成本要算得过来&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;按团队 GPU 资源选择 7B~32B 量级，LoRA 适配&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;一个务实的建议：&lt;strong&gt;用同系列里&amp;quot;稍大一号&amp;quot;的模型做底座，性价比往往高于小模型硬调&lt;/strong&gt;。比如团队只有一张消费级显卡，可以用量化 + LoRA 跑 7B；如果有多卡或云 GPU，14B/32B 的微调收益会更明显。&lt;/p&gt;
&lt;h3 id=&#34;lora-还是全参数微调&#34;&gt;&lt;a href=&#34;#lora-%e8%bf%98%e6%98%af%e5%85%a8%e5%8f%82%e6%95%b0%e5%be%ae%e8%b0%83&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;LoRA 还是全参数微调
&lt;/h3&gt;&lt;p&gt;全参数微调（Full Fine-tuning）效果好，但需要完整显存、容易遗忘通用能力、成本高；&lt;strong&gt;LoRA（低秩适配）是当前企业落地的首选&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;只训练一小部分低秩适配参数，显存占用大幅下降，单卡也能跑；&lt;/li&gt;
&lt;li&gt;训练速度快，迭代周期短，适合频繁更新知识库的场景；&lt;/li&gt;
&lt;li&gt;微调后与基座是&amp;quot;插拔式&amp;quot;关系，可以同时挂多套 LoRA 服务不同业务域。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;具体到企业知识库场景，&lt;strong&gt;QLoRA（量化 + LoRA）&lt;/strong&gt; 是最常见的组合：把基座模型 4-bit 量化，再叠加 LoRA 训练，消费级显卡就能完成 7B~13B 的微调。训练完的 LoRA 权重单独保存，推理时合并或动态加载。&lt;/p&gt;
&lt;h2 id=&#34;三数据准备决定成败的关键环节&#34;&gt;&lt;a href=&#34;#%e4%b8%89%e6%95%b0%e6%8d%ae%e5%87%86%e5%a4%87%e5%86%b3%e5%ae%9a%e6%88%90%e8%b4%a5%e7%9a%84%e5%85%b3%e9%94%ae%e7%8e%af%e8%8a%82&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;三、数据准备：决定成败的关键环节
&lt;/h2&gt;&lt;p&gt;数据准备占微调工作量的 60% 以上，也是拉开效果差距的关键。这一步做得糙，后面的训练和评估都是白费。&lt;/p&gt;
&lt;h3 id=&#34;31-数据从哪来怎么清洗&#34;&gt;&lt;a href=&#34;#31-%e6%95%b0%e6%8d%ae%e4%bb%8e%e5%93%aa%e6%9d%a5%e6%80%8e%e4%b9%88%e6%b8%85%e6%b4%97&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;3.1 数据从哪来、怎么清洗
&lt;/h3&gt;&lt;p&gt;企业内部知识库的数据来源通常有四类：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th style=&#34;text-align: left&#34;&gt;来源&lt;/th&gt;
					&lt;th style=&#34;text-align: left&#34;&gt;典型形态&lt;/th&gt;
					&lt;th style=&#34;text-align: left&#34;&gt;处理方式&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;制度文档&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;流程规范、管理办法&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;解析为问答对，规则类知识优先&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;产品资料&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;产品手册、操作指南&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;抽取出&amp;quot;怎么做&amp;quot;的步骤型问答&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;历史工单&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;客服/技术支持问答记录&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;清洗后直接作为高质量种子数据&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;内部 FAQ&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;现成的问题答案&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;补充扩展问法，增强泛化&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;清洗是必须做的，脏数据会让训练效果断崖式下降。重点清三类：&lt;strong&gt;乱码与格式碎片&lt;/strong&gt;（PDF 解析残留）、&lt;strong&gt;敏感信息&lt;/strong&gt;（个人姓名、账号、内部机密按合规要求脱敏）、&lt;strong&gt;低质量问答&lt;/strong&gt;（答非所问、信息过时的）。&lt;/p&gt;
&lt;h3 id=&#34;32-数据格式sft-三件套&#34;&gt;&lt;a href=&#34;#32-%e6%95%b0%e6%8d%ae%e6%a0%bc%e5%bc%8fsft-%e4%b8%89%e4%bb%b6%e5%a5%97&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;3.2 数据格式：SFT 三件套
&lt;/h3&gt;&lt;p&gt;微调用的是监督微调（SFT），数据统一组织成 &lt;code&gt;instruction&lt;/code&gt;（指令）、&lt;code&gt;input&lt;/code&gt;（可选输入）、&lt;code&gt;output&lt;/code&gt;（标准答案）三段式。以企业知识库问答为例：&lt;/p&gt;
&lt;div class=&#34;highlight&#34;&gt;&lt;div class=&#34;chroma&#34;&gt;
&lt;table class=&#34;lntable&#34;&gt;&lt;tr&gt;&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code&gt;&lt;span class=&#34;lnt&#34;&gt;1
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;2
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;3
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;4
&lt;/span&gt;&lt;span class=&#34;lnt&#34;&gt;5
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;
&lt;td class=&#34;lntd&#34;&gt;
&lt;pre tabindex=&#34;0&#34; class=&#34;chroma&#34;&gt;&lt;code class=&#34;language-json&#34; data-lang=&#34;json&#34;&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;p&#34;&gt;{&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  &lt;span class=&#34;nt&#34;&gt;&amp;#34;instruction&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt; &lt;span class=&#34;s2&#34;&gt;&amp;#34;根据企业内部制度回答：年假需要提前几天申请？&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  &lt;span class=&#34;nt&#34;&gt;&amp;#34;input&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt; &lt;span class=&#34;s2&#34;&gt;&amp;#34;&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;,&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;  &lt;span class=&#34;nt&#34;&gt;&amp;#34;output&amp;#34;&lt;/span&gt;&lt;span class=&#34;p&#34;&gt;:&lt;/span&gt; &lt;span class=&#34;s2&#34;&gt;&amp;#34;根据《员工考勤管理制度》，年假申请需提前 5 个工作日提交，经直属主管审批通过后方可生效。&amp;#34;&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;span class=&#34;line&#34;&gt;&lt;span class=&#34;cl&#34;&gt;&lt;span class=&#34;p&#34;&gt;}&lt;/span&gt;
&lt;/span&gt;&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;&lt;/td&gt;&lt;/tr&gt;&lt;/table&gt;
&lt;/div&gt;
&lt;/div&gt;&lt;p&gt;&lt;strong&gt;input 字段可以承载 RAG 检索片段&lt;/strong&gt;：把检索到的文档片段放进去，模型学习&amp;quot;基于这段材料作答&amp;quot;——这正是微调与 RAG 结合的关键设计。训练时喂&amp;quot;片段 + 问题 → 标准答案&amp;quot;，模型就学会了在给定资料下组织符合企业风格的答案。&lt;/p&gt;
&lt;h3 id=&#34;33-指令配比多样性能救命&#34;&gt;&lt;a href=&#34;#33-%e6%8c%87%e4%bb%a4%e9%85%8d%e6%af%94%e5%a4%9a%e6%a0%b7%e6%80%a7%e8%83%bd%e6%95%91%e5%91%bd&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;3.3 指令配比：多样性能救命
&lt;/h3&gt;&lt;p&gt;数据集不能清一色是&amp;quot;标准问答&amp;quot;，那样模型会过拟合到固定句式。建议配比：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;标准问答 60%&lt;/strong&gt;：核心知识点的问答对；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;多轮对话 20%&lt;/strong&gt;：带上下文的追问场景，提升对话连贯性；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;改写指令 15%&lt;/strong&gt;：同一问题换 N 种问法（&amp;ldquo;怎么请年假&amp;rdquo;、&amp;ldquo;年假申请流程&amp;rdquo;、&amp;ldquo;休年假要办什么手续&amp;rdquo;），增强泛化；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;拒绝与兜底 5%&lt;/strong&gt;：模型回答不了时如何优雅地说&amp;quot;建议咨询相关部门&amp;quot;，避免硬编答案。&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id=&#34;34-数据质量控制与切分&#34;&gt;&lt;a href=&#34;#34-%e6%95%b0%e6%8d%ae%e8%b4%a8%e9%87%8f%e6%8e%a7%e5%88%b6%e4%b8%8e%e5%88%87%e5%88%86&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;3.4 数据质量控制与切分
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;去重&lt;/strong&gt;：相似问题去重，防止某一类知识被反复训练导致过拟合；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;人工抽检&lt;/strong&gt;：按比例人工审查答案质量，错误答案会教坏模型，这条红线不能省；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;划分数据集&lt;/strong&gt;：训练集 / 验证集 / 测试集按 8:1:1 划分，测试集要保证和训练集&lt;strong&gt;知识不重叠&lt;/strong&gt;，否则评估数据虚高。&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;关键认知：数据准备的最大误区是&amp;quot;量不够就硬凑&amp;quot;。宁可 500 条高质量、覆盖全的问答对，也不要 5000 条注水数据。质量 &amp;gt; 数量，是 SFT 的铁律。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id=&#34;四训练配置跑起来并不难调对才难&#34;&gt;&lt;a href=&#34;#%e5%9b%9b%e8%ae%ad%e7%bb%83%e9%85%8d%e7%bd%ae%e8%b7%91%e8%b5%b7%e6%9d%a5%e5%b9%b6%e4%b8%8d%e9%9a%be%e8%b0%83%e5%af%b9%e6%89%8d%e9%9a%be&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;四、训练配置：跑起来并不难，调对才难
&lt;/h2&gt;&lt;h3 id=&#34;41-lora-关键参数&#34;&gt;&lt;a href=&#34;#41-lora-%e5%85%b3%e9%94%ae%e5%8f%82%e6%95%b0&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;4.1 LoRA 关键参数
&lt;/h3&gt;&lt;p&gt;以 QLoRA 训练 7B 模型为例，一组经实践证明靠谱的起步参数：&lt;/p&gt;
&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th style=&#34;text-align: left&#34;&gt;参数&lt;/th&gt;
					&lt;th style=&#34;text-align: left&#34;&gt;建议值&lt;/th&gt;
					&lt;th style=&#34;text-align: left&#34;&gt;说明&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;量化位数&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;4-bit（NF4）&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;显存占用大降&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;lora_r&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;16~32&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;秩越大适配能力越强，但过大会过拟合&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;lora_alpha&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;32&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;通常取 lora_r 的 1~2 倍&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;学习率&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;2e-4~5e-5&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;比全参微调高，LoRA 参数量小&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;batch_size&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;依显存而定&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;显存不足优先减小长度而非 batch&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;训练轮数&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;2~4&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;知识库场景 2~3 轮通常足够，多轮易遗忘通用能力&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;max_seq_len&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;2048~4096&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;覆盖检索片段 + 问题的长度&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id=&#34;42-训练过程中的三个监控点&#34;&gt;&lt;a href=&#34;#42-%e8%ae%ad%e7%bb%83%e8%bf%87%e7%a8%8b%e4%b8%ad%e7%9a%84%e4%b8%89%e4%b8%aa%e7%9b%91%e6%8e%a7%e7%82%b9&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;4.2 训练过程中的三个监控点
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Loss 曲线&lt;/strong&gt;：训练 loss 下降、验证 loss 平稳即可；验证 loss 上升说明过拟合，应提前停止；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;通用能力抽查&lt;/strong&gt;：用基座模型的经典能力测试（如常识问答、代码）抽查微调后模型，若明显退化说明学习率过高或轮数过多；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;样本外测试&lt;/strong&gt;：用训练集中没见过的问法提问，看模型是否学会泛化，而不是背答案。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;训练完成后，保存 LoRA 权重，与基座模型一起打包用于推理。建议&lt;strong&gt;把训练配置、数据版本、效果记录一并归档&lt;/strong&gt;，方便后续复现和迭代——企业微调是持续工程，不是一次性活。&lt;/p&gt;
&lt;h2 id=&#34;五效果评估离线打分--在线验证双轨并行&#34;&gt;&lt;a href=&#34;#%e4%ba%94%e6%95%88%e6%9e%9c%e8%af%84%e4%bc%b0%e7%a6%bb%e7%ba%bf%e6%89%93%e5%88%86--%e5%9c%a8%e7%ba%bf%e9%aa%8c%e8%af%81%e5%8f%8c%e8%bd%a8%e5%b9%b6%e8%a1%8c&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;五、效果评估：离线打分 + 在线验证双轨并行
&lt;/h2&gt;&lt;p&gt;微调效果好不好，不能靠&amp;quot;感觉变聪明了&amp;quot;，要建立可量化的评估体系。&lt;/p&gt;
&lt;h3 id=&#34;51-离线评估三类手段&#34;&gt;&lt;a href=&#34;#51-%e7%a6%bb%e7%ba%bf%e8%af%84%e4%bc%b0%e4%b8%89%e7%b1%bb%e6%89%8b%e6%ae%b5&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;5.1 离线评估：三类手段
&lt;/h3&gt;&lt;table&gt;
	&lt;thead&gt;
			&lt;tr&gt;
					&lt;th style=&#34;text-align: left&#34;&gt;手段&lt;/th&gt;
					&lt;th style=&#34;text-align: left&#34;&gt;做法&lt;/th&gt;
					&lt;th style=&#34;text-align: left&#34;&gt;适用&lt;/th&gt;
			&lt;/tr&gt;
	&lt;/thead&gt;
	&lt;tbody&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;规则指标&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;对答案做 BLEU/ROUGE 相似度计算，与标准答案比对&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;答案较固定的事实型问题&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;LLM-as-Judge&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;用更强的模型按维度（准确性、完整性、风格符合度）给答案打分&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;开放型、需要主观判断的问题&lt;/td&gt;
			&lt;/tr&gt;
			&lt;tr&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;人工评估&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;业务专家按 1~5 分对抽样的回答打分&lt;/td&gt;
					&lt;td style=&#34;text-align: left&#34;&gt;最终验收，不可替代&lt;/td&gt;
			&lt;/tr&gt;
	&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;strong&gt;建议评估维度&lt;/strong&gt;：准确性（答案对不对）、完整性（要点齐不齐）、格式符合度（是否按要求结构输出）、术语规范性（企业术语用得对不对）。&lt;/p&gt;
&lt;h3 id=&#34;52-关键对比微调前-vs-微调后&#34;&gt;&lt;a href=&#34;#52-%e5%85%b3%e9%94%ae%e5%af%b9%e6%af%94%e5%be%ae%e8%b0%83%e5%89%8d-vs-%e5%be%ae%e8%b0%83%e5%90%8e&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;5.2 关键对比：微调前 vs 微调后
&lt;/h3&gt;&lt;p&gt;评估必须回答一个问题：&lt;strong&gt;微调到底带来了什么增益&lt;/strong&gt;？设计三组对照：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;纯 RAG（不微调）——基线；&lt;/li&gt;
&lt;li&gt;RAG + 微调——完整方案；&lt;/li&gt;
&lt;li&gt;纯微调（不接 RAG）——验证知识外挂的必要性。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;只有对照跑下来，才能量化&amp;quot;微调提升了多少准确率、多少格式合规率&amp;quot;，也才能向管理层证明投入的价值。&lt;/p&gt;
&lt;h3 id=&#34;53-在线评估与持续迭代&#34;&gt;&lt;a href=&#34;#53-%e5%9c%a8%e7%ba%bf%e8%af%84%e4%bc%b0%e4%b8%8e%e6%8c%81%e7%bb%ad%e8%bf%ad%e4%bb%a3&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;5.3 在线评估与持续迭代
&lt;/h3&gt;&lt;p&gt;离线通过不代表上线成功。上线后要持续采集&lt;strong&gt;真实用户问题与满意度反馈&lt;/strong&gt;，重点看三件事：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;用户不满意的问题&lt;/strong&gt;：定期聚拢，分析是知识缺失（补 RAG 语料）还是表达问题（补微调样本）；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;高频问题覆盖&lt;/strong&gt;：真实高频问题在知识库里有没有、答得好不好；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;回归测试&lt;/strong&gt;：把历史问题集做成回归集，每次微调迭代都跑一遍，防止&amp;quot;修一个坏三个&amp;quot;。&lt;/li&gt;
&lt;/ul&gt;
&lt;blockquote&gt;
&lt;p&gt;关键认知：微调是一个闭环，不是一锤子买卖。上线只是开始，数据回流、持续迭代才是常态。把它当产品运营来做，效果会越来越好。&lt;/p&gt;
&lt;/blockquote&gt;
&lt;h2 id=&#34;六避坑清单&#34;&gt;&lt;a href=&#34;#%e5%85%ad%e9%81%bf%e5%9d%91%e6%b8%85%e5%8d%95&#34; class=&#34;header-anchor&#34;&gt;&lt;/a&gt;六、避坑清单
&lt;/h2&gt;&lt;p&gt;最后是实战中最容易踩的坑，写下来供对照：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;坑一：数据不脱敏就训练&lt;/strong&gt;。企业内部数据常含敏感信息，必须清洗脱敏后再入库，否则模型可能&amp;quot;背&amp;quot;出来。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;坑二：过度训练导致通用能力遗忘&lt;/strong&gt;。知识库问答微调样本量通常不大，2~3 轮即可，别贪多。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;坑三：拿测试集当验证集反复调参&lt;/strong&gt;。测试集只能最后用一次，反复看测试集调参等于&amp;quot;押题&amp;quot;，评估结果会虚高。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;坑四：只评估准确率，不看格式和风格&lt;/strong&gt;。企业场景里&amp;quot;答得对但不像自己人&amp;quot;同样是失败，格式符合度必须纳入评估。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;坑五：微调和 RAG 割裂&lt;/strong&gt;。微调时不考虑 RAG 片段、上线时只挂 RAG 不挂微调，两套体系各玩各的，效果打折。两者必须一起设计、一起上线。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;开源大模型在企业知识库问答的微调，难不在技术，而在工程化——数据、训练、评估、迭代每一环都要做扎实。把这套流程跑通，模型才能真正成为&amp;quot;懂这家企业的人&amp;quot;。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
