LoRA 微调案例

qz sft --model Qwen/Qwen3-0.6B --tuner_type lora --dataset 'AI-ModelScope/alpaca-gpt4-data-zh#500' 'AI-ModelScope/alpaca-gpt4-data-en#500' 'swift/self-cognition#500' --torch_dtype float16 --num_train_epochs 1 --per_device_train_batch_size 1 --per_device_eval_batch_size 1 --learning_rate 1e-4 --lora_rank 8 --lora_alpha 32 --target_modules all-linear --gradient_accumulation_steps 16 --eval_steps 50 --save_steps 50 --save_total_limit 2 --logging_steps 5 --max_length 2048 --output_dir output --system 'You are a helpful assistant.' --warmup_ratio 0.05 --dataloader_num_workers 4 --dataset_num_proc 4 --model_name 芯辰大模型 'LLM Team model' --model_author '芯辰智能' 'XinChen intelligent.'
这是一个基于大模型训推平台的 LoRA 微调命令,用于对 Qwen3-0.6B 模型进行监督微调(SFT)。以下是各参数的详细说明:


🔧 基础配置

参数 说明
--model Qwen/Qwen3-0.6B 指定基础模型为 Qwen3-0.6B(HuggingFace 模型 ID)
--tuner_type lora 微调方法为 LoRA(低秩适配)
--torch_dtype float16 使用 FP16 半精度训练,节省显存
--output_dir output 训练结果(模型、日志等)的输出目录

📚 数据集配置

参数 说明
--dataset 'AI-ModelScope/alpaca-gpt4-data-zh#500' 中文 Alpaca 数据集,取 500 条
--dataset 'AI-ModelScope/alpaca-gpt4-data-en#500' 英文 Alpaca 数据集,取 500 条
--dataset 'swift/self-cognition#500' 模型自我认知数据集,取 500 条

三个数据集会自动合并,共 1500 条训练样本。


LoRA 配置

参数 说明
--lora_rank 8 LoRA 低秩矩阵的秩,控制参数量
--lora_alpha 32 LoRA 缩放因子,通常设为 rank 的 2~4 倍
--target_modules all-linear 对模型中所有线性层注入 LoRA 适配器

⚙️ 训练超参数

参数 说明
--num_train_epochs 1 训练 1 个 epoch
--per_device_train_batch_size 1 单设备训练 batch size = 1
--per_device_eval_batch_size 1 评估 batch size = 1
--gradient_accumulation_steps 16 梯度累积步数,等效 batch size = 16
--learning_rate 1e-4 学习率 0.0001
--warmup_ratio 0.05 前 5% 的步数用于学习率预热
--max_length 2048 单条样本最大 token 长度

💾 保存与评估策略

参数 说明
--eval_steps 50 每 50 步进行一次评估
--save_steps 50 每 50 步保存一次 checkpoint
--save_total_limit 2 最多保留 2 个 checkpoint,旧的自动删除
--logging_steps 5 每 5 步记录一次日志

🏗️ 数据加载与系统配置

参数 说明
--dataloader_num_workers 4 数据加载进程数
--dataset_num_proc 4 数据集预处理进程数
--system 'You are a helpful assistant.' 系统提示词(System Prompt)

📝 模型元信息

参数 说明
--model_name 芯辰大模型 'LLM Team model' 模型名称(中文 + 英文)
--model_author '芯辰智能' 'XinChen intelligent.' 模型作者/机构

📊 总结

这个命令的完整含义是:

使用 LoRA 方法对 Qwen3-0.6B 进行 1 轮 SFT 微调,训练数据包含 1500 条样本(中英文 Alpaca + 自我认知),采用 FP16 精度,通过 梯度累积 16 步 等效 batch size 为 16,学习率 1e-4,并在训练过程中每 50 步评估和保存一次。

这是一个非常典型的轻量级 LoRA 微调配置,适合在有限算力下快速验证模型效果或进行小规模定制训练。

最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

友情链接更多精彩内容