qz sft --model Qwen/Qwen3-0.6B --tuner_type lora --dataset 'AI-ModelScope/alpaca-gpt4-data-zh#500' 'AI-ModelScope/alpaca-gpt4-data-en#500' 'swift/self-cognition#500' --torch_dtype float16 --num_train_epochs 1 --per_device_train_batch_size 1 --per_device_eval_batch_size 1 --learning_rate 1e-4 --lora_rank 8 --lora_alpha 32 --target_modules all-linear --gradient_accumulation_steps 16 --eval_steps 50 --save_steps 50 --save_total_limit 2 --logging_steps 5 --max_length 2048 --output_dir output --system 'You are a helpful assistant.' --warmup_ratio 0.05 --dataloader_num_workers 4 --dataset_num_proc 4 --model_name 芯辰大模型 'LLM Team model' --model_author '芯辰智能' 'XinChen intelligent.'
这是一个基于大模型训推平台的 LoRA 微调命令,用于对 Qwen3-0.6B 模型进行监督微调(SFT)。以下是各参数的详细说明:
🔧 基础配置
| 参数 |
说明 |
--model Qwen/Qwen3-0.6B |
指定基础模型为 Qwen3-0.6B(HuggingFace 模型 ID) |
--tuner_type lora |
微调方法为 LoRA(低秩适配) |
--torch_dtype float16 |
使用 FP16 半精度训练,节省显存 |
--output_dir output |
训练结果(模型、日志等)的输出目录 |
📚 数据集配置
| 参数 |
说明 |
--dataset 'AI-ModelScope/alpaca-gpt4-data-zh#500' |
中文 Alpaca 数据集,取 500 条 |
--dataset 'AI-ModelScope/alpaca-gpt4-data-en#500' |
英文 Alpaca 数据集,取 500 条 |
--dataset 'swift/self-cognition#500' |
模型自我认知数据集,取 500 条 |
三个数据集会自动合并,共 1500 条训练样本。
LoRA 配置
| 参数 |
说明 |
--lora_rank 8 |
LoRA 低秩矩阵的秩,控制参数量 |
--lora_alpha 32 |
LoRA 缩放因子,通常设为 rank 的 2~4 倍 |
--target_modules all-linear |
对模型中所有线性层注入 LoRA 适配器 |
⚙️ 训练超参数
| 参数 |
说明 |
--num_train_epochs 1 |
训练 1 个 epoch |
--per_device_train_batch_size 1 |
单设备训练 batch size = 1 |
--per_device_eval_batch_size 1 |
评估 batch size = 1 |
--gradient_accumulation_steps 16 |
梯度累积步数,等效 batch size = 16 |
--learning_rate 1e-4 |
学习率 0.0001 |
--warmup_ratio 0.05 |
前 5% 的步数用于学习率预热 |
--max_length 2048 |
单条样本最大 token 长度 |
💾 保存与评估策略
| 参数 |
说明 |
--eval_steps 50 |
每 50 步进行一次评估 |
--save_steps 50 |
每 50 步保存一次 checkpoint |
--save_total_limit 2 |
最多保留 2 个 checkpoint,旧的自动删除 |
--logging_steps 5 |
每 5 步记录一次日志 |
🏗️ 数据加载与系统配置
| 参数 |
说明 |
--dataloader_num_workers 4 |
数据加载进程数 |
--dataset_num_proc 4 |
数据集预处理进程数 |
--system 'You are a helpful assistant.' |
系统提示词(System Prompt) |
📝 模型元信息
| 参数 |
说明 |
--model_name 芯辰大模型 'LLM Team model' |
模型名称(中文 + 英文) |
--model_author '芯辰智能' 'XinChen intelligent.' |
模型作者/机构 |
📊 总结
这个命令的完整含义是:
使用 LoRA 方法对 Qwen3-0.6B 进行 1 轮 SFT 微调,训练数据包含 1500 条样本(中英文 Alpaca + 自我认知),采用 FP16 精度,通过 梯度累积 16 步 等效 batch size 为 16,学习率 1e-4,并在训练过程中每 50 步评估和保存一次。
这是一个非常典型的轻量级 LoRA 微调配置,适合在有限算力下快速验证模型效果或进行小规模定制训练。
最后编辑于 :
©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。