资讯详情

SWIFT 大模型微调实战:10GB 显存 QLoRA 训 7B,单卡 3090 十分钟跑通 4B

📅 2026/9/11 4:46:20 | 华诺云谱 👁 阅读
SWIFT 大模型微调实战:10GB 显存 QLoRA 训 7B,单卡 3090 十分钟跑通 4B
SWIFT 大模型微调实战10GB 显存 QLoRA 训 7B单卡 3090 十分钟跑通 4B【免费下载链接】swiftUse PEFT or Full-parameter to CPT/SFT/DPO/GRPO 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) and 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).项目地址: https://gitcode.com/GitHub_Trending/swift1/swiftSWIFTms-swift是魔搭社区推出的大模型微调与部署框架支持 600 文本大模型与 400 多模态大模型的训练、推理、评测、量化与部署。它覆盖预训练、LoRA/QLoRA 微调、DPO/KTO 偏好对齐、GRPO 强化学习到 vLLM 部署的全链路官方 QLoRA 示例实测 7B 模型训练仅占 10GB 显存。能力全景微调方法与硬件门槛一览维度覆盖范围文本大模型600Qwen3、Qwen3.5、DeepSeek-R1、GLM4.5、InternLM3、Llama4 等多模态大模型400Qwen3-VL、Qwen3-Omni、InternVL3.5、Ovis2.5、GLM4.5V、MiniCPM-V 等微调方法全参数、LoRA、QLoRA、DoRA、LongLoRA、LISA 等 10 轻量方案训练任务预训练、SFT、DPO、KTO、RM、CPO、SimPO、ORPO、GKD、PPO、Embedding、Reranker、序列分类硬件A100/H100、RTX 系列、T4/V100、CPU/MPS、Ascend NPU推理与部署Transformers、vLLM、SGLang、LMDeploy 引擎AWQ/GPTQ/BNB/FP8 量化导出以上方法均支持文本、图像、视频、音频混合模态训练。训练侧集成 Megatron 的 TP/PP/CP/EP 并行MoE 模型提速显著显存侧提供 GaLore、Liger-Kernel、Flash-Attention 2/3 与 Ulysses/Ring 序列并行。不熟悉命令行时swift web-ui提供可视化训练界面最小体验路径安装 SWIFT 并完成第一次 LoRA 微调安装 SWIFT 框架一行命令安装pip install ms-swift -U源码方式则 clone 仓库后pip install -e .。运行环境要求 Python ≥3.10、PyTorch ≥2.0vLLM、DeepSpeed 等按需在 requirements/ 中加装。第一次微调单卡 3090 LoRA 训练 Qwen3-4B官方快速开始路径单卡 3090 约 10 分钟完成 Qwen3-4B 自我认知微调显存约 13GBswift sft \ --model Qwen/Qwen3-4B-Instruct-2507 \ --dataset AI-ModelScope/alpaca-gpt4-data-zh#500 \ --tuner_type lora \ --lora_rank 8 --lora_alpha 32 \ --learning_rate 1e-4 --num_train_epochs 1 --output_dir output--dataset ...#500取内置数据集前 500 条内置 150 数据集也可直接指定自定义 jsonl 路径--lora_rank 8 --lora_alpha 32官方示例默认秩配置--learning_rate 1e-4LoRA 常用区间 1e-45e-5验证推理加载训练后的 LoRA 权重swift infer \ --adapters output/vx-xxx/checkpoint-xxx \ --stream true \ --max_new_tokens 2048--adapters指向训练产出的 last checkpoint。该目录内含训练参数 args.json模型、system 提示词等会自动读取无需重复指定--model。按硬件档位选择微调方案8GB、24GB 与多卡812GB 显存QLoRA 怎么微调 7B官方 bnb 4bit 示例examples/train/qlora/bnb训练 Qwen2.5-7B-Instruct 实测 10GB。7B 模型的显存要求由此档决定关键参数--quant_method bnb --quant_bits 4冻结权重以 BNB 4bit 驻留显存--bnb_4bit_quant_type nf4 --bnb_4bit_use_double_quant truenf4 加双重量化进一步压缩--per_device_train_batch_size 1搭配--gradient_accumulation_steps 16等效大 batch--lora_rank 8只有 LoRA 权重进优化器rank 越小开销越低严格 8GB 的卡建议跑 1.5B4B 的 4bit QLoRA7B 需要 10GB 上下。24GB 单卡7B LoRA 与多模态7B bf16 权重约 15GB加 LoRA 后单张 24GB 卡可承载更大模型改用--deepspeed指向 swift/config/zero3.json 拆分优化器状态多模态 7BQwen2.5-VL-7B单卡 LoRA 示例实测 22GiB关键是用MAX_PIXELS1003520限制图像 token并--freeze_vit true --freeze_aligner true冻结视觉侧仍不足时叠加--gradient_checkpointing true多卡DeepSpeed、FSDP2 与 Megatron双卡 DeepSpeed官方示例 ZeRO2 为 18GiB×2、ZeRO3 为 16GiB×2 训 7B LoRAexamples/train/multi-gpuFSDP2--fsdp2指向 swift/config/fsdp2.jsonMoE 与集群megatron sft命令启用 TP/PP/SP/CP/EP 并行官方说明 300 文本、100 多模态模型支持全参数与 LoRA见 Megatron-SWIFT 文档进阶场景多模态模型训练文本、图像、视频、语音可混在同一条数据里训练packing 技术官方称可提升多模态训练速度 100%。示例为单卡 22GiB 微调 Qwen2.5-VL-7B 生成 COCO 描述swift sft \ --model Qwen/Qwen2.5-VL-7B-Instruct \ --dataset modelscope/coco_2014_caption:validation#20000 \ --tuner_type lora \ --freeze_vit true --freeze_aligner true \ --target_modules all-linearGRPO 强化学习4×80G 训练 72B内置 GRPO、DAPO、GSPO、SAPO、CISPO、CHORD、RLOO、Reinforce 共 8 个 GRPO 族算法rollout 走 vLLMcolocate 或 server 模式奖励函数、多轮调度器均可插件化扩展agent 场景支持多轮 GRPOCUDA_VISIBLE_DEVICES0,1,2,3 NPROC_PER_NODE4 \ swift rlhf \ --rlhf_type grpo \ --model Qwen/Qwen2.5-72B-Instruct \ --tuner_type lora \ --use_vllm true --vllm_mode colocate该官方脚本在 4×80G 上以 vLLM tensor 并行 4 完成 72B 的 GRPO 强化学习。多轮 rollout 中AsyncLLMEngine 让两轮生成时间重叠减少整体等待树状 rollout 调度TreePO将推理切分为多段并支持回退用于提升探索效率量化与 vLLM 部署训练产物导出 AWQ/GPTQ/BNB/FP8 量化权重再挂 vLLM 提供 OpenAI 接口swift export --model output/checkpoint-xxx --quant_method gptq --quant_bits 4 \ --output_dir Qwen2.5-GPTQ-Int4 swift deploy --model Qwen2.5-GPTQ-Int4 --infer_backend vllm --port 8000排障手册OOMCUDA out of memory现象训练前几步或加大 batch 时报显存溢出。原因峰值显存由激活batch×序列长与优化器状态决定。解法按优先级--per_device_train_batch_size 1加梯度累积开--gradient_checkpointing true调小--lora_rank改 QLoRA 或 ZeRO3/FSDP2 拆分。loss 异常NaN 或不收敛现象loss 直接 NaN或数百步后横盘。原因学习率偏高大 rank LoRA 更常见或数据被--max_length截断成残缺样本。解法LoRA 从 1e-4 降到 5e-5GRPO 用 1e-6官方 72B 示例值先用dataset#100小样本验证数据格式。显存不足多模态训练超预算现象加载图片后显存骤增。原因图像 token 数量不受控。解法用MAX_PIXELS限图像像素上限官方 VL 示例取 1003520--freeze_vit true让视觉编码器不进计算图同质数据开启 packing 拼接。训练后验证模型输出不对现象推理跑题、答非所问。原因--adapters指向旧 checkpoint或训练时的--system与模板未被还原。解法swift infer --adapters ...依赖 args.json 自动还原参数校验走 vLLM 时先加--merge_lora true验证需要客观分数时用swift eval跑评测集。收尾文档与社区入口完整参数表见命令行参数文档模型与数据集支持矩阵见Supported-models-and-datasets。文中各场景的可运行脚本集中在 examples/train/qlora、train/multimodal、train/grpo、export/quantize与本文一一对应。交流群二维码见仓库 README 顶部。【免费下载链接】swiftUse PEFT or Full-parameter to CPT/SFT/DPO/GRPO 600 LLMs (Qwen3.6, DeepSeek-V4, GLM-5.1, InternLM3, Llama4, ...) and 300 MLLMs (Qwen3-VL, Qwen3-Omni, InternVL3.5, Ovis2.5, GLM4.5v, Gemma4, Llava, Phi4, ...) (AAAI 2025).项目地址: https://gitcode.com/GitHub_Trending/swift1/swift创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。