在 4 GB 笔记本电脑 GPU 上微调 8B LLM
LoRA 保持基本模型冻结:读取,从不写入。因此,Soup 将其保存在系统 RAM 中,并将其一次一个解码器层流式传输到 GPU。峰值 VRAM 成为一层而不是整个模型。在 RTX 3050 笔记本电脑 4 GB 上测量:Llama-3.1-8B 在 3.32 GB 峰值下以 119.6 tok/s 的速度进行训练。一份 YAML,一条命令。 SFT、DPO、GRPO、KTO,以及评估、门控和导出。阿帕奇 -2.0。每个数字都会被公布,包括我测量并丢弃的数字。
No likes yet
Local DB admin panel – quick multi-dim table backend.