Resumo da IA
LoRA mantém o modelo base congelado: leitura, escrita. Soup mantém a RAM do sistema transmitindo GPU uma camada de decodificador por vez. O pico de VRAM passa a ser uma camada em vez do modelo inteiro. Medido RTX 3050 Laptop 4 GB: Llama-3.1-8B treina 119,6 tok/s 3,32 pico. Um YAML, um comando. SFT, DPO, GRPO, KTO, mais avaliação, exportação de gating. Apache-2.0. Cada número publicado, incluindo os medidos descartados.
Nenhum comentário ainda
Seja o primeiro a compartilhar seus pensamentos e iniciar a conversa!