Vision-Language SFT
Ce skill fait partie du plugin llm-finetuning du marketplace agentic wshobson/agents, un dépôt multi-harness (Claude Code, Codex CLI, Cursor, Gemini CLI, etc.) proposant 94 plugins et 175 skills prêts à l'emploi. Il s'inscrit dans une chaîne de skills ML spécialisés : finetuning-method-selection route vers ce skill lorsque les données sont des démonstrations image+texte, le modèle de base est un VLM, et la méthode retenue est le supervised fine-tuning plutôt que le RL ou les preference pairs.
Ce que couvre ce skill
Le skill produit une configuration d'adapter validée — quels composants geler, quels modules cibler avec LoRA, et quel budget min_pixels/max_pixels appliquer — directement consommable par l'agent llm-finetuning-training-engineer pour générer un script d'entraînement exécutable. Il documente la recette consensus (tower et projecteur gelés, LoRA sur le LLM uniquement, r=8–16, α=16–32), les conditions d'exception pour dégeler les dernières couches ViT, les règles de couplage QLoRA/tower gelé, ainsi que les spécificités Unsloth (UnslothVisionDataCollator, contrainte finetune_vision_layers=False en mode fast inference).
Deux points de défaillance silencieux sont traités en priorité : le désalignement placeholder-image dans le collator (entraînement sans erreur mais sans apprentissage) et le budget min_pixels/max_pixels mal calibré. Le skill insiste sur le fait qu'une courbe de loss normale n'est pas une preuve de bon fonctionnement, et renvoie vers references/collators-and-pitfalls.md pour la checklist de validation pré-entraînement.
Périmètre et dépendances
Ce skill ne couvre ni le choix du modèle de base (délégué au catalogue references/model-catalog.md de finetuning-method-selection), ni la préparation du dataset image+texte (dataset-curation), ni le RL sur VLM (grpo-rlvr-training). Il est conçu pour être lu après lora-qlora-recipes si les fondamentaux LoRA (rang, alpha, target modules) ne sont pas déjà maîtrisés. Son scope s'arrête strictement au supervised fine-tuning de VLMs.