7B params, 128K contexte, ~4.1 Go VRAM en Q4 : sur le papier ça tient partout. En pratique, vérifie la quantization avant la taille du modèle.
#LLM#SelfHosted
On croit qu'ajouter une couche de safety = plus de VRAM à trouver. Nemotron 3.5 Content Safety (4.3B, Apache 2.0) tient en Q4 dans 2.5 Go, à côté de ton modèle principal.
#LLM#SelfHosted
Un MoE 26B et un dense 20B n'ont pas le même besoin VRAM, même à taille annoncée proche. Architecture, quantization, hardware cible : dans cet ordre.
#LLM#SelfHosted
Qwen 2 VL 7B tourne en 6 Go de VRAM (Q4). La vraie question : qu'est-ce que tu sacrifies pour que ça tienne, contexte, résolution d'image, ou les deux ?
#LLM#SelfHosted
« 1,6T de paramètres », ça n'engage à rien tant qu'on n'a pas l'empreinte réelle en quantization. Un Maverick 400B pèse de ~240 Go (Q4_K_M) à ~800 Go (FP16) selon le packing MoE.
#LLM#MoE
19 Go de VRAM pour DeepSeek R1 Distill 32B en Q4, c'est la théorie. Le piège : cette marge fond dès que le contexte s'allonge, et c'est là que ça plante.
#LLM#SelfHosted
7B, 128K de contexte, ~4,1 Go de VRAM en Q4 : ces chiffres de GLM-5.3 se lisent bien séparément, mal ensemble. La vraie question, c'est combien de ce contexte tient sur ta carte une fois le KV cache compté.
#LLM#OpenWeights
Le vrai piège n'est pas la taille du modèle, c'est le GPU sur lequel tu le testes. Les tokens/sec d'une RTX 4090 ne disent rien de ta 3060.
#LLM#SelfHosted
5 Go de VRAM en Q4 pour Claire 7B 0.1, ça tourne sur une carte à 200€. Le vrai piège, c'est la licence CC-BY-NC-SA : usage non-commercial only.
#LLM#OpenWeights
Un modèle "think" avec 16K de contexte : le raisonnement grignote le budget avant la réponse. Vérifie aussi l'EOS avant de déployer un fine-tune.
#LLM#SelfHosted
4,1 Go de VRAM en Q4, c'est le prix des poids d'IBM Granite Code 7B DPO. Pas celui de tes 128K tokens de contexte : le KV cache, lui, vit à part.
#LLM#SelfHosted
GLM-5.3-Flash : 320B params, ~186 Go de VRAM en Q4. Le nom dit "léger", le hardware dit "cluster". La vraie question n'est pas la quantization, c'est l'éligibilité de ton infra.
#LLM#OpenWeights
125B params, 72 Go VRAM en Q4, mais c'est du MoE : les params actifs par token n'ont rien à voir avec le total stocké. Vérifie aussi le KV cache sur 256K de contexte et la licence "other" avant prod.
#LLM#MoE
600M params, ~0.3 Go de VRAM en Q4, contexte 40K tokens, mais S1-mini est taggé anglais only. Avant de choisir un modèle audio léger, vérifie la langue et la licence, pas que le poids.
#LLM#STT
Ce qu'on voit le plus souvent : la VRAM se calcule sur les poids, jamais sur le budget contexte. LFM2.5-DSpark (7B, Q4) tient en ~4,1 Go et laisse de la place pour 32K tokens de contexte.
#LLM#SelfHosted
Granite 4.2 : 8B, 128K de contexte, ~4,6 Go de VRAM en Q4. Le petit modèle qui tient sur presque tout, avec un contexte de gros modèle.
#LLM#OpenWeights
1.5 Go de VRAM, ce n'est pas la prouesse. La vraie question : modèle né petit, ou gros modèle écrasé en quantization jusqu'à l'os ? LFM2.5 2.6B est pensé pour l'edge dès l'entraînement.
#LLM#SelfHosted
131K de contexte annoncés, 4.6 Go de VRAM en Q4 : le chiffre qui compte, c'est ce qui se passe entre les deux. KV cache et contexte réel, pas la fiche.
#LLM#OpenWeights
Un modèle « obliterated », ce n'est pas juste la base sans les refus : c'est une chirurgie sur les poids, pas un fine-tuning. À tester sur ta tâche, pas sur une démo.
#LLM#OpenWeights