Meta Llama
Meta Llama s’adresse aux organisations qui veulent le modèle chez elles, pour une raison réglementaire ou pour une question de volume. Ce n’est pas le chemin le plus court, c’est le seul qui ferme la question de la sortie des données.
Les modèles disponibles
| Modèle | Identifiant d'API | Contexte | Ce qu'il fait |
|---|---|---|---|
| Llama 4 Scout | meta-llama/Llama-4-Scout | 10M tokens | Multimodal, la plus grande fenêtre de contexte publiée en open source. Tient sur un seul GPU H100. |
| Llama 4 Maverick | meta-llama/Llama-4-Maverick | 1M tokens | Multimodal orienté réponse rapide à faible coût. |
| Llama Guard 4 | meta-llama/Llama-Guard-4 | non publié | Modèle de filtrage : il juge si une entrée ou une sortie viole vos règles. |
| Llama 3.3 70B | meta-llama/Llama-3.3-70B-Instruct | 128k tokens | La génération précédente, toujours largement servie par les hébergeurs. |
| Muse Glimmer | non publié | 128k tokens | 30 milliards de paramètres sous Apache 2.0, la licence la plus permissive de la gamme. Publié en août 2026 par Meta Superintelligence Labs. |
| Muse Spark 1.3 | non publié | 1M tokens | Le modèle de tête de Meta, fermé celui-là, soit l'inverse de la démarche Llama. |
Liste vérifiée le 7 septembre 2026 dans la documentation de l'éditeur. Les catalogues de modèles changent vite : reportez-vous à elle avant de vous engager.
Services et endpoints
Téléchargement des poids
Depuis Meta, Hugging Face ou Kaggle. C'est la voie normale d'accès à Llama.
Meta Model API
L'API maison, en préversion publique. L'API Llama hébergée qui l'a précédée a été retirée en juillet 2026.
Hébergement par un tiers
Bedrock, Vertex AI, Groq, Together, les Inference Providers de Hugging Face. C'est ainsi que la plupart des projets consomment Llama.
Auto-hébergement
vLLM ou Ollama sur votre propre serveur, ce que la licence autorise explicitement.
L'avis de Bienfait
Llama occupe une place à part dans ce catalogue : ce n'est pas un service qu'on branche, c'est un fichier qu'on installe. La question n'est donc jamais « quelle clé API », mais « sur quelle machine et qui l'administre ».
Quand on le propose
Sur les dossiers où l'exigence est absolue : aucune donnée ne sort du réseau. Cabinets médicaux, services RH, sous-traitants de la défense. Un modèle installé sur le serveur du client répond à cette exigence de façon vérifiable, ce qu'aucun engagement contractuel ne fait aussi bien.
Sur les volumes très élevés, aussi. À partir du moment où la facture d'API dépasse quelques milliers d'euros par mois, un serveur GPU loué devient moins cher. Le calcul se fait à la main sans grande difficulté.
Ce que la licence vous impose
La Llama 4 Community License n'est pas aussi permissive qu'Apache 2.0. Deux de ses clauses se voient dans le produit fini : il faut afficher « Built with Llama » sur le produit ou sa documentation, puis préfixer par « Llama » tout modèle que vous en dérivez. Une troisième impose de demander une licence à Meta au-delà de 700 millions d'utilisateurs mensuels ; celle-là ne concernera aucun de nos clients.
Nous le signalons au cadrage, parce qu'une mention obligatoire sur l'interface se découvre mal trois jours avant la mise en ligne. Mistral sous Apache 2.0, DeepSeek sous MIT et Qwen sous Apache 2.0 n'imposent, eux, aucun affichage.
Ce que ça coûte vraiment
Le modèle est gratuit, l'exploitation ne l'est pas. Il faut une machine, quelqu'un pour la tenir, une surveillance et une réponse à la question « que se passe-t-il si elle tombe un vendredi soir ». Nous chiffrons toujours ces trois lignes avant de proposer l'auto-hébergement, parce que c'est là que les projets dérapent, jamais sur le modèle lui-même.
Ce qui a changé en 2026 et qu'il faut savoir
Meta a fermé son API Llama hébergée en juillet 2026 et renvoie vers des hébergeurs tiers. Sa gamme de tête s'appelle désormais Muse. Muse Spark est propriétaire, l'inverse exact de ce qui a fait la réputation de Llama. Un projet qui parie sur la continuité de la stratégie ouverte de Meta parie sur quelque chose que Meta ne promet plus. Les modèles déjà publiés, eux, restent téléchargeables et utilisables : c'est ce qui rend le pari raisonnable malgré tout.
Rencontrez notre équipe d'experts.
Discutez de votre projet Meta Llama avec nos experts, sans engagement.