Aller au contenu

Meta Llama

Open source Souveraineté Génération de texte
Réserver un appel → Site Documentation
Description

Meta Llama s’adresse aux organisations qui veulent le modèle chez elles, pour une raison réglementaire ou pour une question de volume. Ce n’est pas le chemin le plus court, c’est le seul qui ferme la question de la sortie des données.

Les modèles disponibles

Modèle Identifiant d'API Contexte Ce qu'il fait
Llama 4 Scout meta-llama/Llama-4-Scout 10M tokens Multimodal, la plus grande fenêtre de contexte publiée en open source. Tient sur un seul GPU H100.
Llama 4 Maverick meta-llama/Llama-4-Maverick 1M tokens Multimodal orienté réponse rapide à faible coût.
Llama Guard 4 meta-llama/Llama-Guard-4 non publié Modèle de filtrage : il juge si une entrée ou une sortie viole vos règles.
Llama 3.3 70B meta-llama/Llama-3.3-70B-Instruct 128k tokens La génération précédente, toujours largement servie par les hébergeurs.
Muse Glimmer non publié 128k tokens 30 milliards de paramètres sous Apache 2.0, la licence la plus permissive de la gamme. Publié en août 2026 par Meta Superintelligence Labs.
Muse Spark 1.3 non publié 1M tokens Le modèle de tête de Meta, fermé celui-là, soit l'inverse de la démarche Llama.

Liste vérifiée le 7 septembre 2026 dans la documentation de l'éditeur. Les catalogues de modèles changent vite : reportez-vous à elle avant de vous engager.

Services et endpoints

Téléchargement des poids

Depuis Meta, Hugging Face ou Kaggle. C'est la voie normale d'accès à Llama.

Meta Model API

L'API maison, en préversion publique. L'API Llama hébergée qui l'a précédée a été retirée en juillet 2026.

Hébergement par un tiers

Bedrock, Vertex AI, Groq, Together, les Inference Providers de Hugging Face. C'est ainsi que la plupart des projets consomment Llama.

Auto-hébergement

vLLM ou Ollama sur votre propre serveur, ce que la licence autorise explicitement.

L'avis de Bienfait

Llama occupe une place à part dans ce catalogue : ce n'est pas un service qu'on branche, c'est un fichier qu'on installe. La question n'est donc jamais « quelle clé API », mais « sur quelle machine et qui l'administre ».

Quand on le propose

Sur les dossiers où l'exigence est absolue : aucune donnée ne sort du réseau. Cabinets médicaux, services RH, sous-traitants de la défense. Un modèle installé sur le serveur du client répond à cette exigence de façon vérifiable, ce qu'aucun engagement contractuel ne fait aussi bien.

Sur les volumes très élevés, aussi. À partir du moment où la facture d'API dépasse quelques milliers d'euros par mois, un serveur GPU loué devient moins cher. Le calcul se fait à la main sans grande difficulté.

Ce que la licence vous impose

La Llama 4 Community License n'est pas aussi permissive qu'Apache 2.0. Deux de ses clauses se voient dans le produit fini : il faut afficher « Built with Llama » sur le produit ou sa documentation, puis préfixer par « Llama » tout modèle que vous en dérivez. Une troisième impose de demander une licence à Meta au-delà de 700 millions d'utilisateurs mensuels ; celle-là ne concernera aucun de nos clients.

Nous le signalons au cadrage, parce qu'une mention obligatoire sur l'interface se découvre mal trois jours avant la mise en ligne. Mistral sous Apache 2.0, DeepSeek sous MIT et Qwen sous Apache 2.0 n'imposent, eux, aucun affichage.

Ce que ça coûte vraiment

Le modèle est gratuit, l'exploitation ne l'est pas. Il faut une machine, quelqu'un pour la tenir, une surveillance et une réponse à la question « que se passe-t-il si elle tombe un vendredi soir ». Nous chiffrons toujours ces trois lignes avant de proposer l'auto-hébergement, parce que c'est là que les projets dérapent, jamais sur le modèle lui-même.

Ce qui a changé en 2026 et qu'il faut savoir

Meta a fermé son API Llama hébergée en juillet 2026 et renvoie vers des hébergeurs tiers. Sa gamme de tête s'appelle désormais Muse. Muse Spark est propriétaire, l'inverse exact de ce qui a fait la réputation de Llama. Un projet qui parie sur la continuité de la stratégie ouverte de Meta parie sur quelque chose que Meta ne promet plus. Les modèles déjà publiés, eux, restent téléchargeables et utilisables : c'est ce qui rend le pari raisonnable malgré tout.

Passons à l'action

Rencontrez notre équipe d'experts.

Discutez de votre projet Meta Llama avec nos experts, sans engagement.

Réserver un appel → Voir tous les modèles d'IA
Newsletter
BienVu, notre newsletter

Un cas concret de donnée ou d'automatisation, deux fois par mois.

Deux envois par mois, pas un de plus. Désinscription en un clic.

Intégrations Modèles d'IA Outils Nous rejoindre
Réserver un appel Accéder au Salon

Nantes · Marseille · Paris. Réponse sous 24 h ouvrées.