Meta Llama Guide
Metas AI-Geschichte hat inzwischen zwei Stränge: die Open-Weight-Llama-Familie, die du herunterladen, selbst hosten und feintunen kannst, und ein neueres proprietäres Flaggschiff (Muse Spark), das den Meta-AI-Consumer-Assistenten antreibt. Dieser Guide fokussiert sich auf den entwicklerrelevanten Strang – Llama-Modelle, die Hosting-Optionen, Llama Stack und die Lizenz – und erklärt, wo Muse Spark einzuordnen ist.
Basierend auf offiziellen Meta-Quellen (llama.com / developer.meta.com/ai, ai.meta.com, huggingface.co/meta-llama, dem Llama-Stack-Repo) sowie den wichtigsten Hosting-Partnern. Zwei Dinge sind auseinanderzuhalten: Die neueste Open-Weight-Generation ist weiterhin Llama 4 (Scout / Maverick, April 2025) – es ist keine neuere Open-Weight-Generation erschienen – und Muse Spark (April 2026) ist proprietär, nicht Teil der Open-Weight-Familie. Metas eigene gehostete Llama API ist in der Preview, nicht GA. Preview-Endpunkte und Partner-Modell-IDs ändern sich; prüfe sie gegen die Live-Dokumentation, bevor du dich darauf verlässt.
1. Das mentale Modell​
| Oberfläche | Wofür sie da ist | Primärer Nutzer |
|---|---|---|
| Open-Weight-Llama-Modelle | Lade die Weights herunter; selbst hosten oder auf eigener Infrastruktur feintunen | Teams, die Kontrolle, Datenschutz, On-Prem wollen |
| Llama API (Meta-gehostet) | Meta-gehostete Inferenz für Llama-Modelle, OpenAI-SDK-kompatibel – Preview | Entwickler, die Llama ohne eigene Infra wollen |
| Llama Stack | Offene, standardisierte API-Schicht + Toolkit (Inferenz, RAG, Agents, Safety, Evals, Telemetrie), überall lauffähig | Entwickler, die portable LLM-Apps bauen |
| Meta AI (Consumer-Assistent) | Endnutzer-Chat ĂĽber WhatsApp, Instagram, Messenger und meta.ai | Verbraucher (keine Build-on-Plattform) |
| Muse Spark | Metas proprietäres Flaggschiff-Modell, das jetzt Meta AI antreibt | Verbraucher; ausgewählte Partner über private API-Preview |
Hosting-/Inferenz-Ă–kosystem, das Llama bereitstellt: Hugging Face (Weights), Ollama und llama.cpp (lokal), vLLM (Hochdurchsatz-Serving) sowie die gehosteten Partner Together, Groq, Fireworks, AWS Bedrock, Azure und Google Vertex AI.
Faustregel:
- Brauchst du Kontrolle, Datenschutz oder Fine-Tuning? → die Open Weights selbst hosten.
- Willst du Llama ohne Ops? → ein gehosteter Partner (Together / Groq / Fireworks / Bedrock / Azure / Vertex).
- Willst du es "direkt von der Quelle", OpenAI-kompatibel, und prototypisierst nur? → die Meta Llama API (Preview).
- Willst du nur einen Endnutzer-Assistenten? → Meta AI (es ist ein Produkt, keine Plattform).
2. Die Open-Weight-Llama-Modelle​
Das ist der Strang, den die meisten Entwickler mit "Llama" meinen. Du lädst die Weights herunter und führst sie selbst aus.
Die neueste Open-Weight-Generation ist Llama 4 (veröffentlicht im April 2025), aufgebaut auf einer Mixture-of-Experts-Architektur:
| Modell | Aktive / Gesamt-Parameter | Kontextfenster | Multimodal |
|---|---|---|---|
Llama 4 Scout (Llama-4-Scout-17B-16E) | 17B aktiv / ~109B gesamt (16 Experts) | bis zu 10M Tokens (Metas Schlagzeilen-Angabe) | Text + Bild → Text; passt auf eine einzelne H100 |
Llama 4 Maverick (Llama-4-Maverick-17B-128E) | 17B aktiv / ~400B gesamt (128 Experts) | 1M Tokens | Text + Bild → Text |
- Llama 4 Behemoth (~288B aktiv / ~2T gesamt) wurde als "noch im Training" angekündigt und wurde nicht öffentlich veröffentlicht – behandle es als nicht veröffentlicht.
- Das Dense-Modell der vorherigen Generation, Llama 3.3 70B Instruct (nur Text, Dez. 2024), wird weiterhin breit bereitgestellt und bleibt eine sinnvolle Wahl fĂĽr Text-Workloads.
Safety-Modelle (neben den Basismodellen einzusetzen):
- Llama Guard 4 (12B) – einheitlicher Text- + Bild-Schutz für die Llama-4- und Llama-3-Serie.
- Llama Prompt Guard 2 – Erkennung von Prompt-Injection / Jailbreaks, in einer 86M- und einer latenzarmen 22M-Variante.
(Code Llama ist Legacy – Coding-Fähigkeit steckt jetzt in den allgemeinen Llama-3+/4-Modellen. Kein 2026-Update wurde bestätigt.)
3. Die Llama-Lizenz – lies das, bevor du auslieferst​
Llama 4 wird unter dem Llama 4 Community License Agreement ausgeliefert (gĂĽltig ab 5. April 2025). Es ist source-available, nicht OSI-"Open Source".
- Gewährung: lizenzgebührenfreie, weltweite, nicht-exklusive Rechte zur Nutzung, Modifikation, Erstellung von Derivaten, Reproduktion und Verbreitung. Kommerzielle Nutzung ist erlaubt.
- Die 700M-MAU-Klausel: Wenn die Produkte, die du anbietest, am Llama-4-Release-Datum 700 Millionen monatlich aktive Nutzer im vorangegangenen Kalendermonat überschreiten, musst du eine separate Lizenz von Meta anfragen, die Meta nach eigenem Ermessen gewähren oder verweigern kann.
- Pflichten: Attribution beibehalten ("Built with Llama"), die Lizenz beilegen und die Acceptable Use Policy einhalten.
Verwende den Begriff "Open Weight" (oder "source available"), nicht "Open Source" – wegen der MAU-Beschränkung und der Acceptable-Use-Grenzen erfüllt Llama nicht die Definition der Open Source Initiative.
4. Llama Stack und Meta AI / Muse Spark​
Llama Stack ist eine offene, standardisierte API-Schicht plus Toolkit – Inferenz, RAG, Agents, Safety, Evals, Telemetrie – so gestaltet, dass eine dagegen geschriebene App über Anbieter hinweg portabel bleibt (Together, Fireworks, Groq, vLLM, Ollama, AWS Bedrock und andere werden als Adapter ausgeliefert). Es ist OpenAI-kompatibel und liegt im Repo llamastack/llama-stack.
Meta AI ist der Consumer-Assistent ĂĽber WhatsApp, Instagram, Messenger und meta.ai. Es ist ein Endnutzer-Produkt, nichts, worauf du aufbaust.
Muse Spark ist Metas neues proprietäres Flaggschiff-Reasoning-Modell (angekündigt am 8. April 2026), das jetzt Meta AI antreibt und Llama innerhalb der Consumer-Apps ersetzt. Wichtige Punkte für Entwickler:
- Es ist geschlossen – keine öffentlichen Weights. Erreichbar nur über eine private API-Preview für ausgewählte Partner (zunächst USA/Kanada).
- Es bietet Modi wie Instant, Thinking und einen Parallel-Reasoning-Modus "Contemplating".
- Metas eigene Formulierung lautet, dass es zukünftige Versionen als Open Source veröffentlichen möchte – eine Hoffnung, keine Zusage. Detaillierte Specs (Parameterzahl, Kontextfenster) wurden nicht offengelegt; gehe von keinen Zahlen aus.
Praktische Konsequenz: Wenn du Metas neuestes, stärkstes Modell heute programmatisch nutzen willst, geht das in der Regel nicht. Für Build-on-Arbeit nutze Llama 4 über die folgenden Optionen.
5. Quickstart-Wege​
(a) Lokal selbst hosten mit Ollama (kürzester lokaler Weg)​
ollama run llama4
Ollama stellt einen lokalen OpenAI-kompatiblen Endpunkt unter http://localhost:11434/v1 bereit, sodass jedes OpenAI-SDK dagegen funktioniert.
(b) Ein gehosteter Partner (OpenAI-kompatibel)​
Die meisten Partner sprechen die OpenAI-API – tausche base_url und den Key aus:
from openai import OpenAI
client = OpenAI(
api_key="<PARTNER_KEY>",
base_url="https://api.together.xyz/v1", # or https://api.groq.com/openai/v1
)
response = client.chat.completions.create(
model="<partner's Llama 4 model id>", # e.g. meta-llama/Llama-4-Maverick-17B-128E-Instruct
messages=[{"role": "user", "content": "..."}],
)
(Der genaue Llama-4-Modell-String jedes Partners unterscheidet sich – hole ihn aus der Modellliste dieses Partners.)
(c) Metas Llama API (Preview)​
OpenAI-SDK-kompatibel; erfordert die Waitlist/den API-Key. Die bereitgestellten Modelle bieten ein 128k-Kontextfenster (die 10M-/1M-Angaben sind Metas Capability-Claims, nicht das, was die Preview-API bereitstellt). Bestätige den genauen Basis-Pfad gegen die Live-Dokumentation – es ist eine sich bewegende Preview.
6. Entscheidungshilfe​
| Wenn du … brauchst | Wähle … |
|---|---|
| Datenresidenz, Datenschutz, Offline-Nutzung oder Fine-Tuning | selbst hosten – vLLM für Produktions-Durchsatz, Ollama / llama.cpp für lokal/dev |
| Llama ohne Ops, SLAs und mit bestehender Cloud-Abrechnung | einen gehosteten Partner – Groq für geringste Latenz; Bedrock / Azure / Vertex, wenn du schon in dieser Cloud bist |
| "direkt von der Quelle" zu prototypisieren, OpenAI-kompatibel | die Meta Llama API (Preview – noch nicht für Produktionszusagen) |
| einen Endnutzer-Assistenten | Meta AI (Consumer-Produkt, keine Plattform) |
7. Empfohlene Einstiegspunkte​
- Einzelentwickler / Schnelltest: Ollama lokal oder der Free Tier eines gehosteten Partners.
- Produktion, kostensensibel bei Skalierung: Llama 4 selbst auf vLLM hosten oder ein gehosteter Partner mit Autoscaling.
- Reguliert / Datenresidenz: die Open Weights auf eigener EU-Infrastruktur (vLLM) selbst hosten, gepaart mit Llama Guard 4 fĂĽr Safety.
- Portabilität über Anbieter hinweg: gegen Llama Stack bauen, damit du Inferenz-Backends später wechseln kannst.
8. Offizielle Links​
Modelle & Doku
- Llama home
- Llama 4 models
- Llama 4 announcement (specs)
- Llama 4 Community License
- Hugging Face — meta-llama
- Llama Stack (GitHub)
- Llama Guard 4 model card
Gehostet & lokal
Meta AI / Muse Spark
Verwandte Guides