Zum Hauptinhalt springen

Meta Llama Guide

Worum geht's?

Metas AI-Geschichte hat inzwischen zwei Stränge: die Open-Weight-Llama-Familie, die du herunterladen, selbst hosten und feintunen kannst, und ein neueres proprietäres Flaggschiff (Muse Spark), das den Meta-AI-Consumer-Assistenten antreibt. Dieser Guide fokussiert sich auf den entwicklerrelevanten Strang – Llama-Modelle, die Hosting-Optionen, Llama Stack und die Lizenz – und erklärt, wo Muse Spark einzuordnen ist.

Quellenstand vom 23. Juni 2026

Basierend auf offiziellen Meta-Quellen (llama.com / developer.meta.com/ai, ai.meta.com, huggingface.co/meta-llama, dem Llama-Stack-Repo) sowie den wichtigsten Hosting-Partnern. Zwei Dinge sind auseinanderzuhalten: Die neueste Open-Weight-Generation ist weiterhin Llama 4 (Scout / Maverick, April 2025) – es ist keine neuere Open-Weight-Generation erschienen – und Muse Spark (April 2026) ist proprietär, nicht Teil der Open-Weight-Familie. Metas eigene gehostete Llama API ist in der Preview, nicht GA. Preview-Endpunkte und Partner-Modell-IDs ändern sich; prüfe sie gegen die Live-Dokumentation, bevor du dich darauf verlässt.

1. Das mentale Modell​

OberflächeWofür sie da istPrimärer Nutzer
Open-Weight-Llama-ModelleLade die Weights herunter; selbst hosten oder auf eigener Infrastruktur feintunenTeams, die Kontrolle, Datenschutz, On-Prem wollen
Llama API (Meta-gehostet)Meta-gehostete Inferenz für Llama-Modelle, OpenAI-SDK-kompatibel – PreviewEntwickler, die Llama ohne eigene Infra wollen
Llama StackOffene, standardisierte API-Schicht + Toolkit (Inferenz, RAG, Agents, Safety, Evals, Telemetrie), überall lauffähigEntwickler, die portable LLM-Apps bauen
Meta AI (Consumer-Assistent)Endnutzer-Chat ĂĽber WhatsApp, Instagram, Messenger und meta.aiVerbraucher (keine Build-on-Plattform)
Muse SparkMetas proprietäres Flaggschiff-Modell, das jetzt Meta AI antreibtVerbraucher; ausgewählte Partner über private API-Preview

Hosting-/Inferenz-Ă–kosystem, das Llama bereitstellt: Hugging Face (Weights), Ollama und llama.cpp (lokal), vLLM (Hochdurchsatz-Serving) sowie die gehosteten Partner Together, Groq, Fireworks, AWS Bedrock, Azure und Google Vertex AI.

Faustregel:

  • Brauchst du Kontrolle, Datenschutz oder Fine-Tuning? → die Open Weights selbst hosten.
  • Willst du Llama ohne Ops? → ein gehosteter Partner (Together / Groq / Fireworks / Bedrock / Azure / Vertex).
  • Willst du es "direkt von der Quelle", OpenAI-kompatibel, und prototypisierst nur? → die Meta Llama API (Preview).
  • Willst du nur einen Endnutzer-Assistenten? → Meta AI (es ist ein Produkt, keine Plattform).

2. Die Open-Weight-Llama-Modelle​

Das ist der Strang, den die meisten Entwickler mit "Llama" meinen. Du lädst die Weights herunter und führst sie selbst aus.

Die neueste Open-Weight-Generation ist Llama 4 (veröffentlicht im April 2025), aufgebaut auf einer Mixture-of-Experts-Architektur:

ModellAktive / Gesamt-ParameterKontextfensterMultimodal
Llama 4 Scout (Llama-4-Scout-17B-16E)17B aktiv / ~109B gesamt (16 Experts)bis zu 10M Tokens (Metas Schlagzeilen-Angabe)Text + Bild → Text; passt auf eine einzelne H100
Llama 4 Maverick (Llama-4-Maverick-17B-128E)17B aktiv / ~400B gesamt (128 Experts)1M TokensText + Bild → Text
Zwei Einschränkungen
  • Llama 4 Behemoth (~288B aktiv / ~2T gesamt) wurde als "noch im Training" angekĂĽndigt und wurde nicht öffentlich veröffentlicht – behandle es als nicht veröffentlicht.
  • Das Dense-Modell der vorherigen Generation, Llama 3.3 70B Instruct (nur Text, Dez. 2024), wird weiterhin breit bereitgestellt und bleibt eine sinnvolle Wahl fĂĽr Text-Workloads.

Safety-Modelle (neben den Basismodellen einzusetzen):

  • Llama Guard 4 (12B) – einheitlicher Text- + Bild-Schutz fĂĽr die Llama-4- und Llama-3-Serie.
  • Llama Prompt Guard 2 – Erkennung von Prompt-Injection / Jailbreaks, in einer 86M- und einer latenzarmen 22M-Variante.

(Code Llama ist Legacy – Coding-Fähigkeit steckt jetzt in den allgemeinen Llama-3+/4-Modellen. Kein 2026-Update wurde bestätigt.)


3. Die Llama-Lizenz – lies das, bevor du auslieferst​

Llama 4 wird unter dem Llama 4 Community License Agreement ausgeliefert (gĂĽltig ab 5. April 2025). Es ist source-available, nicht OSI-"Open Source".

  • Gewährung: lizenzgebĂĽhrenfreie, weltweite, nicht-exklusive Rechte zur Nutzung, Modifikation, Erstellung von Derivaten, Reproduktion und Verbreitung. Kommerzielle Nutzung ist erlaubt.
  • Die 700M-MAU-Klausel: Wenn die Produkte, die du anbietest, am Llama-4-Release-Datum 700 Millionen monatlich aktive Nutzer im vorangegangenen Kalendermonat ĂĽberschreiten, musst du eine separate Lizenz von Meta anfragen, die Meta nach eigenem Ermessen gewähren oder verweigern kann.
  • Pflichten: Attribution beibehalten ("Built with Llama"), die Lizenz beilegen und die Acceptable Use Policy einhalten.

Verwende den Begriff "Open Weight" (oder "source available"), nicht "Open Source" – wegen der MAU-Beschränkung und der Acceptable-Use-Grenzen erfüllt Llama nicht die Definition der Open Source Initiative.


4. Llama Stack und Meta AI / Muse Spark​

Llama Stack ist eine offene, standardisierte API-Schicht plus Toolkit – Inferenz, RAG, Agents, Safety, Evals, Telemetrie – so gestaltet, dass eine dagegen geschriebene App über Anbieter hinweg portabel bleibt (Together, Fireworks, Groq, vLLM, Ollama, AWS Bedrock und andere werden als Adapter ausgeliefert). Es ist OpenAI-kompatibel und liegt im Repo llamastack/llama-stack.

Meta AI ist der Consumer-Assistent ĂĽber WhatsApp, Instagram, Messenger und meta.ai. Es ist ein Endnutzer-Produkt, nichts, worauf du aufbaust.

Muse Spark ist Metas neues proprietäres Flaggschiff-Reasoning-Modell (angekündigt am 8. April 2026), das jetzt Meta AI antreibt und Llama innerhalb der Consumer-Apps ersetzt. Wichtige Punkte für Entwickler:

  • Es ist geschlossen – keine öffentlichen Weights. Erreichbar nur ĂĽber eine private API-Preview fĂĽr ausgewählte Partner (zunächst USA/Kanada).
  • Es bietet Modi wie Instant, Thinking und einen Parallel-Reasoning-Modus "Contemplating".
  • Metas eigene Formulierung lautet, dass es zukĂĽnftige Versionen als Open Source veröffentlichen möchte – eine Hoffnung, keine Zusage. Detaillierte Specs (Parameterzahl, Kontextfenster) wurden nicht offengelegt; gehe von keinen Zahlen aus.

Praktische Konsequenz: Wenn du Metas neuestes, stärkstes Modell heute programmatisch nutzen willst, geht das in der Regel nicht. Für Build-on-Arbeit nutze Llama 4 über die folgenden Optionen.


5. Quickstart-Wege​

(a) Lokal selbst hosten mit Ollama (kürzester lokaler Weg)​

ollama run llama4

Ollama stellt einen lokalen OpenAI-kompatiblen Endpunkt unter http://localhost:11434/v1 bereit, sodass jedes OpenAI-SDK dagegen funktioniert.

(b) Ein gehosteter Partner (OpenAI-kompatibel)​

Die meisten Partner sprechen die OpenAI-API – tausche base_url und den Key aus:

from openai import OpenAI

client = OpenAI(
api_key="<PARTNER_KEY>",
base_url="https://api.together.xyz/v1", # or https://api.groq.com/openai/v1
)

response = client.chat.completions.create(
model="<partner's Llama 4 model id>", # e.g. meta-llama/Llama-4-Maverick-17B-128E-Instruct
messages=[{"role": "user", "content": "..."}],
)

(Der genaue Llama-4-Modell-String jedes Partners unterscheidet sich – hole ihn aus der Modellliste dieses Partners.)

(c) Metas Llama API (Preview)​

OpenAI-SDK-kompatibel; erfordert die Waitlist/den API-Key. Die bereitgestellten Modelle bieten ein 128k-Kontextfenster (die 10M-/1M-Angaben sind Metas Capability-Claims, nicht das, was die Preview-API bereitstellt). Bestätige den genauen Basis-Pfad gegen die Live-Dokumentation – es ist eine sich bewegende Preview.


6. Entscheidungshilfe​

Wenn du … brauchstWähle …
Datenresidenz, Datenschutz, Offline-Nutzung oder Fine-Tuningselbst hosten – vLLM für Produktions-Durchsatz, Ollama / llama.cpp für lokal/dev
Llama ohne Ops, SLAs und mit bestehender Cloud-Abrechnungeinen gehosteten Partner – Groq für geringste Latenz; Bedrock / Azure / Vertex, wenn du schon in dieser Cloud bist
"direkt von der Quelle" zu prototypisieren, OpenAI-kompatibeldie Meta Llama API (Preview – noch nicht für Produktionszusagen)
einen Endnutzer-AssistentenMeta AI (Consumer-Produkt, keine Plattform)

7. Empfohlene Einstiegspunkte​

  • Einzelentwickler / Schnelltest: Ollama lokal oder der Free Tier eines gehosteten Partners.
  • Produktion, kostensensibel bei Skalierung: Llama 4 selbst auf vLLM hosten oder ein gehosteter Partner mit Autoscaling.
  • Reguliert / Datenresidenz: die Open Weights auf eigener EU-Infrastruktur (vLLM) selbst hosten, gepaart mit Llama Guard 4 fĂĽr Safety.
  • Portabilität ĂĽber Anbieter hinweg: gegen Llama Stack bauen, damit du Inferenz-Backends später wechseln kannst.

Modelle & Doku

Gehostet & lokal

Meta AI / Muse Spark

Verwandte Guides