DeepSeek Coder Guide
Dieser Guide ist der modellzentrierte Begleiter zum Cursor + DeepSeek + VS Code Guide. Dort geht es um das Editor-Setup. Hier geht es um das Modell selbst: was DeepSeek Coder ist, die drei realistischen Wege, es zu hosten, und wie du es gut nutzt, sobald es laeuft.
Die Fakten in Abschnitt 1 stammen von der offiziellen DeepSeek-Coder-Projektseite unter deepseekcoder.github.io, geprueft am 22. Juni 2026. Diese Seite dokumentiert das urspruengliche DeepSeek-Coder-Release. Wo dieser Guide ueber die Seite hinausgeht (Hosting-Befehle, Nutzungstipps), kennzeichne ich das als Praxis oder Schlussfolgerung, und ich vermeide es, Zahlen fuer neuere Modelle zu zitieren, die ich nicht anhand der verlinkten Quelle pruefen kann.
1. Was DeepSeek Coder istβ
DeepSeek Coder ist eine Familie von Open-Weight-Code-Modellen, die von DeepSeek veroeffentlicht wurde. Laut offizieller Projektseite umfasst das Release:
1.1 Variantenβ
- Parametergroessen: 1.3B, 5.7B, 6.7B und 33B
- Jeweils zwei Auspraegungen:
- Base β vortrainiert, am besten fuer rohe Vervollstaendigung und Fill-in-the-Middle
- Instruct β instruction-getunt, am besten fuer Chat-artige "mach das fuer mich"-Prompts
1.2 Training und Faehigkeitenβ
- Von Grund auf trainiert auf 2 Billionen Tokens
- Zusammensetzung: 87 % Code, 13 % natuerliche Sprache (Englisch und Chinesisch)
- Abdeckung von 80+ Programmiersprachen
- 16K-Token-Kontextfenster, was die Seite als Grundlage fuer Code-Vervollstaendigung und Infilling auf Projektebene beschreibt (nicht nur einzelne Funktions-Snippets)
1.3 Benchmarks (wie auf der Seite angegeben)β
Die Seite positioniert das 33B-Modell gegen CodeLlama-34B:
| Benchmark | DeepSeek-Coder-33B vs CodeLlama-34B |
|---|---|
| HumanEval (Python) | +7.9% |
| HumanEval (Multilingual) | +9.3% |
| MBPP | +10.8% |
| DS-1000 | +5.9% |
Sie gibt ausserdem an, dass DeepSeek-Coder-Instruct-33B GPT-3.5-turbo bei HumanEval uebertrifft. Behandle diese als die vom Hersteller selbst veroeffentlichten Zahlen, nicht als unabhaengige Ergebnisse von Dritten.
1.4 Lizenz und Zugangβ
- Auf der Seite beschrieben als Open Source und kostenlos fuer Forschung und kommerzielle Nutzung
- Weights: huggingface.co/deepseek-ai
- Code und exakte Nutzungsformate: github.com/deepseek-ai/DeepSeek-Coder
- Gehosteter Chat: coder.deepseek.com
"Kostenlos fuer kommerzielle Nutzung" ist das, was die Projektseite angibt, aber Modelllizenzen koennen Bedingungen enthalten und sich zwischen Releases aendern. Lies die Lizenzdatei, die mit den konkreten Weights ausgeliefert wird, die du herunterlaedst, bevor du etwas darauf aufbauend ausrollst.
Die verlinkte Seite behandelt das urspruengliche DeepSeek Coder. DeepSeek hat seitdem neuere code-faehige Modelle veroeffentlicht (z. B. eine DeepSeek-Coder-V2-Linie und allgemeine Chat-/Reasoner-Modelle der V-Serie). Ich zitiere deren Parameterzahlen oder Benchmarks hier bewusst nicht, weil die verlinkte Quelle sie nicht enthaelt. Fuer alles Neuere schau direkt ins DeepSeek-Coder-Repository und in die deepseek-ai-Organisation auf Hugging Face.
2. Die drei Wege, es zu hostenβ
Es gibt genau drei realistische Modi. Waehle nach wie viel Kontrolle und Skalierung du brauchst.
| Modus | Was es ist | Am besten, wenn |
|---|---|---|
| Lokale Runtime (Ollama / LM Studio) | Inferenz auf einer Maschine, minimales Setup | Einzelner Entwickler, Laptop/Workstation, "laeuft einfach" |
| Selbst gehosteter Server (vLLM / TGI) | OpenAI-kompatible API auf deiner GPU-Maschine | Ein Team, groessere Modelle, viele Tools teilen sich ein Backend |
| DeepSeek API | DeepSeeks eigene gehostete, token-abgerechnete API | Keine Hardware, schnellster Start, akzeptierst, dass Daten dein Netzwerk verlassen |
Der Rest dieses Abschnitts geht jeden Modus durch. Fuer die Editor-Verdrahtung (Continue in VS Code, Cursors kostenlose Stufe) siehe den Cursor + DeepSeek + VS Code Guide β dieser Guide wiederholt das nicht.
2.1 Lokale Runtime mit Ollama (am einfachsten)β
Der schnellste Weg fuer eine Maschine. Installiere Ollama und ziehe dann ein DeepSeek-Coder-Modell:
ollama run deepseek-coder:6.7b
Die Ollama-Bibliothek stellt diese DeepSeek-Coder-Tags bereit:
deepseek-coder:1.3bdeepseek-coder:6.7bdeepseek-coder:33b
Ollama bedient einen HTTP-Endpunkt unter http://localhost:11434 und stellt ausserdem einen OpenAI-kompatiblen Pfad unter http://localhost:11434/v1 bereit, sodass die meisten Tools und SDKs ohne eigenen Code damit sprechen koennen.
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-coder:6.7b",
"messages": [{"role": "user", "content": "Write a Python function that reverses a linked list."}]
}'
Wenn du JSON mit einem Codeblock darin zurueckbekommst, laeuft dein lokales Modell.
2.2 Selbst gehosteter Server mit vLLM (skaliert)β
Wenn ein Laptop nicht reicht β groessere Modelle, ein gemeinsames Team-Backend oder das Routing vieler Tools zu einem Endpunkt β nutze vLLM, das einen OpenAI-kompatiblen Server bereitstellt:
vllm serve deepseek-ai/deepseek-coder-6.7b-instruct
Das gibt dir einen Endpunkt wie http://your-server:8000/v1, der sich wie die OpenAI-API verhaelt. Jeder OpenAI-kompatible Client β VS-Code-Erweiterungen, Codex-artige und Claude-Code-artige Tools, deine eigenen Apps β kann darauf zeigen.
Das 33B-Modell braucht ernsthaften GPU-Speicher (denk an eine Karte mit viel VRAM oder Multi-GPU, besonders bei hoeherer Praezision). Das 6.7B-Modell ist die realistische "laeuft auf einer einzelnen anstaendigen GPU"-Wahl. Der genaue VRAM-Bedarf haengt von Quantisierung und Kontextlaenge ab β benchmarke auf deiner eigenen Hardware, statt einer Tabelle zu vertrauen.
2.3 DeepSeeks gehostete API (keine Hardware)β
Wenn du nichts selbst betreiben willst, bietet DeepSeek eine kostenpflichtige, OpenAI-kompatible API. Das ist die am wenigsten private Option β deine Prompts und dein Code verlassen dein Netzwerk β, also waege sie gegen deine Anforderungen an den Umgang mit Daten ab, bevor du etwas Sensibles sendest.
3. Welche Variante solltest du tatsaechlich betreiben?β
Zwei unabhaengige Entscheidungen: Groesse und Base vs. Instruct.
3.1 Waehle eine Groesseβ
| Groesse | Wofuer du sie nutzt |
|---|---|
| 1.3B | Smoke-Tests, schwache Laptops, nur Autocomplete, sehr niedrige Latenz |
| 6.7B | Die realistische lokale Baseline β gute Qualitaet, bescheidene Hardware |
| 33B | Hoechste Qualitaet, braucht starke GPU-Hardware oder einen Server |
Wenn du unsicher bist, starte bei 6.7B und gehe nur hoch, wenn die Qualitaet der Engpass ist, oder runter, wenn es die Latenz ist.
3.2 Base vs. Instruct β das ist wichtigβ
Das ist der Teil, den die Leute falsch machen.
- Nutze
-instruct, wenn du mit dem Modell im Chat sprichst: "refaktoriere das", "erklaer diesen Stack-Trace", "schreib Tests fuer diese Funktion". Das willst du fuer ein Editor-Chat-Panel oder einen Agenten. - Nutze
-base, wenn du rohe Vervollstaendigung oder Fill-in-the-Middle ohne konversationelle Huelle willst β Inline-Autocomplete, Code-Infilling oder dein eigenes Prompting-Geruest.
Ein haeufig starkes Setup sind zwei Modelle gleichzeitig: ein kleines Base-Modell fuer schnelle Inline-Vervollstaendigung und ein groesseres Instruct-Modell fuer das Chat-/Agenten-Panel.
4. Die besten Ergebnisse erzielenβ
4.1 Nutze Fill-in-the-Middle (FIM) zur Vervollstaendigungβ
Die offizielle Seite hebt Infilling und Vervollstaendigung auf Projektebene explizit als Kernfaehigkeiten hervor β das Modell wurde darauf trainiert, eine Luecke zu fuellen, wenn Code auf beiden Seiten des Cursors gegeben ist, nicht nur vom Ende aus weiterzuschreiben. Genau das macht es stark fuer Inline-Autocomplete.
FIM funktioniert nur, wenn du Praefix/Suffix/Luecke in DeepSeek Coders spezifische Sondertokens einbettest. Die exakten Token-Strings sind im offiziellen Repository definiert β kopiere sie von dort statt aus dem Gedaechtnis, denn falsche Delimiter verschlechtern den Output stillschweigend. Die meisten Editor-Erweiterungen (z. B. Continue) erledigen das fuer dich, wenn du das richtige Template waehlst; du musst dich vor allem darum kuemmern, wenn du dein eigenes Vervollstaendigungs-Geruest baust.
4.2 Fuettere es mit echtem Kontextβ
Das 16K-Fenster reicht fuer Multi-File-Kontext aus, und genau dort soll DeepSeek Coder glaenzen. Praktische Gewinne:
- Fuege die tatsaechlich umgebende(n) Datei(en) ein, nicht nur die eine Funktion.
- Nimm relevante Typdefinitionen, Interfaces und Aufrufstellen mit auf, damit es zu deiner Codebasis passt, statt APIs zu erfinden.
- Bei "schreib Tests fuer X" gib ihm sowohl X als auch einen existierenden Test, damit es deine Test-Konventionen kopiert.
4.3 Prompte das Instruct-Modell wie einen Seniorβ
- Sei explizit bei Sprache, Framework-Version und Constraints ("PHP 8.3, Laravel 11, keine Eloquent-Raw-Queries").
- Bitte um eine Sache pro Runde; lange Multi-Task-Prompts liefern matschigeren Output als eine fokussierte Sequenz.
- Wenn es von deinen Konventionen abweicht, korrigiere mit einem konkreten Beispiel, statt die Regel abstrakt zu wiederholen.
4.4 Stimme das Sampling abβ
- Halte die Temperatur fuer Code niedrig (β0β0.3). Hohe Temperatur bringt dir kreative Prosa und fehlerhaften Code.
- Setze eine Stop-Sequenz, wenn du innerhalb einer groesseren Struktur vervollstaendigst, damit es nicht ueber die Grenze hinauslaeuft, die dir wichtig ist.
4.5 Pruefe den Output immerβ
DeepSeek Coder produziert selbstbewussten, plausiblen und manchmal falschen Code β wie jedes Code-Modell. Der Trainingsmix mit 87 % Code macht es fluessig, nicht unfehlbar. Behandle jeden Vorschlag als Entwurf, der zu pruefen ist, besonders bei sicherheitssensiblen Pfaden, Randfaellen und allem, was echte Daten beruehrt.
5. Empfohlene Setupsβ
5.1 Einzelner Entwickler, guenstig und lokalβ
Ollama + deepseek-coder:6.7b (instruct for chat)
+ a small base model for inline completion
Keine Token-Rechnungen, vollstaendig lokal, gute taegliche Qualitaet.
5.2 Team, gemeinsames Backendβ
vLLM serving a DeepSeek Coder model on a GPU box
β OpenAI-compatible endpoint
β every developer's editor + internal tools point at it
Ein Modell zu pflegen, konsistentes Verhalten im ganzen Team, Code verlaesst nie deine Infrastruktur.
5.3 Null Infrastrukturβ
DeepSeek hosted API
Am schnellsten zu starten; akzeptiere, dass Prompts und Code dein Netzwerk verlassen.
6. Fazitβ
- Was es ist: eine Open-Weight-Code-Modellfamilie (1.3Bβ33B, Base + Instruct), Training mit 2T Tokens, 16K Kontext, starke veroeffentlichte Code-Benchmarks, offen und kostenlos fuer kommerzielle Nutzung laut Projektseite.
- Wie du es hostest: Ollama fuer eine Maschine, vLLM fuer einen Team-Server, die DeepSeek API, wenn du keine Hardware willst.
- Wie du es gut nutzt: passe Base-vs.-Instruct an die Aufgabe an, setze auf Fill-in-the-Middle fuer die Vervollstaendigung, fuettere es mit echtem Multi-File-Kontext, halte die Temperatur niedrig und pruefe alles.
Fuer die Editor-Seite dieser Geschichte β Cursors kostenlose Stufe, Continue in VS Code und die Self-Hosting-Abwaegungen β gehe zum Cursor + DeepSeek + VS Code Guide.