Zum Hauptinhalt springen

DeepSeek Coder Guide

Worum geht's?

Dieser Guide ist der modellzentrierte Begleiter zum Cursor + DeepSeek + VS Code Guide. Dort geht es um das Editor-Setup. Hier geht es um das Modell selbst: was DeepSeek Coder ist, die drei realistischen Wege, es zu hosten, und wie du es gut nutzt, sobald es laeuft.

Wichtiger Kontext

Die Fakten in Abschnitt 1 stammen von der offiziellen DeepSeek-Coder-Projektseite unter deepseekcoder.github.io, geprueft am 22. Juni 2026. Diese Seite dokumentiert das urspruengliche DeepSeek-Coder-Release. Wo dieser Guide ueber die Seite hinausgeht (Hosting-Befehle, Nutzungstipps), kennzeichne ich das als Praxis oder Schlussfolgerung, und ich vermeide es, Zahlen fuer neuere Modelle zu zitieren, die ich nicht anhand der verlinkten Quelle pruefen kann.

1. Was DeepSeek Coder ist​

DeepSeek Coder ist eine Familie von Open-Weight-Code-Modellen, die von DeepSeek veroeffentlicht wurde. Laut offizieller Projektseite umfasst das Release:

1.1 Varianten​

  • Parametergroessen: 1.3B, 5.7B, 6.7B und 33B
  • Jeweils zwei Auspraegungen:
    • Base β€” vortrainiert, am besten fuer rohe Vervollstaendigung und Fill-in-the-Middle
    • Instruct β€” instruction-getunt, am besten fuer Chat-artige "mach das fuer mich"-Prompts

1.2 Training und Faehigkeiten​

  • Von Grund auf trainiert auf 2 Billionen Tokens
  • Zusammensetzung: 87 % Code, 13 % natuerliche Sprache (Englisch und Chinesisch)
  • Abdeckung von 80+ Programmiersprachen
  • 16K-Token-Kontextfenster, was die Seite als Grundlage fuer Code-Vervollstaendigung und Infilling auf Projektebene beschreibt (nicht nur einzelne Funktions-Snippets)

1.3 Benchmarks (wie auf der Seite angegeben)​

Die Seite positioniert das 33B-Modell gegen CodeLlama-34B:

BenchmarkDeepSeek-Coder-33B vs CodeLlama-34B
HumanEval (Python)+7.9%
HumanEval (Multilingual)+9.3%
MBPP+10.8%
DS-1000+5.9%

Sie gibt ausserdem an, dass DeepSeek-Coder-Instruct-33B GPT-3.5-turbo bei HumanEval uebertrifft. Behandle diese als die vom Hersteller selbst veroeffentlichten Zahlen, nicht als unabhaengige Ergebnisse von Dritten.

1.4 Lizenz und Zugang​

Pruefe vor kommerzieller Nutzung immer die Lizenz erneut

"Kostenlos fuer kommerzielle Nutzung" ist das, was die Projektseite angibt, aber Modelllizenzen koennen Bedingungen enthalten und sich zwischen Releases aendern. Lies die Lizenzdatei, die mit den konkreten Weights ausgeliefert wird, die du herunterlaedst, bevor du etwas darauf aufbauend ausrollst.

Es gibt neuere Modelle β€” pruefe deren Specs selbst

Die verlinkte Seite behandelt das urspruengliche DeepSeek Coder. DeepSeek hat seitdem neuere code-faehige Modelle veroeffentlicht (z. B. eine DeepSeek-Coder-V2-Linie und allgemeine Chat-/Reasoner-Modelle der V-Serie). Ich zitiere deren Parameterzahlen oder Benchmarks hier bewusst nicht, weil die verlinkte Quelle sie nicht enthaelt. Fuer alles Neuere schau direkt ins DeepSeek-Coder-Repository und in die deepseek-ai-Organisation auf Hugging Face.


2. Die drei Wege, es zu hosten​

Es gibt genau drei realistische Modi. Waehle nach wie viel Kontrolle und Skalierung du brauchst.

ModusWas es istAm besten, wenn
Lokale Runtime (Ollama / LM Studio)Inferenz auf einer Maschine, minimales SetupEinzelner Entwickler, Laptop/Workstation, "laeuft einfach"
Selbst gehosteter Server (vLLM / TGI)OpenAI-kompatible API auf deiner GPU-MaschineEin Team, groessere Modelle, viele Tools teilen sich ein Backend
DeepSeek APIDeepSeeks eigene gehostete, token-abgerechnete APIKeine Hardware, schnellster Start, akzeptierst, dass Daten dein Netzwerk verlassen

Der Rest dieses Abschnitts geht jeden Modus durch. Fuer die Editor-Verdrahtung (Continue in VS Code, Cursors kostenlose Stufe) siehe den Cursor + DeepSeek + VS Code Guide β€” dieser Guide wiederholt das nicht.

2.1 Lokale Runtime mit Ollama (am einfachsten)​

Der schnellste Weg fuer eine Maschine. Installiere Ollama und ziehe dann ein DeepSeek-Coder-Modell:

ollama run deepseek-coder:6.7b

Die Ollama-Bibliothek stellt diese DeepSeek-Coder-Tags bereit:

  • deepseek-coder:1.3b
  • deepseek-coder:6.7b
  • deepseek-coder:33b

Ollama bedient einen HTTP-Endpunkt unter http://localhost:11434 und stellt ausserdem einen OpenAI-kompatiblen Pfad unter http://localhost:11434/v1 bereit, sodass die meisten Tools und SDKs ohne eigenen Code damit sprechen koennen.

Schneller Smoke-Test
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-coder:6.7b",
"messages": [{"role": "user", "content": "Write a Python function that reverses a linked list."}]
}'

Wenn du JSON mit einem Codeblock darin zurueckbekommst, laeuft dein lokales Modell.

2.2 Selbst gehosteter Server mit vLLM (skaliert)​

Wenn ein Laptop nicht reicht β€” groessere Modelle, ein gemeinsames Team-Backend oder das Routing vieler Tools zu einem Endpunkt β€” nutze vLLM, das einen OpenAI-kompatiblen Server bereitstellt:

vllm serve deepseek-ai/deepseek-coder-6.7b-instruct

Das gibt dir einen Endpunkt wie http://your-server:8000/v1, der sich wie die OpenAI-API verhaelt. Jeder OpenAI-kompatible Client β€” VS-Code-Erweiterungen, Codex-artige und Claude-Code-artige Tools, deine eigenen Apps β€” kann darauf zeigen.

Schlussfolgerung, keine Hardware-Garantie

Das 33B-Modell braucht ernsthaften GPU-Speicher (denk an eine Karte mit viel VRAM oder Multi-GPU, besonders bei hoeherer Praezision). Das 6.7B-Modell ist die realistische "laeuft auf einer einzelnen anstaendigen GPU"-Wahl. Der genaue VRAM-Bedarf haengt von Quantisierung und Kontextlaenge ab β€” benchmarke auf deiner eigenen Hardware, statt einer Tabelle zu vertrauen.

2.3 DeepSeeks gehostete API (keine Hardware)​

Wenn du nichts selbst betreiben willst, bietet DeepSeek eine kostenpflichtige, OpenAI-kompatible API. Das ist die am wenigsten private Option β€” deine Prompts und dein Code verlassen dein Netzwerk β€”, also waege sie gegen deine Anforderungen an den Umgang mit Daten ab, bevor du etwas Sensibles sendest.


3. Welche Variante solltest du tatsaechlich betreiben?​

Zwei unabhaengige Entscheidungen: Groesse und Base vs. Instruct.

3.1 Waehle eine Groesse​

Schlussfolgerung aus der Modellgroesse, kein Hersteller-SLA
GroesseWofuer du sie nutzt
1.3BSmoke-Tests, schwache Laptops, nur Autocomplete, sehr niedrige Latenz
6.7BDie realistische lokale Baseline β€” gute Qualitaet, bescheidene Hardware
33BHoechste Qualitaet, braucht starke GPU-Hardware oder einen Server

Wenn du unsicher bist, starte bei 6.7B und gehe nur hoch, wenn die Qualitaet der Engpass ist, oder runter, wenn es die Latenz ist.

3.2 Base vs. Instruct β€” das ist wichtig​

Das ist der Teil, den die Leute falsch machen.

  • Nutze -instruct, wenn du mit dem Modell im Chat sprichst: "refaktoriere das", "erklaer diesen Stack-Trace", "schreib Tests fuer diese Funktion". Das willst du fuer ein Editor-Chat-Panel oder einen Agenten.
  • Nutze -base, wenn du rohe Vervollstaendigung oder Fill-in-the-Middle ohne konversationelle Huelle willst β€” Inline-Autocomplete, Code-Infilling oder dein eigenes Prompting-Geruest.

Ein haeufig starkes Setup sind zwei Modelle gleichzeitig: ein kleines Base-Modell fuer schnelle Inline-Vervollstaendigung und ein groesseres Instruct-Modell fuer das Chat-/Agenten-Panel.


4. Die besten Ergebnisse erzielen​

4.1 Nutze Fill-in-the-Middle (FIM) zur Vervollstaendigung​

Die offizielle Seite hebt Infilling und Vervollstaendigung auf Projektebene explizit als Kernfaehigkeiten hervor β€” das Modell wurde darauf trainiert, eine Luecke zu fuellen, wenn Code auf beiden Seiten des Cursors gegeben ist, nicht nur vom Ende aus weiterzuschreiben. Genau das macht es stark fuer Inline-Autocomplete.

Nutze das exakte FIM-Token-Format aus dem Repo

FIM funktioniert nur, wenn du Praefix/Suffix/Luecke in DeepSeek Coders spezifische Sondertokens einbettest. Die exakten Token-Strings sind im offiziellen Repository definiert β€” kopiere sie von dort statt aus dem Gedaechtnis, denn falsche Delimiter verschlechtern den Output stillschweigend. Die meisten Editor-Erweiterungen (z. B. Continue) erledigen das fuer dich, wenn du das richtige Template waehlst; du musst dich vor allem darum kuemmern, wenn du dein eigenes Vervollstaendigungs-Geruest baust.

4.2 Fuettere es mit echtem Kontext​

Das 16K-Fenster reicht fuer Multi-File-Kontext aus, und genau dort soll DeepSeek Coder glaenzen. Praktische Gewinne:

  • Fuege die tatsaechlich umgebende(n) Datei(en) ein, nicht nur die eine Funktion.
  • Nimm relevante Typdefinitionen, Interfaces und Aufrufstellen mit auf, damit es zu deiner Codebasis passt, statt APIs zu erfinden.
  • Bei "schreib Tests fuer X" gib ihm sowohl X als auch einen existierenden Test, damit es deine Test-Konventionen kopiert.

4.3 Prompte das Instruct-Modell wie einen Senior​

  • Sei explizit bei Sprache, Framework-Version und Constraints ("PHP 8.3, Laravel 11, keine Eloquent-Raw-Queries").
  • Bitte um eine Sache pro Runde; lange Multi-Task-Prompts liefern matschigeren Output als eine fokussierte Sequenz.
  • Wenn es von deinen Konventionen abweicht, korrigiere mit einem konkreten Beispiel, statt die Regel abstrakt zu wiederholen.

4.4 Stimme das Sampling ab​

  • Halte die Temperatur fuer Code niedrig (β‰ˆ0–0.3). Hohe Temperatur bringt dir kreative Prosa und fehlerhaften Code.
  • Setze eine Stop-Sequenz, wenn du innerhalb einer groesseren Struktur vervollstaendigst, damit es nicht ueber die Grenze hinauslaeuft, die dir wichtig ist.

4.5 Pruefe den Output immer​

DeepSeek Coder produziert selbstbewussten, plausiblen und manchmal falschen Code β€” wie jedes Code-Modell. Der Trainingsmix mit 87 % Code macht es fluessig, nicht unfehlbar. Behandle jeden Vorschlag als Entwurf, der zu pruefen ist, besonders bei sicherheitssensiblen Pfaden, Randfaellen und allem, was echte Daten beruehrt.


5. Empfohlene Setups​

5.1 Einzelner Entwickler, guenstig und lokal​

Ollama + deepseek-coder:6.7b  (instruct for chat)
+ a small base model for inline completion

Keine Token-Rechnungen, vollstaendig lokal, gute taegliche Qualitaet.

5.2 Team, gemeinsames Backend​

vLLM serving a DeepSeek Coder model on a GPU box
β†’ OpenAI-compatible endpoint
β†’ every developer's editor + internal tools point at it

Ein Modell zu pflegen, konsistentes Verhalten im ganzen Team, Code verlaesst nie deine Infrastruktur.

5.3 Null Infrastruktur​

DeepSeek hosted API

Am schnellsten zu starten; akzeptiere, dass Prompts und Code dein Netzwerk verlassen.


6. Fazit​

  • Was es ist: eine Open-Weight-Code-Modellfamilie (1.3B–33B, Base + Instruct), Training mit 2T Tokens, 16K Kontext, starke veroeffentlichte Code-Benchmarks, offen und kostenlos fuer kommerzielle Nutzung laut Projektseite.
  • Wie du es hostest: Ollama fuer eine Maschine, vLLM fuer einen Team-Server, die DeepSeek API, wenn du keine Hardware willst.
  • Wie du es gut nutzt: passe Base-vs.-Instruct an die Aufgabe an, setze auf Fill-in-the-Middle fuer die Vervollstaendigung, fuettere es mit echtem Multi-File-Kontext, halte die Temperatur niedrig und pruefe alles.

Fuer die Editor-Seite dieser Geschichte β€” Cursors kostenlose Stufe, Continue in VS Code und die Self-Hosting-Abwaegungen β€” gehe zum Cursor + DeepSeek + VS Code Guide.


Quellen​