Kimi AI: Funktionsweise, Modelle und Plattformen im Überblick

Kimi AI ist ein fortschrittlicher KI-Assistent des chinesischen Unternehmens Moonshot AI, der sich durch extrem lange Kontextfenster und starke Coding-Fähigkeiten auszeichnet. Seit der ersten Version 2023 mit 128.000 Token Kontext hat sich die Plattform rasant weiterentwickelt.

Am 16. Juli 2026 erschien Kimi K3 mit 2,8 Billionen Parametern und einem 1-Million-Token-Kontextfenster, das dir ermöglicht, hunderte Seiten Dokumente zu verarbeiten und komplexe Programmieraufgaben über mehrere Stunden autonom durchzuführen.

Eine junge ostasiatische Frau sitzt an einem Schreibtisch in einem hellen Büro und lächelt leicht.

Du findest bei Kimi nicht nur einen klassischen Chatbot, sondern ein ganzes Ökosystem aus verschiedenen Modellen und Funktionen. Von der agentenbasierten Recherche über Website-Erstellung bis zur Tabellenkalkulation bietet dir die Plattform Werkzeuge für viele Arbeitsschritte.

Moonshot AI verfolgt dabei eine offene Strategie und veröffentlicht viele Modelle als Open Source unter modifizierter MIT-Lizenz.

Mit monatlich über 36 Millionen aktiven Nutzern gehört Kimi zu den führenden KI-Assistenten aus China. In diesem Artikel erfährst du, wie sich die verschiedenen Modellversionen unterscheiden, welche Benchmarks Kimi erreicht und wie du die APIs für deine eigenen Projekte nutzen kannst.

Entwicklung und Architektur von Kimi

Ein modernes Büro mit mehreren Personen, die an Computern und digitalen Bildschirmen arbeiten, auf denen komplexe Diagramme und Daten zu sehen sind.

Moonshot AI hat seit 2023 eine beeindruckende Entwicklungsreihe von Large Language Models aufgebaut, die von Kimi K1.5 bis zum neuesten Kimi K3 reicht. Die Modelle nutzen moderne Mixture-of-Experts-Architekturen mit immer größeren Parametermengen.

Die Rolle von Moonshot AI

Moonshot AI ist ein Pekinger Start-up mit einer Bewertung von 20 Milliarden US-Dollar. Das Unternehmen wird von der Alibaba Group und Tencent unterstützt.

Die Firma betreibt die offizielle Plattform unter moonshot.ai und kimi.com. Dort kannst du auf verschiedene Modelle zugreifen und technische Spezifikationen einsehen.

Moonshot AI hat sich auf Large Language Models mit besonders langen Kontextfenstern spezialisiert. Die ersten Versionen von Kimi unterstützten bereits 128.000 Tokens Context.

Das Unternehmen setzt stark auf Open-Source-Strategien. Die Kimi K2-Familie wurde im Juli 2025 mit offenen Gewichten veröffentlicht.

Modellentwicklung von Kimi K1.5 bis Kimi K3

Die erste Version Kimi K1.5 erschien 2023 und machte sich durch große Kontextfenster bekannt. Das Modell konnte lange Dokumente und Gespräche verarbeiten.

Im Juli 2025 folgte die Kimi K2-Familie als Open-Source-Modell. Diese Generation nutzte eine 1T-Parameter-MoE-Architektur mit 384 Experten und 32B aktiven Parametern. Spätere Versionen wie Kimi K2.6 und Kimi K2.7 Code erweiterten die Fähigkeiten für Coding und Agent-Workflows mit bis zu 256K Tokens Context.

Kimi K3 wurde am 16. Juli 2026 als neues Flagship Model vorgestellt. Das Modell bietet 2,8 Billionen Parameter und ein 1-Million-Token-Kontextfenster. Der „Thinking Mode“ ist bei K3 permanent aktiviert, und die vollständigen Open Weights sollen bis 27. Juli 2026 verfügbar werden.

Mixture-of-Experts und Parametergrößen

Die Kimi-Modelle basieren auf der Mixture-of-Experts-Architektur (MoE). Bei diesem Ansatz werden nur ausgewählte Experten pro Token aktiviert, statt alle Parameter zu nutzen.

Kimi K3 verwendet 896 Experten, von denen pro Token nur 16 aktiv werden. Diese Struktur macht die Berechnung effizienter, ohne die Modellleistung zu opfern.

Die 2,8 Billionen Parameter bedeuten nicht, dass jedes Token durch alle Parameter läuft. Tatsächlich arbeitet das Modell mit einer deutlich kleineren Zahl aktiver Parameter pro Verarbeitungsschritt.

Zusätzlich nutzt K3 neue Technologien wie Kimi Delta Attention und Attention Residuals. Diese Mechanismen verbessern die Kontextverarbeitung und Genauigkeit bei langen Eingaben.

Leistungsmerkmale und Benchmarks

Mehrere Personen analysieren in einem modernen Büro Daten auf großen Bildschirmen mit Diagrammen und Leistungskennzahlen.

Kimi K3 bietet dir ein 1-Million-Token-Kontextfenster und erreicht Spitzenwerte in Coding- und Reasoning-Benchmarks. Das Modell wurde speziell für mehrstufige Aufgaben und agentenbasierte Workflows optimiert.

Kontextfenster und Langzeitausführung

Das 1M-Token-Kontextfenster von Kimi K3 ermöglicht dir die Verarbeitung extrem langer Dokumente oder mehrstufiger Prozesse ohne Informationsverlust. Bei Long-Horizon-Coding-Aufgaben wie SWE-Bench Pro empfiehlt Moonshot AI bis zu 256.000 Token maximale Ausgabelänge mit bis zu 300 Schritten pro Task.

Du kannst komplette Codebases analysieren oder umfangreiche Recherche-Aufgaben durchführen, ohne den Kontext manuell aufteilen zu müssen. Bei agentenbasierten Benchmarks wie BrowseComp oder DeepSearchQA unterstützt K3 bis zu 256.000 Token Gesamtlänge über mehrere Tool-Aufrufe hinweg.

Die Architektur nutzt eine 2,8T-Parameter-MoE-Struktur (Mixture of Experts), die auch bei langen Kontexten stabile Performance liefert. Für Multi-Hop-Search-Aufgaben solltest du Context-Management-Mechanismen einsetzen, um die Anzahl der Tool-Calls bei sehr langen Sessions zu optimieren.

Benchmarks und Vergleich mit OpenAI & Anthropic

Laut BenchLM erreicht Kimi K3 80,96/100 Punkte und Platz 4 von 200 Modellen auf der öffentlichen Rangliste. Das platziert K3 vor Claude Opus 4.8 im Artificial Analysis Intelligence Index, allerdings bleiben Modelle wie GPT-5.6 Sol und Claude Fable 5 in bestimmten Kategorien führend.

Bei Coding-Benchmarks zeigt K3 starke Ergebnisse: Terminal-Bench 2.0 (Terminus-2) wird mit 256.000 max_tokens und 3 Durchläufen getestet, SWE-Bench Verified empfiehlt 5 Runs bei gleicher Token-Grenze. AIME 2026 erreicht K3 mit 32 Durchläufen à 96.000 Tokens pro Run, HMMT 2026 nutzt identische Parameter.

Arena.ai-Daten und unabhängige Vergleiche zeigen, dass K3 bei Reasoning-Tasks konkurrenzfähig ist, während Anthropics und OpenAIs neueste Modelle in bestimmten Multimodal-Benchmarks noch Vorteile haben. GPQA-Diamond testet du am besten mit 8 Runs und 96.000 Tokens.

Agent Swarm und Agentic Workflows

Kimi K3 wurde explizit für agentenbasierte Workflows entwickelt. Bei Toolathlon, MCPMark und Claw Eval empfiehlt Moonshot 4 Runs mit 48.000 Tokens pro Schritt und maximal 300 Steps insgesamt.

Der Thinking Mode ist standardmäßig aktiviert (thinking=enabled) und ermöglicht dir mehrstufige Problemlösungen mit Tool-Aufrufen. Für Agent-Swarm-Szenarien mit parallelen Agenten unterstützt K3 bei HLE-Heavy bis zu 8 parallele Anfragen (parallel n=8) mit 200 maximalen Schritten.

Bei Multi-Step-Tasks wie WideSearch oder APEX-Agents nutzt du temperature=1.0 und top_p=0.95. Das Tool-Choice-Parameter muss auf „auto“ oder „none“ stehen, wenn Thinking Mode aktiv ist – andere Werte führen zu Fehlern.

Für Long-Horizon-Coding in SWE-Bench Multilingual oder SWE-Bench Verified konfigurierst du 32.000 Tokens pro Step bei 256.000 Total-Maximum. Die offizielle $web_search-Integration ist aktuell noch nicht mit K2.5/K2.6 Thinking Mode kompatibel, funktioniert aber mit K3.

Funktionen und Anwendungsgebiete

Kimi AI bietet dir spezialisierte Funktionen für anspruchsvolle Aufgaben wie umfassende Recherchen, professionelle Softwareentwicklung und automatisierte Dokumentenerstellung. Die Plattform kombiniert verschiedene KI-Agenten mit einem 1-Millionen-Token-Kontext-Fenster für komplexe Workflows.

Tiefenrecherche und Websuche

Die Deep Research-Funktion von Kimi durchsucht systematisch mehrere Quellen und erstellt dir strukturierte Berichte zu komplexen Themen. Du gibst ein Thema vor, und der KI-Agent analysiert relevante Informationen aus verschiedenen Perspektiven.

Das System kann mehrere Suchvorgänge parallel durchführen und die Ergebnisse in einem kohärenten Dokument zusammenfassen. Die Web Search-Integration ist derzeit in Überarbeitung und wird für produktive Workflows noch nicht empfohlen (Stand Juli 2026).

Der 1M-Token-Kontext ermöglicht dir die gleichzeitige Verarbeitung umfangreicher Dokumentensammlungen. Du kannst beispielsweise wissenschaftliche Artikel, Marktberichte oder technische Spezifikationen hochladen und übergreifende Analysen erstellen lassen. Das automatische Context Caching beschleunigt wiederholte Anfragen mit ähnlichen Dokumenten-Prefixen.

Codegenerierung und Entwicklung

Kimi K3 ist als Coding Model für langfristige Entwicklungsaufgaben optimiert. Das System kann eigenständig größere Codebases verstehen, Terminal-Tools koordinieren und mehrstufige Engineering-Tasks mit minimaler menschlicher Aufsicht durchführen.

Das spezialisierte K2.7 Code-Modell unterstützt dich bei der präzisen Code-Generierung für verschiedene Programmiersprachen. Der Coding Agent kann Screenshots und visuelles Feedback nutzen, um Workflows in Game Development, Frontend-Engineering und CAD-Anwendungen zu verbessern. Diese Visual Agentic Intelligence ermöglicht dir die Kombination von Software-Engineering und visueller Analyse.

Du kannst das Kimi App-Ökosystem für spezifische Entwickleraufgaben nutzen. Das MoE-Framework mit 896 Experten (16 aktiv pro Anfrage) sorgt für effiziente Ressourcennutzung. Die API unterstützt Structured Output mit json_schema und Tool Calling für die Integration externer Funktionen.

Präsentationen und Dokument-Skills

Kimi Slides generiert dir automatisch professionelle Präsentationen aus Textinhalten oder Dokumenten. Du beschreibst das Thema und die gewünschte Struktur, und das System erstellt formatierte Folien mit passendem Layout.

Die Document to Skills-Funktion extrahiert Wissen aus hochgeladenen Dateien und wandelt es in wiederverwendbare Fähigkeiten um. Kimi Work kombiniert verschiedene KI-Agenten für End-to-End Knowledge Work – von der Recherche über die Dokumentenanalyse bis zur finalen Aufbereitung.

Du kannst mehrere Dokumente gleichzeitig verarbeiten und Cross-Referenzen erstellen lassen. Die Plattform behält den Kontext über längere Arbeitssessions bei, sodass du komplexe Projekte schrittweise aufbauen kannst. Die aktuellen API-Limits setzen max_completion_tokens standardmäßig auf 131.072 Token, konfigurierbar bis 1.048.576 Token für besonders umfangreiche Outputs.

Plattformen, APIs und Integration

Die Kimi-API-Plattform bietet dir über platform.kimi.ai und api.moonshot.ai direkten Zugriff auf alle Kimi-Modelle – darunter das aktuelle Flaggschiff K3 mit 2,8 Billionen Parametern und 1-Million-Token-Kontext. Du kannst die API mit minimalem Aufwand in bestehende Workflows integrieren, da sie vollständig OpenAI-kompatibel ist.

Kimi API und Entwicklerplattform

Du erhältst deine API-Keys über die Kimi Open Platform unter platform.kimi.ai. Die Plattform stellt dir mehrere Endpunkte bereit:

  • Chat Completions (api.moonshot.ai/v1)
  • File-Upload für Dokumente und Multimodal-Analysen
  • Tool Calling (Web Search, Code-Runner, Excel, Memory)
  • Model List zur Auswahl zwischen K3, K2.7 Code und K2.6

Die Developer API unterstützt Textgenerierung, mehrstufige Konversationen und Dateianalyse. Du kannst direkt auf Web Search zugreifen, um deine Anwendungen mit aktuellen Informationen zu versorgen.

Kimi K3 kostet dich 3 USD pro Million Input-Token und 15 USD pro Million Output-Token (Stand 19.07.2026). Die Plattform bietet außerdem spezifische Tools wie Python-Code-Ausführung, JavaScript-Engine (QuickJS) und Unit-Konverter, die du per API-Call aktivierst.

Kompatibilität mit OpenAI SDK & Drittanbietern

Die Kimi API nutzt das OpenAI-API-Format, sodass du mit wenigen Zeilen Code migrieren kannst. Du änderst einfach die Base-URL auf https://api.moonshot.ai/v1 und verwendest deinen Kimi-API-Key.

Unterstützte Integrationen:

  • OpenAI SDK (Python, Node.js, TypeScript)
  • LangChain für Agent-Workflows
  • Hugging Face (Model-Hubs, Inference-APIs)
  • GitHub Actions und Copilot-Alternative-Setups

Die Kompatibilität gilt für Chat-Completions, Streaming, Function-Calling und Embeddings. Du kannst Kimi in bestehende LangChain-Pipelines einbinden, ohne deine Architektur umbauen zu müssen.

Drittanbieter-Tools wie Cursor, Continue oder Windsurf lassen sich direkt konfigurieren – du gibst nur Base-URL und Key ein. Die Region-spezifischen Endpunkte (CN, US, EU) sorgen für niedrige Latenz.

Self-Hosting und Open Weights

Moonshot AI hat angekündigt, die Open Weights für Kimi K3 bis zum 27. Juli 2026 zu veröffentlichen. Du kannst das Modell dann lokal hosten und selbst deployen.

Die bisherigen Modelle (K2.5, K2.6) sind noch nicht als vollständige Open Weights verfügbar. K3 wird das erste Kimi-Modell sein, das du komplett herunterladen und auf eigener Infrastruktur betreiben kannst.

Für Self-Hosting brauchst du:

  • Zugriff auf Hugging Face oder GitHub-Releases (sobald verfügbar)
  • Hardware für 2,8-Billionen-Parameter-MoE (Mixture-of-Experts)
  • Inference-Framework (vLLM, TGI, oder Moonshots eigene Tools)

Da K3 ein MoE-Modell ist, aktiviert es nur Teile seiner Parameter pro Anfrage – das reduziert deinen Speicher- und Compute-Bedarf im Vergleich zu Dense-Modellen. Stand heute (19.07.2026) sind die genauen Hardware-Anforderungen noch nicht offiziell kommuniziert.

Lizenzierung, Open Source und Sicherheit

Moonshot AI verfolgt bei Kimi eine zweispurige Strategie: Die K-Serie (K2, K2.5, K3) erscheint unter offenen Lizenzen, während der API-Dienst proprietär bleibt. Du musst zwischen Modell-Gewichten und Cloud-Nutzung unterscheiden, da jeweils andere Regeln gelten.

Lizenzen (Modified MIT, Proprietär)

Kimi K2 steht unter einer Modified MIT-Lizenz, die dir weitreichende Freiheiten gibt. Du darfst das Modell kommerziell nutzen, anpassen und weiterverbreiten. Die Modifikation betrifft hauptsächlich Haftungsausschlüsse und die Pflicht zur Namensnennung.

Kimi K3 folgt am 27. Juli 2026 mit vollständigen Gewichten ebenfalls unter Modified MIT. Du kannst das 2,8-Billionen-Parameter-Modell dann selbst hosten und für deine Zwecke einsetzen. Die Lizenz erlaubt dir Closed-Source-Derivate, solange du die Original-Urheberrechte beibehältst.

Der API-Zugang über moonshot.ai bleibt hingegen proprietär. Du bindest dich an die Nutzungsbedingungen von Moonshot AI, die sich von der offenen Modelllizenz unterscheiden. Die Preise liegen aktuell bei $3 pro Million Input-Tokens und $15 pro Million Output-Tokens.

Sicherheitsmerkmale und Fehlerbehandlung

Die API liefert strukturierte Fehlercodes bei Problemen. Du erhältst HTTP-Statuscodes wie 400 (fehlerhafte Anfrage), 401 (ungültiger API-Key) oder 429 (Rate Limit überschritten). Jede Fehlerantwort enthält eine detaillierte Nachricht zur Ursache.

Moonshot AI speichert deine Eingaben und hochgeladenen Inhalte für Modellverbesserungen. Die Datenschutzrichtlinie erlaubt das Teilen mit Dienstleistern und verbundenen Unternehmen. Du solltest keine sensiblen Daten eingeben, wenn du strikte Vertraulichkeit benötigst.

Das open-source model selbst bietet dir mehr Kontrolle. Bei selbstgehostetem K2 oder K3 bleiben alle Daten in deiner Infrastruktur. Du implementierst eigene Sicherheitsebenen und Error-Handling-Mechanismen nach deinen Anforderungen.

Rate Limits und Quoten

Moonshot AI setzt Anfragelimits je nach Abo-Stufe. Der kostenlose Zugang beschränkt dich auf wenige Anfragen pro Minute. Bezahlpläne erhöhen diese Grenze deutlich, konkrete Zahlen gibt Moonshot auf moonshot.ai bekannt.

Du erkennst ein überschrittenes Rate Limit am 429-Fehlercode. Die API-Antwort zeigt dir meist, wann du die nächste Anfrage senden darfst. Bei kritischen Anwendungen solltest du Retry-Logik mit exponentiellem Backoff einbauen.

Self-Hosting umgeht diese Beschränkungen komplett. Mit den K2- oder K3-Gewichten setzt du eigene Durchsatzlimits basierend auf deiner Hardware. Du brauchst allerdings erhebliche GPU-Ressourcen – K3 benötigt mehrere High-End-Beschleuniger für Inferenz in vernünftiger Geschwindigkeit.

Produktvielfalt und Nutzungsmöglichkeiten

Moonshot AI bietet dir mit Kimi verschiedene spezialisierte Produkte und Modi für unterschiedliche Anwendungsfälle. Von Coding-Tools über visuelle Agenten bis hin zu verschiedenen Denkweisen kannst du die Plattform flexibel an deine Bedürfnisse anpassen.

Kimi Work, Kimi Code und Kimi App

Kimi Work richtet sich an professionelle Wissensarbeit und unterstützt dich beim Erstellen von Präsentationen, Dokumentenanalyse und komplexen Recherchen. Du kannst hier auf das volle 1-Million-Token-Kontextfenster zugreifen, um große Dokumente zu verarbeiten.

Kimi Code bietet dir spezialisierte Werkzeuge für die Softwareentwicklung. Die Kimi K2.7 Code-Variante konzentriert sich besonders auf Long-Context-Programmierung mit bis zu 256K Tokens. Du kannst über die Kimi Code CLI direkt aus dem Terminal arbeiten und erhältst Unterstützung für mehrere Programmiersprachen.

Die Kimi App steht dir als webbasierte Plattform zur Verfügung und ermöglicht Zugang zu allen Modellvarianten. Du kannst zwischen verschiedenen Kimi-Versionen wählen – von Kimi K2.6 für Standardaufgaben bis zu Kimi K3 für besonders anspruchsvolle Projekte. Die App bietet dir Funktionen wie Web-Suche, Excel-Analyse und Code-Runner direkt in der Oberfläche.

Agentenmodi und Thinking Mode

Der Agent Mode ermöglicht dir, dass Kimi eigenständig mehrere Schritte plant und ausführt. Beim Agent Swarm (verfügbar in K2.5 und höher) kannst du sogar parallele Aufgaben gleichzeitig bearbeiten lassen. Jeder Agent kann dabei auf verschiedene Tools wie Web-Suche, Code-Ausführung oder Excel-Analyse zugreifen.

Der Thinking Mode ist bei Kimi K3 standardmäßig aktiviert und zeigt dir transparent, wie das Modell zu seinen Antworten kommt. Du siehst die Gedankenschritte in Echtzeit, ähnlich wie bei Chain-of-Thought-Reasoning. Das hilft dir besonders bei komplexen mathematischen Problemen oder logischen Fragestellungen, die Argumentation nachzuvollziehen.

Mit Goal-basierten Workflows kannst du dem Agenten ein übergeordnetes Ziel vorgeben. Das System plant dann selbstständig die notwendigen Zwischenschritte und führt sie aus – du musst nicht jeden Schritt einzeln anweisen.

How to Use Kimi: Einstieg und Nutzung

Du startest mit Kimi über die Website oder die API. Für den ersten Zugang registrierst du dich kostenlos und erhältst ein Basiskontingent an Tokens. Die Weboberfläche bietet dir einen Chat-Interface, in dem du direkt deine Anfragen eingibst.

Für Entwickler steht die Kimi API Platform zur Verfügung. Du bindest die API mit wenigen Zeilen Code ein und kannst dann auf K3 mit seinen 2,8 Billionen Parametern zugreifen. Das Pricing liegt bei etwa $3 pro Million Input-Tokens und $15 pro Million Output-Tokens (Stand Juli 2026).

Du kannst Tools explizit aktivieren, indem du sie in deiner Anfrage erwähnst oder in den API-Parametern festlegst. Verfügbare Tools umfassen Web-Search, Memory, Code-Runner, Excel und Fetch. Bei visuellen Aufgaben lädst du einfach Bilder hoch – Kimi K2.5 und höher verarbeiten multimodale Eingaben direkt.