Kimi K3 schlägt Fable 5 im Frontend-Code und fällt bei Mathe krachend durch

KI-News: Kimi K3, 1679, 39 Prozent

Zwei neue Datenpunkte zu Moonshots Kimi K3 sind aufgetaucht, und sie zeigen in entgegengesetzte Richtungen. In der Code Arena Frontend, die Modelle nach menschlichen Präferenzurteilen per Elo-Wertung sortiert, kommt Kimi K3 auf 1679 Punkte. Dahinter Claude Fable 5 mit 1631 und GPT-5.6 Sol mit 1618. Zum ersten überhaupt Mal steht ein chinesisches Modell auf Platz eins dieses Benchmarks, und zwar nicht knapp.

Bei harter Mathematik dreht sich das Bild. Nach Daten von Epoch AI erreicht Kimi K3 auf FrontierMath Tier 4, der schwierigsten Stufe mit Aufgaben auf Expertenniveau, nur rund 39% Genauigkeit. Modelle von OpenAI und Anthropic liegen dort teilweise nahe 90%. Das ist keine Nuance, das ist ein Abstand von mehr als dem Doppelten.

Für Nutzer heißt das vor allem eines: Der Satz »das beste Modell« ist endgültig sinnlos geworden. Wer eine Oberfläche bauen lässt, bekommt bei Kimi K3 offenbar das, was Menschen lieber ansehen. Wer einen Beweis geprüft haben will, ist woanders besser aufgehoben. Dass ein Benchmark auf menschlichem Geschmack beruht und der andere auf nachprüfbaren Lösungen, macht den Vergleich übrigens nicht fairer, sondern nur ehrlicher.

Einschränkung, weil sie hier wirklich zählt: Elo-Wertungen aus Arena-Formaten messen Vorliebe, nicht Korrektheit. Schöner Code ist nicht automatisch richtiger Code, und Frontend-Ergebnisse lassen sich mit Layout-Geschmack leichter gewinnen als mit Logik. Die Zahlen sind trotzdem ein Signal, dass der Abstand zwischen offenen chinesischen Modellen und westlichen Spitzenmodellen je nach Disziplin komplett unterschiedlich aussieht.

Quellen

Ähnliche News

Diese Meldung wurde mit Unterstützung von Claude (Anthropic) recherchiert und verfasst. Inhaltliche Fehler sind möglich. Die verlinkten Quellen ermöglichen eine eigene Prüfung. Fachbegriffe erläutert das Glossar.

Bist du bereit für mehr?

Was sagst du dazu?