flowki@club:~$ Gerade gestartet · sei von Anfang an dabei
$ beitreten
MODELS
NousCoder-14B: Open-Source Coding-Modell mit volltransparenter Trainingsmethode

NousCoder-14B: Open-Source Coding-Modell mit volltransparenter Trainingsmethode

2 min Lesezeit
Rafi GrzonkaRafi Grzonka
TeilenXLinkedInWhatsApp

Offenheit statt Geheimniskrämerei

Nous Research hat mit NousCoder-14B ein Coding-Modell veröffentlicht, das nicht nur technisch überzeugt, sondern auch durch radikale Transparenz besticht. Das 14-Milliarden-Parameter-Modell erreicht 67,87 Prozent Genauigkeit auf LiveCodeBench v6 und wurde in gerade mal vier Tagen mit 48 Nvidia B200 GPUs trainiert.

Der eigentliche Unterschied zur Konkurrenz: Nous Research veröffentlichte nicht nur die Modellgewichte, sondern den kompletten RL-Trainingsstack, Benchmark-Suite und das gesamte Training Harness basierend auf dem Atropos-Framework. Jeder Forscher mit ausreichend Rechenleistung kann die Arbeit reproduzieren oder erweitern — ein in der AI-Industrie seltenes Maß an Offenheit.

Wie 24.000 Aufgaben einen Trainingssprung ermöglichen

Das Training-Verfahren nutzt "verifiable rewards": Das Modell generiert Code, dieser wird gegen Test-Cases ausgeführt, und erhält ein binäres Signal — richtig oder falsch. Die Infrastruktur dafür ist erheblich: Mit Modal laufen parallel sandboxed Executions. Jede der 24.000 Trainingsaufgaben enthält hunderte Test-Cases, die Code-Generierung muss innerhalb von 15 Sekunden und 4 GB RAM korrekt arbeiten.

Eine Technik namens DAPO (Dynamic Sampling Policy Optimization) optimiert den Lernprozess: Trainingsbeispiele, die das Modell entweder vollständig löst oder völlig fehlen, werden aussortiert — sie erzeugen kein nützliches Gradient-Signal.

Zum Vergleich: Trainer Joe Li, selbst früherer Competitive-Programmer, brauchte zwei Jahre und etwa 1.000 Probleme, um seine Codeforces-Rating von 1600 auf 2100 zu verbessern. Das Modell vollbrachte diesen Sprung (vom geschätzten 1600-1750er auf 2100-2200er Range) in 96 Stunden — benötigte aber 24.000 Aufgaben. Menschen bleiben deutlich dateneffizienter.

Das Data-Shortage-Problem

Lis technischer Report offenbart ein fundamentales Problem: NousCoder trainiert auf "einem signifikanten Anteil aller verfügbaren, verifizierbaren Competitive-Programming-Aufgaben in standardisiertem Format". Mit 24.000 Aufgaben hat die RL-Community beim Competitive Programming die Grenze hochwertiger Trainingsdaten erreicht.

Die Konsequenz ist klar: Künftige Durchbrüche bei Code-Modellen hängen von Synthetic Data Generation und dateneffizienteren Architekturen ab. Eine vielversprechende Richtung: Modelle trainieren, selbst lösbare Aufgaben zu generieren — ähnlich Self-Play-Techniken aus Game-Playing-AI. Damit könnte das System seine eigene Trainings-Curriculum erstellen.

Kontext-Fenster und Multi-Turn Feedback

NousCoder startete mit 32.000-Token-Kontext und expandierte auf 40.000. Bei Evaluation zeigten 80.000 Token die besten Ergebnisse. Für die Zukunft identifizierten die Forscher zwei kritische Verbesserungen:

  1. Multi-Turn RL: Aktuell erhält das Modell nur Final-Feedback (bestanden/nicht bestanden). Intermediate-Signale wie Compile-Fehler oder Timeout könnten mehrfaches Iterieren über Problem-Instanzen trainieren.

  2. Response-Length-Kontrolle: Fehlerhafte Lösungen sind durchschnittlich länger — ein Pattern, das bisher nicht gelöst wurde.

Kontext: Die $65-Million-Wette auf Open-Source

Nous Research positioniert sich bewusst gegen Big Tech: Die Paradigm-finanzierte Startup (Seed: $50 Mio. April 2025, insgesamt $65 Mio.) setzt auf offene Modelle, die proprietäre Systeme konkurrieren. Das Unternehmen hat bereits mit Hermes 4 und DeepHermes-3 gezeigt, dass Transparenz und Top-Performance keine Gegensätze sein müssen.

Der NousCoder-Code ist auf Hugging Face unter Apache-2.0-Lizenz verfügbar — eine klare Ansage in Zeiten von Claude Code und proprietären AI-Tools.

Weiterlesen

Aus dem Magazin

Alle Artikel
MODELS

OpenAI stellt GPT-5.6 vor – neue Modell-Familie mit verbesserter Sicherheit

1 min · 10. Juli

MODELS

OpenAI startet GPT-5.6 öffentlich — und präsentiert ChatGPT Work

2 min · 9. Juli

MODELS

GPT-5.6: Intelligenz, die mit deinen Anforderungen wächst

1 min · 9. Juli