WissenClaude Code & Vibe Coding
Woran du eine falsche Claude Code Antwort erkennst
Claude Code klingt bei einer erfundenen Bibliothek genauso sicher wie bei einer echten Lösung. Woran du eine falsche Antwort erkennst, bevor sie in deinem Code landet.
Ein Kollege, der auf jede Frage sofort eine Antwort hat und dir dabei nie sagt, wie sicher er sich eigentlich ist. Genau das ist die Grundeigenschaft eines Sprachmodells wie Claude: es klingt bei einer erfundenen Programmbibliothek genauso überzeugt wie bei einer echten Lösung.
Kurz gesagt
Eine falsche Claude Code Antwort klingt nicht anders als eine richtige, das ist der Kern des Problems. Erkennbar wird sie an konkreten Prüfpunkten statt am Ton: Existiert das genannte Paket wirklich, stimmt der Befehl mit der aktuellen Dokumentation überein, laufen die Tests durch, und bleibt die Aussage bei einer zweiten, unabhängigen Nachfrage gleich. Wer nur auf die Selbstsicherheit der Antwort achtet, merkt den Fehler erst im fertigen Code.
Warum das Modell so überzeugt falsch liegt
Claude sagt bei jeder Antwort das wahrscheinlichste nächste Wort voraus, gestützt auf Trainingsdaten und den bisherigen Gesprächsverlauf. Es prüft dabei nicht in einer Liste nach, ob eine Bibliothek oder eine Programmierschnittstelle wirklich existiert, es erzeugt einen Namen, der plausibel klingt. Genau das nennt die Forschung Halluzination: eine Aussage, die sich stimmig anfühlt, aber nicht überprüft wurde. Die bislang größte Untersuchung dazu, vorgestellt beim USENIX Security Symposium 2025, hat 576.000 Codebeispiele von 16 verschiedenen Modellen ausgewertet. Rund 19,7 Prozent der empfohlenen Softwarepakete existierten überhaupt nicht, bei quelloffenen Modellen im Schnitt 21,7 Prozent, bei kommerziellen Modellen etwa 5,2 Prozent.
Die konkreten Warnsignale
Ein paar Muster, bei denen du genauer hinsehen solltest, statt der Antwort einfach zu vertrauen:
- Ein Paketname oder eine Bibliothek, die du noch nie gehört hast. Kurz auf npm, PyPI oder in der offiziellen Dokumentation nachschlagen, bevor du sie installierst.
- Code, der auffällig glatt wirkt. Keine Fehlerbehandlung, keine Randfälle, jede Zeile scheint perfekt zu passen. Genau das ist typisch für einen erfundenen, nie wirklich durchdachten Lösungsweg.
- Eine Zahl oder ein Fakt ohne Quelle. Wenn Claude eine konkrete Angabe macht, etwa zu einem Limit, einem Preis oder einer Frist, aber keine Quelle nennt, ist das ein Grund nachzufragen.
- Ein Widerspruch zu einer früheren Aussage in derselben Session. Wenn sich die Antwort auf dieselbe Frage im Verlauf ändert, war mindestens eine der beiden Versionen geraten.
Eine Untersuchung der Cloud Security Alliance von Juli 2025 verschärft das Problem zusätzlich: 62 Prozent des geprüften, KI-generierten Codes enthielten Design- oder bekannte Sicherheitsfehler, obwohl er lauffähig war. Kompilieren und grüne Tests sind also kein Beweis für Korrektheit, nur ein erster Filter.
Wie du systematisch gegenprüfst
Verlass dich nicht auf dein Bauchgefühl beim Lesen, sondern auf feste Prüfschritte. Lies den Diff wirklich, bevor du committest, lass die Tests tatsächlich laufen statt sie nur zu überfliegen, und schau bei jedem unbekannten Paketnamen einmal kurz in die offizielle Dokumentation. Bei wichtigen Entscheidungen hilft eine zweite, unabhängige Nachfrage als Gegenprobe: Stell dieselbe Frage neu, ohne auf den bisherigen Verlauf zu verweisen. Weicht die Antwort ab, war die erste vermutlich geraten. Die Permissions helfen an dieser Stelle nur begrenzt, sie verhindern eine unerwünschte Aktion, aber nicht eine falsche, plausibel klingende Information.
Ich denke, das Missverständnis ist oft, Halluzination als seltenen Ausrutscher zu behandeln statt als eingebaute Eigenschaft. Ein Sprachmodell ist kein Nachschlagewerk mit Fehlerquote nahe null, es ist ein Textvorhersagesystem, das gelegentlich falsch liegt und das nie zugibt. Wer das einmal verinnerlicht hat, liest Antworten anders, nicht misstrauischer insgesamt, aber gezielter an den Stellen, wo ein Fehler teuer würde.
Quellen: We Have a Package for You! (USENIX Security 2025) · Understanding Security Risks in AI-Generated Code (Cloud Security Alliance)
Häufige Fragen
Warum klingt eine falsche Claude Code Antwort genauso sicher wie eine richtige?
Ein Sprachmodell sagt das wahrscheinlichste nächste Wort voraus, es schlägt nicht in einer Datenbank nach, ob eine Bibliothek wirklich existiert. Der Tonfall bleibt deshalb bei einer erfundenen Antwort identisch zu dem bei einer korrekten.
Wie oft erfindet ein Sprachmodell beim Programmieren tatsächlich etwas?
In der bislang größten Untersuchung dazu waren rund 19,7 Prozent der von 16 Modellen empfohlenen Softwarepakete komplett erfunden, bei quelloffenen Modellen deutlich häufiger als bei kommerziellen.
Reicht es, wenn der Code kompiliert und die Tests grün sind?
Nein. Eine Untersuchung der Cloud Security Alliance fand Design- oder Sicherheitsfehler in 62 Prozent des geprüften, KI-generierten Codes, obwohl er lauffähig war. Grün heißt nicht geprüft.
Was mache ich, wenn ich mir bei einer Antwort unsicher bin?
Stell dieselbe Frage in einer neuen, unabhängigen Anfrage noch einmal, ohne den bisherigen Verlauf zu erwähnen. Kommt eine andere Antwort zurück, war die erste vermutlich geraten statt gewusst.
Willst du das bei dir umsetzen?
In der Community zeige ich, was bei mir hält. Im Erstgespräch schauen wir uns dein Vorhaben konkret an.