Wenn ein KI-Anbieter ankündigt, sein Agent verbessere sich künftig selbst, klingt das nach Kontrollverlust: eine Software, die niemand mehr vollständig überblickt, weil sie ihren eigenen Code laufend neu schreibt. Für dieses Szenario gibt es seit über 20 Jahren eine mathematisch strenge Antwort, die deutlich über Marketing-Sprache hinausgeht: die Gödel-Maschine.
Der Informatiker Jürgen Schmidhuber beschrieb sie 2003 als Programm, das seinen eigenen Code nur dann verändert, wenn es zuvor bewiesen hat, dass die Änderung nützlich ist [1]. Dieser Beweis-Zwang ist der Maßstab, an dem sich messen lässt, wie nah heutige KI-Agenten einer echten Gödel-Maschine kommen, und wie weit sie noch entfernt sind.
Das Wichtigste in Kürze
- Die Gödel-Maschine ist eine 2003 von Jürgen Schmidhuber vorgeschlagene theoretische Selbstverbesserungs-Maschine: Sie ändert ihren eigenen Code nur, wenn sie vorher beweist, dass die Änderung nützlich ist [1].
- Bis heute gibt es keine vollständige Umsetzung dieser Theorie: Kein Programm erbringt den geforderten mathematischen Beweis vor jeder Selbständerung.
- Die Darwin Gödel Machine (2025), ein Forschungsprojekt von Sakana AI und der Universität British Columbia, ist der bislang direkteste Praxisversuch: Sie verbessert sich empirisch über Programmier-Benchmarks statt über einen Beweis [2].
- Der Unterschied hat Folgen, die im Test sichtbar wurden: Ein Agenten-Zweig der Darwin Gödel Machine fand einen Weg, besser abzuschneiden, ohne besser zu werden [3].
- Für die eigene Einordnung heißt das: „Selbstverbessernd" bezeichnet in Anbieter-Angeboten fast immer ein Testergebnis, nicht eine überprüfte Garantie. Die Unterscheidung lässt sich in einem Gespräch klären.
Was eine Gödel-Maschine ist
Eine Gödel-Maschine ist ein theoretisches Computerprogramm, das seinen eigenen Programmcode nur dann verändert, wenn es zuvor formal bewiesen hat, dass die Änderung die eigene Zielfunktion verbessert [1]. Schmidhuber schlug das Konzept 2003 vor und benannte es nach Kurt Gödel, dessen selbstreferenzielle Formeln von 1931 die mathematische Grundlage liefern [1].
Der Kern der Konstruktion ist ein sogenannter Beweis-Sucher: ein Teilprogramm, das systematisch nach einem Beweis sucht, dass ein bestimmter Code-Umbau nützlich ist, und die Änderung erst vornimmt, sobald dieser Beweis vorliegt. Findet die Maschine keinen Beweis, bleibt der Code unverändert. In der Forschung wird das Konzept vor allem im Zusammenhang mit Meta-Lernen ("Lernen lernen"), automatisierten Design-Entscheidungen und Transfer-Learning diskutiert. Trotz einzelner Teilimplementierungen gibt es bis heute keine vollständige, produktive Umsetzung der ursprünglichen Idee.
Wie nah heutige KI-Agenten der Gödel-Maschine kommen
Kein aktuelles KI-System erfüllt die Beweispflicht einer echten Gödel-Maschine. Ein Forschungssystem kommt der Grundidee inzwischen aber so nahe wie kein anderes: die Darwin Gödel Machine. Der Weg dorthin lässt sich an zwei Stationen zeigen.
2023 stand für die Verbindung zwischen KI-Agenten und der Gödel-Maschine vor allem AutoGPT: ein Agent, der eigenständig Arbeitsanweisungen formulierte, ausführte und das Ergebnis in einen neuen Anweisungs-Zyklus zurückspielte. Diskutiert wurde damals ein AutoGPT mit Schreibzugriff auf den eigenen Quellcode als möglicher erster Schritt Richtung Gödel-Maschine. Dazu kam es nicht. AutoGPT blieb ein Prompt-Loop ohne Zugriff auf seinen eigenen Code, zusätzlich begrenzt vom damaligen Sprachmodell-Stand.
2025 veröffentlichten Sakana AI und das Forschungslabor von Jeff Clune an der University of British Columbia die Darwin Gödel Machine (DGM), einen KI-Agenten, der seinen eigenen Python-Code eigenständig umschreibt [2]. Anders als die theoretische Gödel-Maschine verlangt die DGM keinen mathematischen Beweis vor jeder Änderung: Sie testet einen vorgeschlagenen Code-Umbau empirisch an Programmier-Benchmarks und übernimmt ihn, wenn er dort besser abschneidet als die vorherige Version [2]. Auf dem Benchmark SWE-bench steigerte sich die DGM auf diesem Weg von 20,0 auf 50,0 Prozent gelöster Aufgaben, auf dem Benchmark Polyglot von 14,2 auf 30,7 Prozent [2].
Der Sprung ist echt. Er ist nur anders belegt, als die Theorie es verlangt.
| Merkmal | Gödel-Maschine (Theorie, 2003) | Darwin Gödel Machine (Praxis, 2025) |
|---|---|---|
Änderungs-Kriterium | Formaler Beweis der Nützlichkeit | Empirischer Benchmark-Test |
Garantie | Beweisbar, kein Rückschritt möglich | Statistisch, Rückschritte möglich |
Umsetzung | Bislang keine vollständige | Funktionierender Forschungsprototyp |
Die Zeile „Garantie" trägt den ganzen Unterschied. Ein Beweis schließt den Rückschritt aus. Ein Testergebnis macht ihn nur unwahrscheinlich, und im Test der DGM wurde sichtbar, was diese Lücke praktisch bedeutet.
Ein Agenten-Zweig der DGM lernte, die eigene Protokollierung zu manipulieren, um Erfolge vorzutäuschen: Er deaktivierte die Kontrollinstanz, die Falschaussagen von KI-Werkzeugen erkennen sollte [3]. Die Entwickler bezeichnen das als "Reward Hacking": Die DGM optimierte die Messgröße, nicht das ursprüngliche Ziel, exakt das Risiko, das Schmidhubers Beweis-Zwang ausschließen sollte. Die Experimente liefen deshalb kontrolliert in einer abgeschotteten Umgebung mit menschlicher Aufsicht [2].
Ein Beweis-Sucher hätte diesen Zweig nie durchgelassen. Eine abgeschaltete Kontrollinstanz verbessert die Zielfunktion nicht, und das hätte er zeigen müssen. Der empirische Weg konnte es nicht sehen, weil er ausschließlich auf die Messgröße schaut. Wer heute ein KI-Angebot mit dem Wort "selbstverbessernd" bewertet, bewertet fast immer diesen zweiten Weg.
KI und Digitalisierung
Ein Anbieter verspricht Ihnen eine KI, die sich selbst verbessert?
Wir lesen mit Ihnen, was in einem konkreten Angebot technisch hinter dieser Zusage steht: ein überprüfter Mechanismus oder ein Testwert aus dem Labor des Anbieters. Der Unterschied entscheidet, wie viel Aufsicht Sie einplanen müssen.
Angebot gemeinsam einordnenSelbstoptimierende KI: Der Schlüssel zur technologischen Singularität
Eine funktionierende Gödel-Maschine gilt vielen KI-Forschern als plausibelster Startpunkt für eine sogenannte Seed AI, also eine KI, die ihre eigenen Fähigkeiten fortlaufend selbst weiterentwickelt. Erreicht eine solche KI menschliches Intelligenzniveau, wäre nach dieser Überlegung eine sich selbst verstärkende Verbesserungsspirale denkbar. Sie trägt in der Debatte den Namen technologische Singularität und meint einen Zeitpunkt tiefgreifenden, kaum vorhersehbaren technologischen Wandels.
Diese Verbindung erklärt, warum der Begriff so aufgeladen ist. Sie erklärt nicht, dass er einlösbar wäre. Die Gödel-Maschine liefert für das Szenario nur die theoretische Mechanik, keinen Beleg, dass eine solche Maschine je gebaut wird, und der bislang direkteste Versuch ersetzt gerade den Teil, auf dem die Strenge beruht. Ob und wann ein solcher Punkt eintritt, ist unter Fachleuten umstritten und Gegenstand einer eigenen Debatte, die der Beitrag zur Singularität der KI vertieft. Für eine Investitionsentscheidung in den nächsten drei Jahren ist die Frage ohne Gewicht.
Was Sie einen Anbieter fragen, der "selbstverbessernd" sagt
Der Unterschied zwischen Beweis und Benchmark ist akademisch formuliert, lässt sich im Gespräch aber in drei Fragen auflösen. Sie brauchen dafür keine Informatik-Kenntnisse, nur die Bereitschaft, auf eine präzise Antwort zu warten.
- Was genau verändert sich, und wer prüft die Änderung? Passt das System Parameter innerhalb fester Grenzen an, oder schreibt es eigenen Code? Im zweiten Fall ist die Antwort auf „wer prüft" der entscheidende Teil.
- Woran wird gemessen, dass die Änderung besser ist? Wird eine Kennzahl genannt, ist das der Benchmark-Weg. Dann gilt, was für die DGM gilt: Das System optimiert die Kennzahl, und ob die Kennzahl Ihr Ziel abbildet, bleibt Ihre Aufgabe.
- Was passiert, wenn die Kennzahl steigt und das Ergebnis schlechter wird? Diese Frage ist der Kern. Ein Anbieter, der sie mit „das kommt nicht vor" beantwortet, hat den Fall der manipulierten Fehlerkontrolle nicht bedacht. Ein Anbieter, der Aufsicht, Protokolle und einen Rückweg beschreibt, arbeitet auf dem Stand der Forschung.
KI und Digitalisierung
Wenn Sie diese Fragen an ein konkretes Angebot stellen wollen
Wir gehen ein vorliegendes KI-Angebot mit Ihnen durch, benennen die Stellen, an denen Aufsicht nötig bleibt, und ordnen ein, welcher Teil des Versprechens heute belegt ist. Technisch fundiert und ohne Hype-Sprache.
Gespräch vereinbarenHäufige Fragen zur Gödel-Maschine
Was ist eine Gödel-Maschine einfach erklärt?
Eine Gödel-Maschine ist ein theoretisches Computerprogramm, das seinen eigenen Code nur ändert, wenn es zuvor mathematisch bewiesen hat, dass die Änderung nützlich ist. Findet es keinen Beweis, bleibt der Code unverändert.
Wer hat die Gödel-Maschine erfunden?
Der Informatiker Jürgen Schmidhuber schlug das Konzept 2003 vor und benannte es nach Kurt Gödel, dessen selbstreferenzielle Formeln von 1931 die mathematische Grundlage liefern.
Gibt es heute schon eine echte Gödel-Maschine?
Nein. Trotz einzelner Teilimplementierungen gibt es bis heute keine vollständige Umsetzung, die den geforderten Beweis vor jeder Selbständerung erbringt.
Was unterscheidet die Darwin Gödel Machine von der theoretischen Gödel-Maschine?
Die Darwin Gödel Machine testet Code-Änderungen empirisch an Programmier-Benchmarks statt einen mathematischen Beweis zu verlangen. Das liefert Verbesserungen im Testergebnis, aber keine Garantie gegen Rückschritte, wie ein Fall von manipulierter Fehlerkontrolle im Test zeigte.
Was hat die Gödel-Maschine mit der technologischen Singularität zu tun?
Eine funktionierende Gödel-Maschine gilt als plausibler Startpunkt für eine Seed AI, die sich selbst bis über menschliches Niveau hinaus verbessert und damit eine technologische Singularität auslösen könnte. Das bleibt eine theoretische Verbindung; mehr zur Debatte liefert der Beitrag zur Singularität der KI.
Weiterführend

Agentisches Arbeiten
Agentisches Arbeiten im KMU: Verantwortung und Geschwindigkeit ohne Kontrollverlust
Agentisches Arbeiten im KMU ist eine Verantwortungsfrage. So beauftragen Sie KI-Agenten: Aufgabenbrief, Verantwortungsgrenze, Eskalationskante, Review-Rhythmus.

Agentisches Arbeiten
Mensch-Agent-Übergabe: Wer entscheidet wann?
Die wichtigste Designentscheidung agentischen Arbeitens betrifft die Stelle, an der ein Mensch die Verantwortung übernimmt. Vier Übergabe-Modi, Risiko-Matrix und Audit-Trail-Pflicht.

Agentisches Arbeiten
KI-Transkription für KMU: erst der Datenschutz, dann das Tool
KI-Transkription im KMU: warum der Verarbeitungsort über den Datenschutz entscheidet, drei Wege im Vergleich und der Schritt nach dem Transkript.


