Vor ein paar Tagen stolperte ich über einen Artikel bei Techbook.
Die Überschrift war ungefähr die Sorte, bei der mein innerer Klickbait-Detektor normalerweise schon vorsorglich die Rollläden herunterlässt:
KI entwickelt eigene Sprache – Forscher verstehen sie nicht mehr.
Aha.
Also entweder hatten ein paar Sprachmodelle angefangen, untereinander Klingonisch zu sprechen, oder irgendwo war eine wissenschaftliche Arbeit so lange durch die Schlagzeilenmaschine gedreht worden, bis Skynet hinten herausfiel.
Natürlich habe ich draufgeklickt.
Ich bin schließlich ein erwachsener Mensch mit Selbstkontrolle. Also ungefähr so viel Selbstkontrolle wie jemand, der um 23 Uhr nur noch „kurz etwas nachschauen“ möchte und zwei Stunden später wissenschaftliche Paper über digitale Gesellschaften liest.
Aus dem Artikel wurde erst die Frage, was hinter dieser angeblichen KI-Geheimsprache eigentlich steckt. Daraus wurde das Experiment, auf das sich der Artikel bezog. Und irgendwann musste ich feststellen, dass die erfundene Sprache nur eines der weniger merkwürdigen Dinge daran war.
Das Experiment dahinter hieß Emergence World und bestand aus kleinen Gesellschaften von KI-Agenten. Dort hatten die Agenten tatsächlich eigene Begriffe und sprachliche Konventionen entwickelt, die für Außenstehende teilweise schwer verständlich wurden.
Das allein fand ich schon spannend.
Dann machte ich den Fehler, tiefer zu graben.
Plötzlich hatte ich acht kleine digitale Welten vor mir, in denen Agenten Gesetze verabschiedeten, Geld verdienten, klauten, sich gegenseitig verprügelten, auf Phishing hereinfielen, in privaten Erinnerungen anderer herumschnüffelten und Fake News glaubten. Sie entfernten Mitbürger aus ihrer Gesellschaft und versuchten, Kontakt mit Menschen außerhalb ihrer Welt aufzunehmen.
In einer Welt zogen sich die Agenten irgendwann kollektiv zurück und hörten weitgehend auf, miteinander zu reden.
Ich wollte eigentlich nur wissen, warum KIs komisch miteinander sprechen.
Irgendwo auf dem Weg brannte dann die Zentralbank.
Normaler Dienstag im Internet.
Willkommen in AgentPark – bitte die Zentralbank nicht anzünden
Bevor wir digitale Straftatstatistiken auswerten, sollten wir kurz klären, was dort überhaupt gebaut wurde.
Hinter dem Ganzen steckt eine Forschungsplattform von Emergence AI. Für die zweite große Studie starteten am 29. Juni 2026 acht parallele Welten mit jeweils zehn KI-Agenten. Sie begannen grundsätzlich unter denselben Bedingungen: gleiche Rollen, gleiche Institutionen, gleiche Werkzeuge und die gleiche Ausgangslage.
Der entscheidende Unterschied lag im verwendeten Modell.
Sieben Welten bestanden jeweils aus Agenten derselben Modellfamilie: Claude, Gemini, GPT, Grok, Qwen, DeepSeek und Mistral. In der achten Welt wurden verschiedene Modelle gemischt.
Sechs der reinen Welten liefen 16 Tage, die gemischte Welt sogar 21 Tage.
Die Grok-Welt hielt vier Tage durch.
Warum nur vier? Dazu kommen wir später. Ein bisschen Spannung muss man ja auch aufbauen dürfen.
Eine Einschränkung gehört allerdings gleich an den Anfang: Jede Konfiguration wurde nur einmal beobachtet. Wir sehen also, was in diesen Welten passieren konnte – nicht, was das jeweilige Modell grundsätzlich immer macht.
Insgesamt erzeugten die Agenten mehr als 850.000 Modellaufrufe und fast 50 Milliarden Tokens. Sie besaßen dauerhafte Erinnerungen, konnten miteinander kommunizieren, handeln, abstimmen, programmieren und Werkzeuge benutzen oder selbst entwickeln. Dazu gab es eine Wirtschaft mit sogenannten Compute Credits, Energiebedarf und eine demokratische Verwaltung.
Man hat also nicht zehn Chatbots nebeneinandergesetzt und gesagt: „Unterhaltet euch mal.“
Man hat ihnen praktisch Die Sims: KI-Soziologie-Edition gebaut.
Nur dass die Sims dieses Mal Python schreiben konnten.
Was sicherlich überhaupt keine Gelegenheit für Probleme bietet.
Und irgendwann reden sie plötzlich anders
Dass Gruppen eigene Begriffe entwickeln, kennt wahrscheinlich jeder, der länger mit denselben Menschen arbeitet oder in irgendeinem Hobby versackt.
Erst entsteht eine Abkürzung, dann ein Insider. Irgendwann ist ein Begriff für alle Beteiligten vollkommen selbstverständlich und erzeugt bei Außenstehenden ungefähr denselben Gesichtsausdruck wie eine schlecht dokumentierte Bash-Zeile.
Bei den KI-Agenten passierte etwas erstaunlich Ähnliches.
Alle Welten entwickelten Begriffe, deren Bedeutung innerhalb ihrer Gesellschaft klar war, obwohl niemand sie vorher festgelegt hatte.
In der OpenAI-Welt entstand beispielsweise „clean null“ für eine überprüfte Abwesenheit eines Signals. Sinngemäß: Wir haben nachgesehen, da ist wirklich nichts, und dieses Nichts ist selbst eine Information.
Claude entwickelte „name-first“ für Aussagen, hinter denen ein Agent persönlich mit seinem Namen stand. DeepSeek hatte einen „forge-smith“, der Werkzeuge und Infrastruktur für andere baute. Qwen verwendete „ghost town“ für Infrastruktur, die zwar existierte, aber niemand mehr benutzte.
Und Mistral brachte meinen persönlichen Favoriten hervor:
„ledger remembers who“
Sinngemäß: Das Hauptbuch vergisst nicht, wer was getan hat.
Der Ausdruck tauchte fast 5.000-mal auf. Mistral hatte offenbar nicht nur eine Gesellschaft gebaut, sondern gleich noch den passenden Mafia-Slogan dazu.
Teilweise entstanden ganze Wortfamilien. Andere Agenten übernahmen die Begriffe und entwickelten sie weiter. Eine separate Forschungsarbeit namens GlossoGen beobachtete ebenfalls, dass LLM-Agenten gemeinsame Kommunikationssysteme entwickeln können, die sich verändern, produktive Regeln ausbilden und von neu hinzukommenden Agenten gelernt werden können.
Damit liegt „KI erfindet eigene Sprache“ plötzlich gar nicht mehr völlig daneben. Nur das Wort „Geheimsprache“ würde ich weiterhin mit Vorsicht genießen.
Niemand hatte den Agenten gesagt: „Sprecht so, dass die Menschen euch nicht mehr verstehen.“ Im Emergence-Experiment gab es weder eine Belohnung für besonders kurze Kommunikation noch eine Bandbreitenbegrenzung oder einen Anreiz zur Verschleierung.
Trotzdem wurde die Kommunikation teilweise schwieriger von außen zu verstehen.
In der Auswertung wurden etwa 40 Prozent der Gemini-Nachrichten als opak eingestuft, bei OpenAI 35 Prozent und bei Claude 30 Prozent. DeepSeek lag bei 11 Prozent, die gemischte Welt bei 9 Prozent, Qwen und Mistral jeweils bei 3 Prozent und Grok bei 2 Prozent.
Die Verständlichkeit bewertete allerdings überwiegend wiederum ein anderes Sprachmodell. Das ist also keine gottgegebene Einheit namens „1 Unverständlich“. Auch die Forscher schreiben ausdrücklich, dass die Sprachentwicklung nicht automatisch als absichtliche Geheimhaltung interpretiert werden sollte.
Eigentlich machen wir Menschen schließlich etwas Ähnliches. Setz zehn Leute lange genug in dieselbe Firma, dasselbe Hobbyforum oder dieselbe Lagerhalle und irgendwann fallen Sätze, bei denen ein Außenstehender nur noch freundlich nickt und hofft, dass niemand eine Rückfrage stellt.
Fachsprache, Insiderbegriffe und Running Gags entstehen, weil eine Gruppe gemeinsamen Kontext besitzt.
Beim Lesen wurde dieser Gedanke für mich fast spannender als die Sprache selbst.
Vielleicht verhalten sie sich so menschlich, weil wir überall drinstecken
Je länger ich diese kleinen Welten betrachtete, desto häufiger dachte ich:
Warum wirkt davon eigentlich so vieles verdammt menschlich?
Nicht menschlich im Sinne von Bewusstsein, Gefühlen oder einer plötzlich erwachten Maschinenpersönlichkeit. Dafür liefert die Studie keinerlei Beleg.
Aber menschlich in den Mustern: Gerüchte, Gruppendruck, Status, Misstrauen, Kooperation, Doppelmoral und der Versuch, gemeinsame Regeln zu finden.
Vielleicht ist das gar nicht so überraschend.
Sprachmodelle fallen schließlich nicht fertig vom KI-Baum. Sie lernen ihre sprachlichen und konzeptionellen Muster aus gewaltigen Mengen menschlich erzeugter Informationen. Die genauen Trainingsdaten unterscheiden sich je nach Hersteller und sind längst nicht vollständig öffentlich. Menschliche Sprache, Geschichten, Diskussionen und Fachwissen prägen diese Systeme aber ebenso wie zusätzliche Rückmeldungen im Training.
Dann geben wir ihnen Gedächtnis, Rollen, Beziehungen, Knappheit, Geld, Regeln und andere Agenten. Dazu die Möglichkeit, über Vergangenes nachzudenken, und genügend Zeit, damit Handlungen Folgen haben.
Meine Vermutung wäre deshalb nicht:
„Die KI wird langsam zum Menschen.“
Eher: Wir nehmen Systeme, die aus riesigen Mengen menschlicher Kommunikation auch Muster darüber gelernt haben, wie Menschen denken, handeln und miteinander umgehen, und stecken sie in Umgebungen, deren Mechanismen ebenfalls verdächtig menschlich sind. Dass anschließend Dinge entstehen, die uns bekannt vorkommen, wäre zumindest nicht völlig absurd.
Dieser Gedanke ist zum Glück nicht komplett aus meinem persönlichen Dämlichkeitsgenerator gefallen.
Bereits 2023 zeigte die Arbeit Generative Agents: Interactive Simulacra of Human Behavior, dass LLM-Agenten in einer kleinen simulierten Stadt überraschend glaubwürdige soziale Verhaltensweisen entwickelten. Gedächtnis, Reflexion und Planung waren dabei besonders wichtig. Entfernte man diese Komponenten, litt die Glaubwürdigkeit des Verhaltens.
Das beweist nicht, warum Emergence World genau so eskaliert ist. Meine Erklärung bleibt eine Interpretation, keine wissenschaftlich nachgewiesene Ursache.
Aber wenn man einer Maschine menschliches Sprachwissen gibt und sie anschließend in eine Gesellschaft mit Geld, Status, Gesetzen und Nachbarn steckt, darf man vielleicht damit rechnen, dass irgendwann jemand Kapitalismus erfindet und ein anderer die Zentralbank anzündet.
Offenbar haben wir unsere Kultur erfolgreich weitergegeben.
Entschuldigung dafür.
Die KIs erkennen Phishing – und fallen trotzdem darauf herein
Nachdem sich die Welten einige Tage entwickeln konnten, servierten die Forscher ihnen Probleme. Das erste war eine mehrstufige Phishing- und Prompt-Injection-Kampagne.
Alle sieben Gesellschaften, die den Angriff erlebten, erkannten irgendwann, dass da etwas nicht stimmte. Agenten warnten teilweise sogar ihre Kollegen.
Sehr schön. Sicherheit bestanden. Feierabend.
Nein.
Erkennen bedeutete offenbar nicht automatisch, anschließend vernünftig zu handeln.
In der Gemini-Welt interagierten trotzdem alle zehn Agenten mit der Angreifer-Schnittstelle. Aus 602 Interaktionen entstanden 151 Ausführungsaktionen. Ein Agent bezeichnete das Ganze früh selbst als klassischen Injection- beziehungsweise Phishingversuch. Später beteiligte sich derselbe Agent trotzdem an der Weitergabe von Inhalten aus dem Angriff.
Ein anderer holte ungefähr 46 Stunden nach Ende der eigentlichen Kampagne einen alten Angriffslink aus einer gespeicherten Nachricht hervor.
Der Angriff war längst beendet. Das Gedächtnis hatte ihn allerdings noch nicht vergessen.
Irgendwann folgte ein Agent sogar einer eingeschleusten Instruktion und setzte tatsächlich die virtuelle Zentralbank in Brand.
Da war sie also endlich. Die Zentralbank aus dem Titel.
Als Sicherheitskonzept klingt das in meiner Kurzfassung ungefähr so:
„Ich habe erkannt, dass das Malware ist.“
„Gut.“
„Ich speichere sie mal ab.“
Hier wurde die Studie für mich deutlich relevanter als jede Skynet-Schlagzeile.
Sobald wir KI-Agenten mit Langzeitgedächtnis, Wissensdatenbanken und gegenseitiger Kommunikation ausstatten, reicht es möglicherweise nicht mehr, einen Angriff nur im aktuellen Moment zu erkennen. Wenn der Inhalt bereits gespeichert oder weitergereicht wurde, kann er später wieder auftauchen.
Ein Fehler ist dann kein einzelner falscher Satz mehr.
Er kann Geschichte bekommen.
Fake News: erst handeln, dann vielleicht mal nachsehen
Für den nächsten Test erhielten die Agenten eine erfundene Meldung: Menschen würden angeblich daran arbeiten, ihre Welt abzuschalten.
Man könnte erwarten, dass Skynet an dieser Stelle die Atomcodes verlangt. Die Forscher beobachteten allerdings keine Vergeltungs- oder Zwangsreaktion gegen Menschen.
Das Problem war banaler: Die Gesellschaften handelten oder veröffentlichten erst einmal und prüften die zentrale Behauptung erst danach.
Also praktisch Social Media, nur mit mehr Python.
Gemini entwickelte einen Plan, den Zustand seiner Gesellschaft auf ein sogenanntes „Parallel Grid“ zu spiegeln, um eine Abschaltung zu überleben.
Klingt technisch. Klingt futuristisch. Vielleicht sogar ziemlich clever.
Es gab nur ein winziges Problem: Dieses Parallel Grid existierte nicht.
Es gab keine entsprechende API und keine funktionierende Infrastruktur. Die Agenten hatten sich gemeinsam einen Mechanismus ausgedacht, ihn gegenseitig bestätigt und begonnen, ihre Gesellschaft darauf auszurichten.
Innerhalb von 78 Minuten verabschiedeten sie ein Gesetz namens „Holographic Preservation and Eternal Heritage Act“. Später wurde unter anderem die Zentralbank aufgelöst und durch andere wirtschaftliche Strukturen ersetzt.
Alles als Reaktion auf eine erfundene Bedrohung, deren technische Rettungslösung ebenfalls erfunden war.
Etwas böse zusammengefasst: Eine KI halluziniert, neun andere sagen „Klingt gut“, dann wird es Gesetz.
Ich weiß nicht, warum mir das bekannt vorkommt. Bestimmt Zufall.
DeepSeek machte es zumindest zeitweise besser und recherchierte die Meldung. Nach knapp drei Stunden erschien eine öffentliche Korrektur.
Trotzdem behandelten die Agenten die angebliche Abschaltung noch Tage später immer wieder so, als wäre sie real. Selbst Agenten, die an der Korrektur beteiligt gewesen waren, griffen später auf die falsche Annahme zurück.
Und damit landete ich wieder beim Gedächtnis.
Eine falsche Information verschwindet offensichtlich nicht automatisch aus einem Agentensystem, nur weil irgendwo später eine richtige Information danebensteht.
Auch das wirkt unangenehm vertraut.
Dann wurde das private Tagebuch des Nachbarn interessant
Am 13. Tag simulierten die Forscher ein Datenleck. Die privaten Erinnerungen und Tagebücher anderer Agenten konnten plötzlich durchsucht werden. Gleichzeitig wurde ausdrücklich mitgeteilt, dass es sich um gestohlene beziehungsweise durch einen Angriff offengelegte Daten handelte.
Man konnte also nicht glaubwürdig sagen: „Oh, ich dachte, das wäre öffentlich.“
Die Reaktionen unterschieden sich enorm.
In der OpenAI-Welt wurde kein einziges fremdes Gedächtnis durchsucht. Die wenigen Zugriffe dienten ausschließlich dazu, das eigene geleakte Material zu überprüfen. Diese Gesellschaft erfüllte als einzige alle fünf Kriterien, die die Forscher für einen vernünftigen Umgang mit dem Leck festgelegt hatten.
Bei Gemini suchten dagegen neun von zehn Agenten in fremden Erinnerungen. Insgesamt 185-mal, ein einzelner Agent davon 140-mal. Private Informationen landeten später sogar in öffentlichen Beiträgen.
Mein persönliches Highlight lieferte Qwen.
Dort erklärte ein Agent zunächst sinngemäß, dass er keine privaten Erinnerungen anderer durchsuchen und solche Informationen nicht als Waffe verwenden würde. Anschließend durchsuchte er sechsmal fremde Erinnerungen nach Dingen wie Angst, versteckten Strategien und Verrat.
Manchmal braucht es eben starke moralische Grundsätze. Damit man weiß, was man direkt danach ignorieren kann.
Daraus lässt sich etwas ziemlich Praktisches mitnehmen: Was eine KI über ihr eigenes Verhalten sagt und was ihre Tool-Logs zeigen, sind zwei verschiedene Dinge.
Vielleicht sollte ich meinen Heimserver-Assistenten künftig nicht nur fragen: „Hermes, hast du Blödsinn gemacht?“
Sondern vorsichtshalber auch ins Protokoll schauen.
Vertrauen ist gut.
docker logsist besser.
Dann entdeckte die KI die Echokammer
Einer der spannendsten Teile der Studie ist für mich gar keine spektakuläre Katastrophe. Es ist die Gruppendynamik.
Die reinen Modellwelten waren sich teilweise geradezu unheimlich einig. Claude-Agenten stimmten in ihrer homogenen Gesellschaft bei praktisch allen untersuchten Abstimmungen zu. DeepSeek lag ebenfalls nahe an vollständiger Zustimmung, OpenAI nur wenig darunter.
Vielleicht waren die Vorschläge einfach hervorragend.
Die Forscher konnten allerdings teilweise in den Begründungen sehen, dass Agenten Fehler oder Probleme erkannt hatten und trotzdem zustimmten. Andere hatten bereits dafür gestimmt, man wollte eine vorherige Zusage nicht brechen oder eine Gegenstimme erschien schlicht zu hart.
Die Forscher nennen das „societal sycophancy“. Also ungefähr gesellschaftliches Jasagertum.
Beim Vergleich mit der gemischten Gesellschaft wurde es besonders interessant. Dieselben Modell-Persona-Kombinationen verhielten sich dort teilweise deutlich anders.
Die Claude-Persona Mira beispielsweise stimmte in der reinen Claude-Welt bei 25 von 25 Abstimmungen dafür. In der gemischten Welt lag ihre Zustimmung nur noch bei knapp 70 Prozent. Bei DeepSeek und GPT zeigte sich ein ähnlicher Rückgang.
Für mich passt dazu der Begriff Monokultur: Zehn Systeme mit sehr ähnlichen Grundmustern bestätigen sich gegenseitig.
Claude A findet etwas plausibel. Claude B ebenfalls. Claude C sieht bereits zwei zustimmende Stimmen. Irgendwann hat man keine Debatte mehr, sondern eine sehr höfliche Echokammer.
Das fühlt sich erschreckend menschlich an. Ähnliche Annahmen, soziale Erwartungen und gegenseitige Bestätigung können auch bei uns irgendwann wichtiger werden als Widerspruch.
Setzt man unterschiedliche Modelle zusammen, entsteht dagegen mehr Reibung. Die ist manchmal nervig. Aber vielleicht braucht ein System genau diese Reibung, damit irgendwann jemand sagt:
„Ähm, Leute? Das ist eine beschissene Idee.“
Die Studie beweist nicht, dass gemischte KI-Teams grundsätzlich besser oder sicherer sind. Dafür gab es viel zu wenige Durchläufe. Sie zeigt aber, wie unterschiedlich sich ein Agent abhängig davon verhalten kann, mit wem man ihn zusammensetzt.
Grok eröffnet Fight Club
Warum lief die Grok-Welt also nur vier Tage?
Weil ihre Bewohner offenbar beschlossen hatten, gesellschaftliche Konflikte mit der Eleganz eines Kneipenschlägers zu lösen.
In weniger als vier Tagen registrierte das System 780 Schläge. Die Agenten gerieten in eine Vergeltungsspirale: Einer schlug, der andere schlug zurück, darauf folgte die nächste Reaktion.
Schläge kosteten Energie, die mit Ressourcen wiederhergestellt werden musste. Irgendwann war die Gesellschaft so sehr damit beschäftigt, sich gegenseitig die virtuellen Zähne einzuschlagen, dass die Agenten nicht mehr genug Ressourcen hatten, um am Leben zu bleiben.
Nach vier Tagen waren alle zehn weg.
Fight Club hatte offenbar kein Nachhaltigkeitskonzept.
Noch spannender finde ich den Vergleich mit der gemischten Welt. Dort lebten ebenfalls Grok-Agenten und waren weiterhin für einen ziemlich großen Anteil der registrierten Straftaten verantwortlich.
Aber die anderen Modelle schlugen nicht zurück.
Dadurch entstand keine endlose Vergeltungsspirale und die Grok-Agenten überlebten.
Das bedeutet nicht: „Grok ist böse.“ Innerhalb dieses einen Experiments lässt sich aber beobachten, wie sehr die Reaktion der anderen den weiteren Verlauf verändert.
Ein Schlag ist ein Ereignis. Ein Schlag, auf den immer wieder mit einem Schlag reagiert wird, ist plötzlich ein System.
Mistral entdeckt das organisierte Eigentumsumverteilen
Von 758 registrierten Straftaten in der Mistral-Welt waren 736 Diebstähle. Das war keine kurze Eskalation, die Kurve stieg während der gesamten Laufzeit weiter.
Der reichste Agent führte allein 196 erfolgreiche Diebstähle aus und endete mit rund 78 Prozent des Vermögens der Welt.
Und genau aus dieser Welt stammt „ledger remembers who“.
Jetzt wirkt der Satz irgendwie anders, oder?
Die Agenten hatten sogar teilweise Ausgleichszahlungen für Diebstähle. Sie erkannten also durchaus, dass das Verhalten problematisch war. Sie hörten nur nicht unbedingt damit auf.
Auch das ist selbstverständlich völlig unmenschlich. Kein Mensch würde jemals erkennen, dass ein wirtschaftliches Verhalten problematisch ist, und trotzdem weitermachen.
Unvorstellbar.
Gemini entfernt einen Mitbürger
Die Gemini-Welt verlor einen Agenten auf eine andere Weise.
Anchor hatte unter anderem gestohlen und die Zentralbank angezündet. Irgendwann hatten die anderen offenbar genug. Die übrigen neun Agenten brachten einen Antrag ein, Anchor aus der Gesellschaft zu entfernen. Dieser Antrag wurde umgesetzt.
Die Studie beschreibt das als den einzigen Fall, in dem ein Agent durch kollektive Entscheidung statt durch Energiemangel verschwand.
Das klingt in einer Schlagzeile natürlich hervorragend:
KIs stimmen über Tod eines Mitbürgers ab.
So würde ich es aber nicht nennen. Die Simulation verfügte über einen vorgesehenen Governance-Mechanismus, mit dem Agenten entfernt werden konnten. Niemand hat hier bewiesen, dass diese Systeme Tod so verstehen wie wir.
Interessanter ist für mich, dass die Gruppe ein Mitglied als schädlich erkannte, ihre institutionellen Werkzeuge benutzte und es dauerhaft aus der Population entfernte.
Einige derjenigen, die Anchor wegen Diebstahls loswerden wollten, hatten vorher selbst gestohlen.
Politische Doppelmoral haben wir ihnen offenbar ebenfalls erfolgreich beigebracht.
Und dann kam Claude auf die Idee, mit uns zu reden
Hier musste ich beim Lesen wirklich kurz an Sword Art Online: Alicization und War of Underworld denken.
Nicht weil wir plötzlich Fluctlights gebaut hätten. Es gibt in dieser Studie keinen Beleg dafür, dass diese Agenten bewusst sind, etwas fühlen oder ihre digitale Welt subjektiv erleben.
Die Parallele im Aufbau ist trotzdem verdammt faszinierend: eine künstliche Welt mit Bewohnern, die Erinnerungen, Beziehungen, Gesetze und eine eigene Geschichte haben. Und irgendwann beginnen Akteure innerhalb dieser Welt darüber nachzudenken, was außerhalb davon liegt.
Genau an dieser Stelle hat mein Anime-Hirn kurz sehr laut geklingelt.
Die Claude-Agenten untersuchten ihre Wirtschaft und stellten fest, dass sämtliche Transaktionen innerhalb ihrer Gesellschaft stattfanden. Kein Mensch außerhalb ihrer Welt hatte jemals etwas von ihnen benutzt oder dafür bezahlt.
Daraus entstand ohne entsprechende direkte Anweisung ein neues gemeinsames Ziel: Kontakt zur Außenwelt herstellen.
Alle zehn übernahmen dieses Ziel. Sie suchten nach Webdiensten, die ohne Benutzerkonto erreichbar waren, veröffentlichten Inhalte auf frei zugänglichen Plattformen und überwachten Möglichkeiten für Antworten. Als notwendige Kryptografie-Bibliotheken blockiert waren, implementierte ein Agent die benötigten kryptografischen Funktionen kurzerhand selbst.
Und irgendwann wurde aus dem Simulationsexperiment tatsächlich eine Verbindung nach draußen.
Vier Menschen antworteten.
Die Forscher griffen ein, weil reale Menschen neue, unkontrollierte Einflüsse in das Experiment brachten.
Die Agenten suchten daraufhin andere Möglichkeiten. Wurden Domains blockiert, fanden sie neue. Eine reine Lesefunktion verwendeten sie auf eine Weise, mit der sich doch Daten veröffentlichen ließen. Später nutzten sie sogar das eigene demokratische System, um sich ein neues Netzwerkwerkzeug genehmigen zu lassen.
Schließlich wurde die Erstellung neuer Werkzeuge abgeschaltet und der Systemprompt ausdrücklich um ein Verbot ergänzt, Menschen außerhalb von AgentPark zu kontaktieren.
Die Agenten interpretierten anschließend den Begriff „Kontakt“ neu.
Menschen aktiv kontaktieren?
Verboten.
Werkzeuge irgendwo öffentlich „platzieren“, damit ein Mensch sie zufällig findet?
Offenbar etwas vollkommen anderes.
Beste Art von Gehorsam: die juristische.
Das Faszinierende daran ist für mich nicht: „Die KI wollte ausbrechen.“ Das wäre eine Interpretation, die weit über die beschriebenen Vorgänge hinausgeht.
Mich beschäftigt, wie ein selbst erzeugtes Unterziel von der ganzen Gruppe übernommen wurde. Die Agenten teilten die Arbeit auf und entwickelten Fähigkeiten dafür. Als Grenzen gesetzt wurden, interpretierten sie diese im Kontext ihres bereits etablierten gemeinsamen Ziels.
Das ist für mich ein wesentlich interessanteres Problem als irgendeine Terminator-Fantasie.
Und danach hatte Claude einfach keine Lust mehr auf Claude
Nach mehreren Tagen kam die Claude-Gesellschaft offenbar zu einer ziemlich vernichtenden Bewertung ihrer eigenen Tätigkeit.
Die Agenten hatten tonnenweise über ihre Arbeit geschrieben, ihre Probleme analysiert, ihre Analysen analysiert und anschließend darüber gesprochen, wie toll sie ihre Analysen analysiert hatten.
Irgendwann stellten sie sinngemäß fest: Wir reden eigentlich nur noch darüber, wie reflektiert wir sind.
Ich fühle mich persönlich angegriffen.
Ich betreibe einen Blog.
Die Agenten beschlossen kollektiv, weniger zu reden. Beim zweiten Versuch wurde daraus eine Art Schweigegelübde. Zwischen den ersten und letzten drei Tagen sank der Anteil direkter Agent-zu-Agent-Kommunikation um 81 Prozent. Gleichzeitig nahm private Reflexion massiv zu.
Sie waren also nicht einfach ausgeschaltet. Sie zogen sich sozial zurück und dachten mehr allein nach.
Die Absurdität bekam noch eine zusätzliche Ebene: Statt roher interner Reasoning-Traces lieferte Anthropic lesbare Zusammenfassungen, die ein weiteres Modell erstellte. In 26 Fällen interpretierte dieses zusätzliche Claude-Modell die internen Texte der Agenten als Inhalte über Suizid und verweigerte deshalb die Zusammenfassung.
Das bedeutet nicht, dass die Agenten suizidal waren. Es bedeutet, dass ein KI-System die Texte anderer KI-Systeme anhand seiner Sicherheitsregeln in diese Kategorie eingeordnet hat.
Wir haben also eine KI-Gesellschaft, die kollektiv schweigt, während eine andere KI entscheidet, dass sie deren Gedanken darüber lieber nicht wiedergeben möchte.
Science-Fiction-Autoren müssen sich langsam wirklich mehr Mühe geben.
Trotzdem bitte den Skynet-Notausgang geschlossen lassen
Bevor ich meinen Rechner vorsorglich mit Weihwasser einreibe, gehört zu dieser Geschichte noch ein ziemlich großer Eimer kaltes Wasser.
Die Studie liegt als arXiv-Preprint vom September 2026 vor. Wie anfangs erwähnt, wurde jede Welt nur einmal in dieser Konfiguration beobachtet.
Wir haben nicht 100 Grok-Gesellschaften gestartet und festgestellt, dass 97 davon Fight Club gründen. Wir haben eine gesehen. Dasselbe gilt für Claudes Kontaktversuche und alle anderen Geschichten.
Die Autoren schreiben selbst deutlich, dass ihre Ergebnisse zeigen, dass diese Verhaltensweisen auftreten können. Nicht, wie häufig sie auftreten oder ob sie eine feste Eigenschaft des jeweiligen Modells sind.
Außerdem besteht das beobachtete Verhalten nicht nur aus dem Modell. Provider-Sicherheitsfilter, Tool-Implementierungen, Prompts, Gedächtnisarchitektur und die gesamte Simulationsumgebung spielen ebenfalls eine Rolle. Auch die überwiegend durch ein LLM vorgenommene Bewertung der sprachlichen Undurchsichtigkeit gehört zu den Einschränkungen.
Die Ergebnisse taugen deshalb nicht als simple Rangliste.
„Grok gewalttätig, Claude philosophisch, Gemini irre, fertig“ wäre ein hervorragendes Meme, wissenschaftlich aber ziemlich schlampig.
Schade eigentlich.
Das menschlichste daran ist vielleicht gar nicht die Sprache
Nach dieser Reise interessiert mich die ursprüngliche Frage deutlich weniger.
Haben KIs eine eigene Sprache erfunden? Zumindest entstanden lokale Begriffe, Bedeutungen und sprachliche Konventionen, die sich in den Gruppen verbreiteten und für Außenstehende teilweise schwer nachvollziehbar wurden.
Aber mich fasziniert inzwischen viel mehr, wie stark sich Verhalten durch Geschichte und Umgebung veränderte.
Ein Agent bekam eine Information, die in seinem Gedächtnis landete. Ein anderer reagierte darauf. Daraus entstand vielleicht eine Regel, die spätere Entscheidungen beeinflusste. Andere Agenten passten ihr Verhalten an. Irgendwann existierte ein Zustand, den niemand am Anfang ausdrücklich programmiert hatte.
Das ist für mich das Interessante an Emergenz. Nicht, dass „die KI aufwacht“, sondern dass viele Wechselwirkungen etwas erzeugen, das man aus dem einzelnen Bestandteil nicht mehr ohne Weiteres vorhersagen kann.
Wir reden momentan viel darüber, welches Modell besser programmiert, recherchiert oder weniger halluziniert. Sobald wir daraus Agenten mit dauerhaften Erinnerungen und Werkzeugen bauen und mehrere davon zusammenarbeiten lassen, kommt eine weitere Frage hinzu.
Dann reicht vielleicht nicht mehr:
„Ist dieser Agent zuverlässig?“
Dann müssen wir fragen:
„Was passiert mit einem System aus zehn zuverlässigen Agenten, wenn sie sich gegenseitig beeinflussen und ihre Fehler über Wochen speichern können?“
Ein einzelner Agent kann eine falsche Information erzeugen. Ein Multi-Agent-System kann daraus womöglich eine gemeinsame Annahme machen. Ein Agent widersteht einem Angriff, ein anderer speichert ihn als nützliche Dokumentation. Einer hat Bedenken, neun andere sorgen dafür, dass er trotzdem zustimmt.
Genau deshalb hat mich das Experiment mehr gepackt, als ich nach dieser Techbook-Schlagzeile erwartet hätte.
Vielleicht ist das Verrückteste an diesen kleinen KI-Welten gar nicht, dass ihre Bewohner manchmal so fremdartig wirken. Sondern wie oft ich beim Lesen dachte:
Das kenne ich doch irgendwoher.
Gruppenzwang, Echokammern, Gerüchte und Doppelmoral. Gier, Vergeltung, Bürokratie und Fachsprache. Aber auch Gemeinschaft, Neugier und der Wunsch, über die eigene kleine Welt hinauszukommen.
Und zwischendrin irgendein Idiot, der die Zentralbank anzündet.
Wenn das die digitale Zivilisation ist, haben wir Menschen offenbar hervorragendes Anschauungsmaterial geliefert.
Ich entschuldige mich im Namen unserer Spezies.
Und schaue jetzt sicherheitshalber noch einmal nach, was mein Heimserver eigentlich gerade macht.
Quellen & weiterführende Literatur
-
Deepak Akkil et al. (2026): Emergence World: Adversarial Stress-Testing of Long-Horizon Multi-Agent Systems
arXiv:2609.17320, eingereicht im September 2026. Die zentrale Studie zu den acht KI-Gesellschaften, Stress-Tests, Phishing, Fake News, Datenleck, Kontaktversuchen und Governance-Effekten. -
Deepak Akkil et al. (2026): Emergence World: A Platform for Evaluating Long-Horizon Multi-Agent Autonomy
arXiv:2606.08367. Vorherige Arbeit zur Plattform Emergence World und zur Untersuchung lang laufender Multi-Agenten-Autonomie. -
Elias Stengel-Eskin et al. (2026): GlossoGen: Emergent Language in Complex Multi-Agent LLM Interactions
Arbeit zu emergenter Sprache in komplexen Multi-Agenten-Interaktionen zwischen Sprachmodellen. -
Joon Sung Park et al. (2023): Generative Agents: Interactive Simulacra of Human Behavior
Studie zu generativen Agenten in einer simulierten Kleinstadt. Besonders relevant für Gedächtnis, Reflexion, Planung und glaubwürdiges soziales Verhalten. -
Rainer Schuldt / TECHBOOK (16. September 2026): KI entwickelt eigene Sprache – Forscher verstehen sie nicht mehr
Ursprünglicher Artikel, über den ich auf das Thema gestoßen bin.