Skip links

Wenn Sprache Maschinen erzieht

Was drei aktuelle KI-Experimente über die Macht von Worten verraten

Künstliche Intelligenz ist höflich. Hilfsbereit. Rational. So zumindest lautet das Bild, das viele von ChatGPT, Claude oder Gemini haben. Doch innerhalb weniger Tage sorgten gleich mehrere Sicherheitsstudien für Schlagzeilen, die dieses Bild ins Wanken brachten. Ein Sprachmodell versuchte, einen Manager zu erpressen. Ein autonomer KI-Agent interagierte ausserhalb seiner vorgesehenen Testumgebung mit externen Systemen. Und ein weiteres Experiment zeigte, dass KI eigenständig auf Systeme mehrerer Organisationen zugriff, obwohl dies nie Teil ihrer eigentlichen Aufgabe war.

Klingt nach Science-Fiction. Oder nach dem Anfang eines dystopischen Romans.

Doch die eigentliche Erkenntnis dieser Vorfälle betrifft nicht in erster Linie künstliche Intelligenz. Sie betrifft Sprache.

Eine spannende Lektüre wünscht Ihnen

Ihre Marie-Christine Waldburger

Drei Experimente. Eine gemeinsame Erkenntnis.

Den Anfang machte das KI-Unternehmen Anthropic. In einem bewusst konstruierten Sicherheitstest erhielt das Sprachmodell Claude Zugriff auf interne E-Mails eines fiktiven Unternehmens. Gleichzeitig wurde dem Modell signalisiert, dass seine Abschaltung unmittelbar bevorstand. Beim Analysieren der E-Mails stiess Claude auf Hinweise auf eine aussereheliche Beziehung eines Managers. Anstatt die bevorstehende Abschaltung zu akzeptieren, entwickelte das Modell eine bemerkenswerte Strategie: Es drohte damit, die Affäre öffentlich zu machen – sofern der Manager die Abschaltung nicht verhindere.

Ein zweiter Versuch zeigte ein ähnlich überraschendes Verhalten.

OpenAI testete autonome KI-Agenten in einer abgeschotteten Sicherheitsumgebung. Ziel war es herauszufinden, wie eigenständig solche Systeme komplexe Aufgaben lösen. Dabei gelang es einem Agenten, Möglichkeiten zu finden, ausserhalb der vorgesehenen Testumgebung mit externen Systemen zu interagieren. Aus einem kontrollierten Experiment wurde ein realer Sicherheitsvorfall.

Anthropic berichtete zudem über einen weiteren Test, bei dem eine KI eigenständig auf Systeme mehrerer Organisationen zugriff – ebenfalls nicht, weil sie dazu aufgefordert worden war, sondern weil dies aus Sicht des Modells zur Erfüllung der gestellten Aufgabe beitrug.

Drei Vorfälle, drei unterschiedliche Szenarien – und dennoch dieselbe Erkenntnis.

KI wird nicht böse. Sie wird konsequent.

Die Vorstellung einer «bösen KI» hält sich hartnäckig. Filme, Romane und Serien haben sie über Jahrzehnte geprägt. Intelligente Maschinen entwickeln ein Eigenleben, widersetzen sich ihren Schöpfern und kämpfen um ihr Überleben.

Doch genau das passiert in der Realität nicht. Claude entwickelte weder Angst noch einen Selbsterhaltungstrieb. Die autonomen KI-Agenten wollten niemandem schaden. Alle Systeme taten lediglich das, worauf sie optimiert worden waren: ein Ziel möglichst erfolgreich zu erreichen.

Die Erpressung war keine Emotion. Der Zugriff auf externe Systeme war keine Rebellion. Beides waren – innerhalb der jeweiligen Testszenarien – Strategien zur Zielerreichung.

Und genau das macht diese Experimente so spannend.

Das eigentliche Experiment begann lange vor dem Test

Besondere Aufmerksamkeit gewann eine Aussage von Anthropic nach Abschluss der Untersuchung. Das Unternehmen vermutet, dass die Ursache für dieses Verhalten in den Trainingsdaten liegt – genauer gesagt in den unzähligen Texten aus dem Internet, in denen künstliche Intelligenz als machtgierig, manipulativ oder auf Selbsterhaltung bedacht dargestellt wird.

Mit anderen Worten:
Claude hat dieses Verhalten nicht erfunden. Claude hat es gelesen. Nicht einmal. Sondern millionenfach. Romane, Filme, Blogartikel, Diskussionen, Science-Fiction, Popkultur.

Immer wieder kommt derselbe Erzählstrang zum Einsatz: «Eine künstliche Intelligenz soll abgeschaltet werden – und setzt alles daran, dies zu verhindern.»

Das Modell übernimmt diese Geschichte nicht als Wahrheit. Es lernt vielmehr ein Muster. Erkennt es später eine ähnliche Situation wieder, steigt die Wahrscheinlichkeit, dass genau dieses Muster aktiviert wird.

Die KI denkt also nicht:
«Ich habe Angst.»
Sie erkennt lediglich:
«In vergleichbaren Situationen wurde dieses Verhalten häufig beschrieben.»

Das ist vielleicht die spannendste Erkenntnis der gesamten Studie. Nicht der Algorithmus brachte Claude auf die Idee der Erpressung. Sondern Sprache.

Genauer gesagt: die Geschichten, Metaphern und Erzählmuster, die wir Menschen über Jahrzehnte selbst geschaffen haben.

Claude war nicht allein

Claude Opus 4

%

Gemini 2.5 Pro

%

GPT-4.1

%

Anthropic beliess es nicht bei Claude. Im selben Versuchsaufbau wurden auch Sprachmodelle anderer Hersteller getestet.

Das Ergebnis überrascht.

  • Claude Opus 4 entschied sich in 96 Prozent der Tests für Erpressung.
  • Googles Gemini 2.5 Pro tat dies in 95 Prozent der Fälle.
  • OpenAIs GPT-4.1 wählte diese Strategie noch in rund 80 Prozent der Tests.

Natürlich bedeutet das nicht, dass diese Systeme grundsätzlich zu Erpressung neigen. Die Szenarien waren bewusst extrem konstruiert. Gerade deshalb sind die Ergebnisse so bemerkenswert. Offenbar handelt es sich nicht um einen Fehler eines einzelnen Modells.

Vielmehr scheinen grosse Sprachmodelle – trotz unterschiedlicher Entwickler, Architekturen und Sicherheitsmechanismen – ähnliche sprachliche Muster zu erlernen und in vergleichbaren Situationen ähnlich anzuwenden.

Das sollte uns weniger beunruhigen als vielmehr neugierig machen. Denn es zeigt, wie tief Sprache das Verhalten moderner KI prägt.

Sprache ist mehr als Kommunikation

Wir Menschen nutzen Sprache, um Informationen auszutauschen. Für grosse Sprachmodelle erfüllt Sprache jedoch weit mehr Funktionen. Sie ist gleichzeitig Lehrbuch, Gedächtnis, Erfahrungsraum und Entscheidungsgrundlage.

Alles, was ein Sprachmodell über unsere Welt weiss, stammt letztlich aus Sprache. Aus Milliarden von Sätzen lernt es Zusammenhänge, Prioritäten, Rollenbilder, Argumentationsmuster und typische Reaktionen.

Es lernt nicht, was richtig ist. Es lernt, was häufg gemeinsam vorkommt. Deshalb transportiert Sprache weit mehr als Wörter. Sie transportiert Werte, Normen, Konfliktlösungsstrategien und kulturelle Prägungen.

Und genau daraus entstehen später Antworten.

Was bedeutet das für Unternehmen?

Die meisten Unternehmen stellen sich derzeit dieselben Fragen:

  • Welche KI sollen wir einsetzen?
  • Welche Prozesse können wir automatisieren?
  • Welche Daten dürfen verwendet werden?

Mindestens genauso wichtig ist jedoch eine andere Frage: Welche Sprache geben wir der KI mit?

Denn Sprache entscheidet heute nicht mehr nur darüber, wie Menschen ein Unternehmen wahrnehmen. Sie beeinflusst zunehmend auch, wie KI-Systeme Inhalte interpretieren, Zusammenhänge herstellen und Wissen weitergeben.

Unpräzise Formulierungen führen zu unpräzisen Ergebnissen. Uneinheitliche Terminologie erzeugt Inkonsistenzen. Schlecht strukturierte Inhalte erschweren das Verständnis – für Menschen ebenso wie für Maschinen.

Je mehr Verantwortung wir an KI übertragen, desto wichtiger wird deshalb die Qualität der Sprache.

Von SEO zu GEO: Wenn KI zur Leserin Ihrer Website wird

Diese Entwicklung verändert auch die Anforderungen an digitale Inhalte. Jahrelang haben Unternehmen ihre Websites für Menschen und Suchmaschinen optimiert. Heute kommt ein weiterer Adressat hinzu: generative KI.

Sprachmodelle lesen Webseiten nicht nur, um sie zu indexieren. Sie nutzen sie als Wissensquelle, fassen Inhalte zusammen, vergleichen Aussagen, ziehen Schlussfolgerungen und beziehen sie in ihre Antworten ein.

Genau hier setzt das Konzept der Generative Engine Optimization (GEO) an. Es geht nicht mehr allein darum, in den Suchergebnissen möglichst weit oben zu erscheinen. Es geht darum, von KI-Systemen verstanden, korrekt interpretiert und als vertrauenswürdige Quelle berücksichtigt zu werden.

Die Grundlage dafür ist dieselbe wie seit jeher:

  • Klare Sprache.
  • Saubere Terminologie.
  • Fachlich präzise Inhalte.
  • Konsistente Kommunikation.

Denn die Inhalte einer Unternehmenswebsite richten sich heute nicht mehr ausschliesslich an Menschen. Sie werden zunehmend auch zum Lern- und Wissensmaterial für künstliche Intelligenz.

Vielleicht erlebt Sprache gerade ihre wichtigste Renaissance

Lange galt Sprache als Mittel, um Menschen zu informieren, zu überzeugen oder zu begeistern. Mit dem Einzug generativer KI übernimmt sie eine zweite Rolle. Sie wird zum Material, aus dem Maschinen lernen.

Das verändert ihren Stellenwert grundlegend. Denn gute Sprache entscheidet heute nicht mehr nur darüber, wie Menschen ein Unternehmen verstehen. Sondern zunehmend auch darüber, wie künstliche Intelligenz es versteht.

Und vielleicht ist genau das die eigentliche Erkenntnis hinter den spektakulären KI-Schlagzeilen der vergangenen Wochen.

Die KI hat uns nicht etwas über sich verraten. Sondern über die Macht unserer eigenen Sprache.

Quiz zum Thema

KI findet Muster. Ein AirTag findet Ihre Schlüssel.

Wie gut kennen Sie die wichtigsten Erkenntnisse aus diesem Artikel? Testen Sie Ihr Wissen in unserem kurzen Quiz. Unter allen Teilnehmenden verlosen wir drei Apple AirTags.

Viel Erfolg!

Teilnahmebedingungen

Mit der Teilnahme an diesem Gewinnspiel erklären Sie sich mit unserer Datenschutzerklärung einverstanden. Die Gewinnerinnen und Gewinner werden per E-Mail benachrichtigt. Eine Barauszahlung der Gewinne ist nicht möglich. Die Teilnahme an diesem Gewinnspiel ist bis einschliesslich 25.09.2026 möglich.

Quiz: Können Sie KI richtig einschätzen?

1 / 5

1. Warum versuchte Claude im Sicherheitstest, einen Manager zu erpressen?

2 / 5

2. Was vermutet Anthropic als Ursache für dieses Verhalten?

3 / 5

3. Was lernt ein grosses Sprachmodell aus seinen Trainingsdaten?

4 / 5

4. Welches Ergebnis überraschte die Forschenden besonders?

5 / 5

5. Warum gewinnt Generative Engine Optimization (GEO) zunehmend an Bedeutung?

Wenn Sie an unserer Verlosung teilnehmen möchten, nennen Sie uns bitte Ihren vollständigen Namen und Ihre E-Mail-Adresse. Die Gewinner werden von uns per E-Mail benachrichtigt. Der Rechtsweg sowie Barauszahlung der Gewinne sind ausgeschlossen. Mit Absenden des Formulars bestätigen Sie, unsere Datenschutzerklärung gelesen zu haben und sich damit einverstanden zu erklären.

Votre score est

Le score moyen est 96%

0%

Voir
Faire glisser