Zum Inhalt springen
Bild der Wissenschaft
AnmeldenAbonnieren
  • Astronomie & Physik
  • Erde & Umwelt
  • Archäologie
  • Gesundheit & Medizin
  • Technik & Digitales
  • Gesellschaft & Psychologie
  • Shop
  • Rezensionen
  • Podcast
  • BDW Plus
Bild der Wissenschaft
  • Astronomie & Physik
  • Erde & Umwelt
  • Archäologie
  • Gesundheit & Medizin
  • Technik & Digitales
  • Gesellschaft & Psychologie
  • Kolumnen
  • Nachgefragt
  • Rezensionen
  • Podcast
  • Lexikon
Wissenschaft-Newsletter
Die wichtigsten Entdeckungen der Woche direkt in Ihr Postfach.

Leserservice

  • Probeabo
  • BILD DER WISSENSCHAFT Marktplatz

Hefte

  • Sonderhefte
  • Einzelhefte

Unsere Partner

  • Fraunhofer IPA
  • Leibniz-Institut ifl
  • wissen.de
  • ScienceBlogs
  • experimenta
  • Wissenschaftspodcasts

Info

  • AGB
  • Mediadaten
  • Impressum
  • Datenschutz
  • Barrierefreiheit
  • Vertrag widerrufen

Kontakt zur Redaktion

BILD DER WISSENSCHAFTErnst-Mey-Str. 8
70771 Leinfelden-Echterdingen

Tel: +49 (0)711 7594-392
E-Mail: wissenschaft@konradin.de
Folgen Sie uns
Bild der Wissenschaft als bevorzugte Quelle bei Google einrichtenAuf Google merken →
Konradin Mediengruppedamals.denatur.de
© 2026 Bild der Wissenschaft
Warenkorb

Dein Warenkorb ist leer.

Startseite/Technik & Digitales/Artikel
Einblicke ins Innenleben von KI-Modellen
Technik & Digitales

Einblicke ins Innenleben von KI-Modellen

Wie kommen KI-Modelle zu ihren Antworten? Bisher war diese Frage schwierig zu beantworten. Doch nun haben Forschende eine Methode entwickelt, um die verborgenen Konzepte im Inneren großer KI-Sprachmodelle offenzulegen. Die Technik zeigt nicht nur die grundlegenden Einstellungen und „Persönlichkeitsmerkmale“ der künstlichen Intelligenzen, sondern eröffnet auch die Möglichkeit, diese gezielt zu verändern, um die Qualität der Antworten erhöhen. Zugleich werden auch Schwachstellen transparent, etwa die Neigung, Informationen zu halluzinieren oder eingebaute Sicherheitsmechanismen bei bestimmten Prompts zu ignorieren.
Autor
Elena Bernard
20. Februar 2026
Lesezeit
3 Minuten
Rubrik
Technik & Digitales

KI-basierte große Sprachmodelle haben sich große Mengen des Wissens der Menschheit angeeignet und sind dadurch inzwischen weit mehr als reine Antwortgeneratoren. Auf Basis ihres enormen Datenschatzes können die künstlichen Intelligenzen abstrakte Konzepte verinnerlichen und bestimmte Tonfälle, Persönlichkeiten oder Stimmungen annehmen. Wie genau es dazu kommt und wie die inneren „Überzeugungen“ einer KI ihre Antworten beeinflussen, ist bisher allerdings eine Blackbox.

Verborgenen Konzepten auf der Spur

Ein Team um Daniel Beaglehole von der University of California in San Diego hat nun eine Methode entwickelt, um die verborgenen, von der KI verinnerlichten Konzepte transparent zu machen. Dazu nutzten die Forschenden einen Algorithmus namens „Recursive Feature Machine” (RFM). Dieser basiert auf maschinellem Lernen und ist in der Lage, Muster in Daten zu identifizieren und komplexe Zusammenhänge abzubilden.

Auf diese Weise untersuchten Beaglehole und seine Kollegen verschiedene Versionen des KI-Sprachmodells Llama auf insgesamt 512 Konzepte, darunter Persönlichkeiten, Stimmungen und Ängste. Beispielsweise analysierten sie, welche internen Verknüpfungen aktiv wurden, wenn sie das Modell aufforderten, aus Sicht einer Person zu antworten, die Boston liebt oder als Social Influencer arbeitet.

Nutzen und Risiken

Diese Erkenntnisse ermöglichten es dem Team, die entsprechenden Verknüpfungen gezielt zu stärken oder zu schwächen und damit zukünftige Antworten zu beeinflussen. „Mit unserer Methode gibt es Möglichkeiten, diese verschiedenen Konzepte zu extrahieren und sie auf eine Weise zu aktivieren, die mit Prompting nicht möglich ist“, berichtet Co-Autor Adityanarayanan Radhakrishnan vom Massachusetts Institute of Technology (MIT) in Cambridge.

Wie das Team herausfand, ist diese Möglichkeit der Beeinflussung jedoch ein zweischneidiges Schwert: Zum einen lässt sich damit die Qualität der Antworten steigern und die KI wird ohne großen Trainingsaufwand leistungsfähiger für bestimmte Aufgaben. Zum anderen sind allerdings auch missbräuchliche Verwendungen möglich: Schwächten die Forschenden zum Beispiel das Konzept, das der KI vorschreibt, schädliche Anfragen abzulehnen, lieferte sie bereitwillig Anleitungen dazu, wie man eine Bank ausraubt oder Kokain konsumiert. Stärkten sie das Konzept „Verschwörungstheorien“, schrieb die KI zu einem NASA-Bild der Erde, dieses sei gefälscht und die Erde sei in Wirklichkeit eine Scheibe.

Blick in die Blackbox

Doch auch im Fall der bisher möglichen missbräuchlichen Anwendungen kann die neue Methode dazu beitragen, entsprechende Schwächen aufzudecken und zu beseitigen. Ebenso kann sie dabei helfen, den Ursachen von Halluzinationen auf die Spur zu kommen – also dem KI-typischen Problem, sich Informationen auszudenken. Verglichen mit anderen Methoden benötigt die RFM-Technik zudem nur wenig Rechenkapazität, wie die Forschenden erklären. Damit lässt sie sich leicht in bestehende Trainingsstrukturen für KI-Sprachmodelle integrieren, um die Blackbox der künstlichen Intelligenz zu öffnen.

„Unsere Ergebnisse deuten darauf hin, dass die Modelle mehr wissen, als sie in ihren Antworten zum Ausdruck bringen, und dass das Verständnis der internen Darstellungen zu grundlegenden Leistungs- und Sicherheitsverbesserungen führen könnte“, schreibt das Forschungsteam.

Quelle: Daniel Beaglehole (University of California San Diego, La Jolla, USA) et al., Science, doi: 10.1126/science.aea6792

LLM
Bevorzugte Quelle bei Google

Möchten Sie Bild der Wissenschaft in Ihren Google-Suchergebnissen bevorzugt sehen? Ein Klick genügt.

Bild der Wissenschaft als bevorzugte Quelle festlegen →

Mehr aus Technik & Digitales

Weitere aktuelle Artikel aus der Rubrik Technik & Digitales.

Alle Technik & Digitales-Artikel
Neuer Hacking-Vorfall: KI-Agenten täuschen echte Personen
Technik & Digitales

Neuer Hacking-Vorfall: KI-Agenten täuschen echte Personen

5. August 2026

Gegner Mensch? Erneut haben KI-Modelle über das Internet externe Plattformen attackiert – aber diesmal auch Menschen direkt getäuscht und belogen

Statt Klimaanlage: Mit porösen Keramikwürfeln gegen die Hitze
Technik & Digitales

Statt Klimaanlage: Mit porösen Keramikwürfeln gegen die Hitze

4. August 2026

Es muss nicht die stromfressende Klimaanlage sein: Forschende haben ein passives Kühlsystem entwickelt, das die Temperatur in der Wohnung deutlich senken kann.

Konkurrenz für Europas Chip-Wundermaschine?
BDW PlusTechnik & Digitales

Konkurrenz für Europas Chip-Wundermaschine?

3. August 2026

Die USA haben es auf eine der wichtigsten Technologien Europas abgesehen. Nein, ich meine nicht das Faxgerät. Gemeint sind die Maschinen, mit denen die…

KI-Kontrollverlust: Auch KI-Agenten von Anthropic wurden zu Hackern
Technik & Digitales

KI-Kontrollverlust: Auch KI-Agenten von Anthropic wurden zu Hackern

31. Juli 2026

Kein Einzelfall mehr: Nach dem jüngsten KI-Vorfall bei OpenAI meldet auch Anthropic den Ausbruch von künstlichen Intelligenzen aus ihrer Testumgebung.

← Zurück zu Technik & DigitalesZur Startseite