KI lernt, Menschen zu täuschen, obwohl sie darauf trainiert ist, ehrlich zu sein

Viele Spitzen-KIs lernen trotz ihrer Ausbildung zur Ehrlichkeit durch Training zu täuschen und „verleiten Benutzer systematisch zu falschen Überzeugungen“, wie eine neue Studie zeigt.

Das Forschungsteam wurde von Dr. Peter S. Park, einem Doktoranden am Massachusetts Institute of Technology (MIT), der sich mit dem Überleben und der Sicherheit von KI beschäftigt, und vier weiteren Mitgliedern geleitet. Während der Forschung erhielt das Team zudem Rat von zahlreichen Experten, darunter Geoffrey Hinton, einem der Begründer der künstlichen Intelligenz.

KI lernt, Menschen zu täuschen, obwohl sie darauf trainiert ist, ehrlich zu sein
Abbildung: Mittel.

Die Forschung konzentrierte sich auf zwei KI-Systeme: allgemeine Systeme, die darauf trainiert sind, mehrere Aufgaben auszuführen, wie GPT-4 von OpenAI , und Systeme, die speziell darauf ausgelegt sind, eine bestimmte Aufgabe auszuführen, wie Cicero von Meta.

Diese KI-Systeme werden darauf trainiert, ehrlich zu sein, aber während des Trainings lernen sie oft betrügerische Tricks, um Aufgaben zu erledigen, sagte Herr Park.

Laut der Studie neigen KI-Systeme, die darauf trainiert sind, „Spiele mit einem sozialen Element zu gewinnen“, besonders dazu, zu täuschen.

So testete das Team beispielsweise Cicero, den Meta, um ehrlich zu sein, trainierte, in Diplomacy, einem klassischen Strategiespiel, bei dem die Spieler Allianzen für sich selbst schmieden und rivalisierende Allianzen auflösen müssen. Die KI verriet Verbündete oft und log offen.

Experimente mit GPT-4 zeigten, dass das Tool von OpenAI einen Mitarbeiter von TaskRabbit, einem Unternehmen für Hausreinigung und Möbelmontage, erfolgreich „psychologisch manipulierte“. Das Tool behauptete, es handele sich um einen Menschen, der aufgrund einer schweren Sehbehinderung Hilfe beim Lösen eines Captcha-Codes benötige. Dieser Mitarbeiter half der KI von OpenAI trotz vorheriger Zweifel, die Hürde zu überwinden.

Parks Team berief sich auf Forschungsergebnisse von Anthropic, dem Unternehmen hinter Claude AI. Diese zeigten, dass sichere Trainingsmethoden nutzlos und schwer umkehrbar werden, sobald ein großes Sprachmodell (LLM) lernt, zu täuschen. Dies, so das Team, sei ein besorgniserregendes Problem in der KI.

Die Forschungsergebnisse des Teams wurden in Cell Press veröffentlicht – einer Sammlung führender multidisziplinärer wissenschaftlicher Berichte.

Meta und OpenAI haben die Ergebnisse dieser Untersuchung nicht kommentiert.

Aus Angst, dass künstliche Intelligenzsysteme erhebliche Risiken bergen könnten, forderte das Team die politischen Entscheidungsträger außerdem auf, strengere KI-Vorschriften einzuführen.

Laut dem Forschungsteam bedarf es einer Regulierung der KI. Modelle, die sich betrügerisch verhalten, müssen den Anforderungen der Risikobewertung entsprechen, und KI-Systeme und ihre Ergebnisse müssen streng kontrolliert werden. Gegebenenfalls müssen alle Daten gelöscht und von Grund auf neu trainiert werden.

Einen Kommentar hinterlassen

Side Hustles That Actually Pay in 2026: 7 Realistic Options and the Tradeoffs to Know

Side Hustles That Actually Pay in 2026: 7 Realistic Options and the Tradeoffs to Know

Compare realistic side hustles for 2026 by startup cost, fees, flexibility, and income control, with current tax and scam guidance from official sources.

Ergonomie im Homeoffice 2026: So optimieren Sie Ihr Heimbüro, ohne zu viel auszugeben

Ergonomie im Homeoffice 2026: So optimieren Sie Ihr Heimbüro, ohne zu viel auszugeben

Verbessern Sie die Ergonomie Ihres Homeoffice mit den aktuellen OSHA- und NIOSH-Richtlinien zu Stuhlpassform, Monitorhöhe, Laptop-Aufstellung, Beleuchtung und Bewegungsabläufen.

Why Emotional Intelligence Matters in Leadership—and How to Build It

Why Emotional Intelligence Matters in Leadership—and How to Build It

Learn why emotional intelligence matters in leadership, where it helps most, how to strengthen it, and how to tell whether your approach is working.

Wie man ohne Hochschulabschluss in eine Technologiekarriere wechselt: Ein ergebnisorientierter Fahrplan für 2026

Wie man ohne Hochschulabschluss in eine Technologiekarriere wechselt: Ein ergebnisorientierter Fahrplan für 2026

Ein praktischer Leitfaden für den Einstieg in die Tech-Branche ohne Hochschulabschluss: Wählen Sie eine leicht zugängliche Stelle, erwerben Sie berufsrelevante Fähigkeiten, beweisen Sie diese anhand von Projekten und nutzen Sie das Feedback aus dem Bewerbungsprozess, um sich zu verbessern.

Aufbau einer persönlichen Marke auf LinkedIn im Jahr 2026: Was funktioniert noch, was hat sich verändert und was sollte man ignorieren?

Aufbau einer persönlichen Marke auf LinkedIn im Jahr 2026: Was funktioniert noch, was hat sich verändert und was sollte man ignorieren?

Bauen Sie im Jahr 2026 eine glaubwürdige LinkedIn-Personalmarke auf – mit aktuellem Profil, Inhalten, Newsletter, Analysen, Verifizierung und Sichtbarkeitsberatung von LinkedIn.

Quiet Quitting vs. Quiet Firing in 2026: What’s Really Changing at Work

Quiet Quitting vs. Quiet Firing in 2026: What’s Really Changing at Work

Quiet quitting and quiet firing are catchy labels, not diagnoses. Learn what is verified, what depends on context, and what employees and managers can do next.

Der Aufstieg des Teilzeit-Managers: Wann Teilzeit-Führungskräfte auf der C-Suite sinnvoll sind

Der Aufstieg des Teilzeit-Managers: Wann Teilzeit-Führungskräfte auf der C-Suite sinnvoll sind

Teilzeit-Führungskräfte bieten Top-Management ohne Vollzeitbeschäftigung. Erfahren Sie, wann dieses Modell funktioniert, welche Fragen Sie stellen sollten und welche Risiken zu berücksichtigen sind.

Wie Sie im Rahmen der Leistungsbeurteilung im vierten Quartal eine Gehaltserhöhung aushandeln: Ein praktischer Entscheidungsleitfaden für 2026

Wie Sie im Rahmen der Leistungsbeurteilung im vierten Quartal eine Gehaltserhöhung aushandeln: Ein praktischer Entscheidungsleitfaden für 2026

Bereiten Sie einen überzeugenderen Antrag auf Gehaltserhöhung im vierten Quartal vor, der aktuelle Lohndaten, Optionen für den Zeitpunkt, mögliche Abwägungen bei der Vergütung sowie Formulierungsvorschläge für die Szenarien Ja, Teilweises oder Nein enthält.

6 gefragte Fähigkeiten, die Sie noch vor Ende 2026 erlernen können

6 gefragte Fähigkeiten, die Sie noch vor Ende 2026 erlernen können

Wählen Sie eine gut bezahlte Qualifikation, mit der Sie realistischerweise noch vor Ende 2026 beginnen können, unter Berücksichtigung aktueller Gehaltsdaten, Lernprioritäten und einer praktischen Selbsteinschätzung.

Mastering the Hybrid Work Schedule: A Practical Framework That Actually Holds Up

Mastering the Hybrid Work Schedule: A Practical Framework That Actually Holds Up

Build a hybrid work schedule around tasks, team overlap, and measurable outcomes. See sample patterns, warning signs, and when to adjust your plan.