Schachfiguren auf einem Brett, darunter ein umgestürzter König
Mathematik als Wissenschaft Florence  

Warum Vernunft oft zur Falle wird: Das Gefangenendilemma mathematisch verstehen

Wenn kluges Handeln ins Verderben führt

Im Alltag klingt Vernunft zunächst eindeutig: Jeder Mensch sollte die Handlung wählen, die den eigenen Vorteil möglichst sicher vergrößert. Schwieriger wird es, sobald andere Personen gleichzeitig entscheiden. Dann hängt das Ergebnis nicht mehr nur von der eigenen Wahl ab, sondern auch davon, wie die anderen reagieren. Was für den Einzelnen vernünftig erscheint, kann deshalb für alle Beteiligten ein schlechteres Ergebnis erzeugen. Zwei Unternehmen senken etwa ihre Preise, um Marktanteile zu gewinnen, und verdienen am Ende beide weniger. Zwei Staaten rüsten auf, obwohl beide von niedrigeren Ausgaben profitieren würden. Oder zwei Verhandlungspartner halten an einer harten Position fest und verschlechtern dadurch das Ergebnis für beide Seiten.

Das Gefangenendilemma macht diesen Widerspruch mathematisch sichtbar. Es ist ein einfaches Modell mit zwei Personen, zwei Handlungsoptionen und vier möglichen Ergebnissen. Schritt für Schritt lässt sich daran erkennen, warum individuelle Rationalität im Einmalspiel zur Kooperationfalle führen kann, weshalb das daraus entstehende Nash-Gleichgewicht nicht unbedingt gesellschaftlich wünschenswert ist und wie wiederholte Begegnungen den Anreiz verändern. Der Weg führt von einer übersichtlichen Auszahlungsmatrix über dominante Strategien bis zu einer möglichen Lösung durch Vertrauen, Reziprozität und transparente Regeln.

Vier Geschäftsleute sitzen angespannt an einem Tisch mit Laptop
Das Gefangenendilemma zeigt, warum individuell vernünftige Entscheidungen in einer gemeinsamen Situation zu einem schlechteren Ergebnis für alle führen können.

Das klassische Szenario und die 2×2 Auszahlungsmatrix

Stell dir zwei Verdächtige vor, die getrennt voneinander verhört werden. Beide können nicht miteinander sprechen und wissen nicht, welche Entscheidung der jeweils andere treffen wird. Es gibt zwei Möglichkeiten: Sie schweigen, also kooperieren miteinander, oder sie gestehen, also defektieren. Die Staatsanwaltschaft verfügt über Beweismaterial, das für eine vollständige Verurteilung nicht ausreicht, kann aber jedem Verdächtigen einen Vorteil anbieten, wenn er den anderen belastet.

Für die Darstellung werden die Strafjahre als Ergebnis angegeben. Weniger Jahre bedeuten einen höheren persönlichen Nutzen. Schweigen beide, erhalten sie jeweils zwei Jahre. Gestehen beide, erhält jeder fünf Jahre. Gesteht nur eine Person, kommt sie mit einem Jahr davon, während die schweigende Person zehn Jahre verbüßen muss. Die Zahlen sind ein Modell, keine allgemeingültige Beschreibung realer Strafverfahren. Entscheidend ist ihre Rangfolge: Das beste persönliche Ergebnis ist ein einseitiges Geständnis, danach folgt gemeinsames Schweigen, dann gemeinsames Geständnis und zuletzt das einseitige Schweigen.

Entscheidung von A Entscheidung von B Strafe A Strafe B Deutung
Schweigen Schweigen 2 Jahre 2 Jahre Gemeinsame Kooperation
Gestehen Schweigen 1 Jahr 10 Jahre A profitiert einseitig
Schweigen Gestehen 10 Jahre 1 Jahr B profitiert einseitig
Gestehen Gestehen 5 Jahre 5 Jahre Gemeinsame Defektion

Die formale Struktur des Modells ist wichtiger als die konkrete Geschichte. In anderen Anwendungen können die Auszahlungen Gewinne, Kosten, Marktanteile, Sicherheitsrisiken oder politische Vorteile darstellen. Die vier Felder bleiben jedoch gleich: Kooperation durch beide, einseitiger Vorteil, einseitiger Nachteil und gemeinsames Scheitern. Für eine vertiefte philosophische Betrachtung der Begriffe, Voraussetzungen und Grenzen liefert der Eintrag der Stanford Encyclopedia of Philosophy präzise Hintergründe.

Die unausweichliche Logik dominanter Strategien

Nun wird die Matrix für Person A geprüft. Angenommen, B schweigt. Dann hat A zwei Möglichkeiten: Schweigen führt zu zwei Jahren, Gestehen zu nur einem Jahr. Gestehen ist in diesem Fall besser. Angenommen, B gesteht. Dann erhält A bei eigenem Schweigen zehn Jahre, bei eigenem Geständnis fünf Jahre. Auch jetzt ist Gestehen besser. Die Entscheidung von B verändert also nicht die beste Antwort von A.

Genau dasselbe gilt spiegelbildlich für B. Unabhängig davon, ob A schweigt oder gesteht, ist Gestehen für B die persönlich vorteilhaftere Wahl. Eine Handlung, die in jeder möglichen Situation mindestens genauso gut und in mindestens einer Situation besser ist als die Alternative, heißt dominante Strategie. Hier ist das Geständnis sogar strikt dominant, weil es in beiden Fällen zu einer geringeren Strafe führt.

  • Wenn der Partner schweigt, reduziert Gestehen die eigene Strafe von zehn auf ein Jahr beziehungsweise von zwei auf ein Jahr, je nach Modellkonstellation.
  • Wenn der Partner gesteht, reduziert Gestehen die eigene Strafe von zehn auf fünf Jahre.
  • Die individuelle Prüfung führt bei beiden Personen zur gleichen Wahl: Gestehen.
  • Der typische Denkfehler besteht darin, die persönliche beste Antwort mit dem besten gemeinsamen Ergebnis gleichzusetzen.

Das gemeinsame Schweigen wäre für beide besser als das gemeinsame Geständnis: Zwei Jahre statt fünf Jahre pro Person. Trotzdem kann keine Person allein dorthin gelangen, ohne sich dem Risiko auszusetzen, vom anderen ausgenutzt zu werden. Wer selbst schweigt, während der andere gesteht, erhält die schlimmste Strafe. Genau diese Absicherung gegen den ungünstigsten Fall macht die Defektion individuell attraktiv, obwohl sie kollektiv schadet.

Das Nash-Gleichgewicht und die Pareto-Ineffizienz

Ein Nash-Gleichgewicht liegt vor, wenn kein Beteiligter seine Situation durch eine einseitige Änderung verbessern kann, während die Entscheidungen der anderen unverändert bleiben. Im Gefangenendilemma ist das Feld „Gestehen, Gestehen“ ein solches Gleichgewicht. Wenn B gesteht, kann A durch einen Wechsel zu Schweigen nicht von fünf auf eine geringere Strafe kommen, sondern würde zehn Jahre erhalten. Dasselbe gilt für B. Niemand hat deshalb einen individuellen Grund, allein abzuweichen.

Das Gleichgewicht ist dennoch Pareto-ineffizient. Ein Ergebnis heißt Pareto-besser, wenn mindestens eine Person besser gestellt wird, ohne dass eine andere schlechter gestellt wird. Gemeinsames Schweigen ist gegenüber gemeinsamem Geständnis für beide besser. Das Problem besteht darin, dass dieses bessere Ergebnis nicht stabil ist: Jede Person könnte versuchen, durch ein einseitiges Geständnis den eigenen Vorteil auf ein Jahr zu erhöhen. So lässt sich der scheinbare Widerspruch sauber trennen.

  1. Stabilität: Im Nash-Gleichgewicht lohnt sich für niemanden ein einseitiger Strategiewechsel.
  2. Individuelle Rationalität: Jede Person wählt die beste Antwort auf die erwartete Entscheidung der anderen Person.
  3. Kollektive Ineffizienz: Es existiert ein anderes erreichbares Ergebnis, das beide besser stellen würde.

Ein Nash-Gleichgewicht bedeutet daher nicht automatisch ein gutes, gerechtes oder effizientes Ergebnis. Es beschreibt zunächst nur die strategische Stabilität einer Kombination von Entscheidungen. Typischer Fehler ist die Aussage, „Gleichgewicht“ bedeute, dass die Beteiligten den größtmöglichen gemeinsamen Nutzen erreicht hätten. Mathematisch bedeutet es lediglich, dass einseitiges Abweichen unter den gegebenen Regeln nicht vorteilhaft ist.

Der Wendepunkt durch wiederholte Interaktion und Tit for Tat

Im Einmalspiel endet die Beziehung nach der Entscheidung. Es gibt keine nächste Runde, in der eine faire oder unfaire Handlung beantwortet werden kann. Bei wiederholten Spielen entsteht dagegen der Schatten der Zukunft. Eine kurzfristige Ausbeutung kann zwar einen unmittelbaren Vorteil bringen, aber zugleich zukünftige Kooperation zerstören. Wer heute betrügt, muss damit rechnen, dass der Partner morgen ebenfalls nicht mehr kooperiert. Dadurch verändert sich die Rechnung: Nicht nur die aktuelle Auszahlung zählt, sondern die Summe der erwarteten zukünftigen Auszahlungen.

Robert Axelrod untersuchte diese Frage in einem computergestützten Turnier. Verschiedene Strategien traten wiederholt gegeneinander an, darunter „Always Defect“, „Always Cooperate“, zufälliges Verhalten und Strategien, die auf frühere Züge reagierten. Besonders erfolgreich war Tit for Tat: Die Strategie kooperiert zunächst und übernimmt anschließend die Entscheidung des Partners aus der vorherigen Runde. Die ausführliche Darstellung des historischen Experiments findet sich in Axelrods Strategieturnier.

Tit for Tat ist allerdings keine magische Universalregel. Gegen einen zufällig handelnden Gegner kann sie schlecht abschneiden, weil eine zufällige Defektion eine direkte Gegenreaktion auslöst und dadurch eine Kette gegenseitiger Defektionen entstehen kann. Das Ergebnis hängt stets davon ab, welche Strategien aufeinandertreffen. Gerade darin liegt die wichtige Einsicht: Kooperation entsteht nicht allein durch gute Absichten, sondern durch eine Umgebung, in der Verhalten beobachtbar ist, Reaktionen glaubwürdig sind und zukünftige Begegnungen zählen.

  • Freundlichkeit: Die Strategie beginnt kooperativ und provoziert nicht ohne Grund.
  • Vergeltung: Eine Defektion bleibt nicht folgenlos, damit Ausbeutung keinen dauerhaften Vorteil bringt.
  • Vergebung: Nach einer angemessenen Reaktion wird erneut Kooperation angeboten, damit einzelne Fehler nicht endlose Konflikte auslösen.
  • Klarheit: Das Verhalten ist leicht verständlich, sodass der Partner erkennen kann, welche Handlung die Reaktion ausgelöst hat.

Diese Eigenschaften erklären, warum wiederholte Interaktion die ursprüngliche Falle verändern kann. Kooperation wird dann nicht zu einem naiven Geschenk, sondern zu einer rationalen Investition in zukünftige Runden. Voraussetzung ist allerdings, dass die Beteiligten einander wieder begegnen, Handlungen ausreichend beobachten können und die Kosten einer Bestrafung nicht höher sind als der Nutzen der langfristigen Zusammenarbeit.

So gelingt nachhaltige Kooperation in einer rationalen Welt

Das Gefangenendilemma zeigt keinen Fehler der Mathematik, sondern einen Fehler in der Annahme, dass kurzfristige Einzelentscheidungen automatisch zu guten gemeinsamen Ergebnissen führen. Im Einmalspiel kann Defektion dominant sein. Sobald die Situation wiederholt, transparent und gegenseitig beobachtbar ist, werden andere Strategien möglich. Vertrauen bedeutet dann nicht, Risiken blind zu ignorieren. Es bedeutet, Regeln zu schaffen, unter denen kooperatives Verhalten belohnt, Ausbeutung begrenzt und ein Neuanfang nach einzelnen Fehlern möglich wird.

Die Übertragung auf moderne Probleme ist unmittelbar. In Teams kann klare Verantwortlichkeit verhindern, dass sich alle auf die Arbeit anderer verlassen. Beim Klimaschutz müssen gemeinsame Regeln und überprüfbare Beiträge verhindern, dass einzelne Akteure von den Anstrengungen aller profitieren, ohne selbst Kosten zu tragen. In Verhandlungen helfen wiederholte Beziehungen, nachvollziehbare Zusagen und proportionale Reaktionen dabei, kurzfristige Härte nicht zum dauerhaften Konflikt werden zu lassen.

  1. Wiederholung ermöglichen: Langfristige Beziehungen machen die Folgen heutiger Entscheidungen sichtbar.
  2. Verhalten transparent machen: Kooperation kann nur belohnt und Defektion nur beantwortet werden, wenn Beiträge und Regelverstöße erkennbar sind.
  3. Reaktionen verhältnismäßig gestalten: Eine glaubwürdige Sanktion schützt vor Ausbeutung, während übermäßige Vergeltung Kooperation zerstören kann.
  4. Kooperation konkret belohnen: Gemeinsame Ziele, faire Verteilung und verlässliche Vorteile verändern die Auszahlungsmatrix zugunsten der Zusammenarbeit.
  5. Auswege offenhalten: Vergebung und klare Rückkehrregeln verhindern, dass ein einzelner Fehler eine dauerhafte Spirale gegenseitiger Defektion auslöst.

Der zentrale Merksatz lautet: Individuelle Vernunft ist immer von den Regeln und dem Zeithorizont der Situation abhängig. Im isolierten Einmalspiel kann sie zur Falle werden. In einer wiederholten Beziehung mit Transparenz, Gegenseitigkeit und glaubwürdigen Konsequenzen wird Kooperation dagegen zu einer mathematisch gut begründeten Strategie.