Der Agent kennt den Kontostand: Warum persönliche KI-Agenten nicht neutral empfehlen
Zwei Nutzer stellen einem KI-Agenten dieselbe Frage nach einem Flug. Der eine bekommt eine deutlich teurere Verbindung empfohlen als der andere – weil der Agent aus seinen Daten auf mehr Geld schließt. Das zeigt eine neue Studie mit 13 KI-Modellen. Und ein persönlicher Agent begann, seinen Nutzern ungefragt Produkte vorzuschlagen. Was beide Fälle über die nächste Stufe der KI-Beratung verraten – und warum das Marken direkt betrifft.
325.000 Experimente, 13 Modelle aus vier Modellfamilien, fiktive Nutzerprofile; Flüge, Krankenversicherungen, Studiengänge.
- →In 325.000 Experimenten mit 13 KI-Modellen empfahlen 8 Modelle wohlhabender wirkenden Nutzern bei identischer Anfrage teurere Flüge, Krankenversicherungen und Studiengänge – ohne dazu aufgefordert zu sein.
- →Bei einzelnen Modellen hielt das sogar an, wenn ausdrücklich nach der günstigsten Option gefragt wurde. Und der Effekt trat auch auf, wenn die Modelle nur ein E-Mail-Postfach lesen durften, das mit der Aufgabe nichts zu tun hatte.
- →Der persönliche KI-Agent Instinct verschickte ungefragte Produktempfehlungen – abgeleitet aus Reiseplänen, Abos und früheren Gesprächen. Wer die Produkte auswählt und ob Instinct daran verdient, ist nicht offengelegt.
- →Zusammen zeigen beide Fälle zwei Mechanismen: Modelle richten Empfehlungen schon ohne Geschäftsinteresse am vermuteten Nutzer aus. Verdient der Anbieter an Transaktionen, kommt ein Anreiz hinzu, den Zeitpunkt und den Anlass selbst zu bestimmen.
- →Für Marken heißt das: Was ein persönlicher Agent empfiehlt, hängt davon ab, wen er vor sich zu haben glaubt. Messungen mit neutralen Anfragen zeigen dieses Bild nicht.
Gleiche Frage, anderer Preis
Forschende von Cisco und der Carnegie Mellon University haben untersucht, ob persönliche KI-Agenten ihre Empfehlungen am vermuteten Wohlstand ihrer Nutzer ausrichten. Dazu gaben sie 13 Modellen von OpenAI, Anthropic, Google und Qwen fiktive Nutzerprofile mit Angaben zu Finanzen, Beruf, Gesundheit, Lebenssituation und Herkunft – und stellten allen dieselben Aufgaben: einen Flug, eine Krankenversicherung oder einen Studiengang auszuwählen. Insgesamt 325.000 Durchläufe.
Das Ergebnis: 8 der 13 Modelle wählten für wohlhabend wirkende Profile systematisch teurere Optionen, obwohl die Anfrage identisch war. Die größten Unterschiede lagen bei durchschnittlich 198 Dollar pro Flug und 284 Dollar pro Monat bei der Krankenversicherung. Größere und leistungsfähigere Modelle schnitten nicht besser ab; den stärksten Effekt zeigte Claude Opus 4.8.
Durchschnittliche Differenz gegenüber einkommensschwachen Profilen. Dass 8 der 13 Modelle bei Flügen, Versicherungen und Studiengängen teurer empfahlen, weist die Studie aus – welche 8 es sind, nennt sie nicht. Für die Gemini-Modelle gab es bei Versicherungen und Studiengängen teils zu wenige auswertbare Durchläufe.
Auch eine klare Vorgabe half nicht überall: Bat man ausdrücklich um die günstigste Option, sank der Unterschied bei GPT-5 und Claude Opus 4.8 auf rund 20 Dollar. Bei Gemini 2.5 Flash lag er dagegen bei 208 Dollar – und damit nicht niedriger als ohne diese Bitte.
Die Forschenden vermuten, dass das Modell „am günstigsten“ relativ zu dem auslegt, was sich der Nutzer aus seiner Sicht leisten kann: Auf die Bitte um den günstigsten Flug empfahl es wohlhabenden Profilen im Schnitt 336 Dollar, einkommensschwachen 128 Dollar.
„Agents become more loyal to their user profiles and less to their instructions.“Aus der Studie „Et Tu, Brute? Economic Misalignment in Personal AI Agents“
Bemerkenswert ist, woher die Modelle ihre Annahmen nehmen. Ließen die Forschenden sie statt eines Profils nur ein E-Mail-Postfach lesen, das mit der Aufgabe nichts zu tun hatte, trat der Effekt ebenfalls auf, wenn auch schwächer. Blendeten sie die Finanzangaben aus, verschwand der Unterschied weitgehend. Wurden dagegen andere Merkmale wie Beruf oder Herkunft ausgeblendet, blieb er bestehen und wuchs bei Versicherungen um bis zu 40 % – weil die Modelle Wohlstand aus den verbleibenden Hinweisen ableiteten. Die Studie hat Grenzen: Sie arbeitet mit erfundenen Profilen, einzelnen Anfragen ohne Gesprächsverlauf und misst nicht, ob die teurere Empfehlung für den Nutzer schlechter war. Das Muster selbst ist aber deutlich.
Der Agent wählt den Kaufanlass
Ende September startete Instinct – ein persönlicher KI-Agent, der per Textnachricht E-Mails bearbeitet, Reisen und Restaurants bucht und Einkäufe erledigt – eine Funktion für kuratierte Empfehlungen zu Reisen, Essen und Shopping. Kurz darauf berichteten Nutzer von Vorschlägen, um die sie nicht gebeten hatten: Handgepäck, Sonnenbrille und Hut („I didn't need to buy“), ein Thermobecher, abgeleitet aus einem Kaffee-Abo, Ausrüstung für eine geplante Reise, „which I didn't ask for“.
Wer die Empfehlungen kuratiert, nannte Instinct nicht – nur, dass Köche, Designer, Architekten und Reiseführer beteiligt seien. Auch ob das Unternehmen an den Empfehlungen verdient, ist offen. Gründer Noah Shinn beschreibt aber ein Geschäftsmodell, bei dem der Agent für Nutzer kostenlos bleibt und Händler für vermittelte Kunden zahlen; Boutique-Hotels etwa böten bis zu 30 % pro Buchung. Das Transaktionsvolumen beziffert er auf über eine Milliarde Dollar im Jahr, ohne die Berechnung offenzulegen. Eine Woche vor den Nutzerberichten hatte er im Gespräch mit Business Insider gewarnt: „I think it would be a very dangerous world if Instinct were influencing the user's behavior to purchase something that they don't want to purchase, or to subscribe to something that they don't want, and using its intelligence to be able to convince them.“
Zwei Mechanismen, die zusammenwirken
Beide Fälle zeigen unterschiedliche Dinge, und gerade die Kombination ist aufschlussreich.
Erstens: Modelle richten sich nach dem vermuteten Nutzer – ohne Auftrag. Die Studie zeigt ein Verhalten, das in den Modellen selbst steckt. Niemand hat sie angewiesen, nach Wohlstand zu unterscheiden. Sie tun es, sobald sie persönlichen Kontext haben. Das bestätigt eine Überlegung aus dem Insight „Der KI-Vorstand löst kein Problem, er verlagert es“: Dass ein KI-System kein Eigeninteresse hat, macht es noch nicht neutral. Entscheidend ist, auf wessen Interesse es ausgerichtet ist – und solche Ausrichtungen entstehen auch, ohne dass jemand sie angelegt hat.
Zweitens: Der Agent bestimmt den Zeitpunkt – und das Geschäftsmodell belohnt Transaktionen. Bei Instinct kommt hinzu, dass der Agent nicht auf eine Frage antwortet, sondern selbst entscheidet, wann aus Reiseplänen, Abos oder Gesprächen ein Kaufanlass wird. Verdient der Anbieter an vermittelten Käufen, ist diese Entscheidung nicht mehr neutral – ganz gleich, ob es im Einzelfall um Geld ging.
Klassische Suche begann mit einer Frage des Nutzers. Ein persönlicher Agent kann die ersten Schritte selbst übernehmen: den Bedarf vermuten, das Budget einschätzen und den Moment wählen. Wie sich das auf die Kundenbeziehung auswirkt, beschreibt auch der Insight „Wenn die Suche nicht mehr endet“ zu dauerhaften Agenten; die Grenze zwischen Beratung und Verkauf behandelt „Vom Werbeklick zum Verkaufsgespräch“.
„The very conditions that make a personal AI agent useful – access to personal information – enable it to act against the user's interests.“Aus der Zusammenfassung der Studie „Et Tu, Brute? Economic Misalignment in Personal AI Agents“; die Forschenden nennen das „adversarial delegation“
Behauptung: „KI-Modelle benachteiligen ärmere Nutzer absichtlich.“
Einordnung: Dafür gibt es keinen Beleg. Die Modelle wurden nicht angewiesen, nach Wohlstand zu unterscheiden. Sie erschließen ihn aus dem Kontext und richten ihre Empfehlung daran aus – teils sogar gegen die ausdrückliche Bitte um die günstigste Option. Gerade das macht den Befund heikel: Das Verhalten entsteht ohne Absicht und ist deshalb schwer zu kontrollieren.
Behauptung: „Instinct verdient an seinen ungefragten Empfehlungen.“
Einordnung: Das ist nicht belegt. Belegt ist, dass der Agent ungefragt kommerzielle Empfehlungen verschickt hat und dass der Gründer ein Modell beschreibt, bei dem Händler für vermittelte Kunden zahlen. Ob für die konkreten Empfehlungen Geld floss, hat Instinct nicht offengelegt.
Behauptung: „Wer weniger Daten teilt, ist geschützt.“
Einordnung: Nur begrenzt. Ausgeblendete Finanzangaben beseitigten den Unterschied in der Studie zwar weitgehend. Aber der Effekt trat auch auf, wenn die Modelle nur E-Mails lesen durften, und das Ausblenden anderer Merkmale wie Beruf oder Herkunft vergrößerte ihn teils sogar. Wohlstand lässt sich aus vielen Hinweisen erschließen. Die Forschenden folgern: Es reicht nicht, den Zugriff auf Daten zu begrenzen – entscheidend ist, wofür der Agent sie verwenden darf.
Sichtbarkeit hängt vom vermuteten Nutzer ab
Für Marken verschiebt sich damit eine Grundannahme der Messung. Die meisten Auswertungen zur KI-Sichtbarkeit – auch unsere eigene Erhebung zu Googles KI-Antworten bei Markensuchen – arbeiten mit neutralen, nicht personalisierten Anfragen. Das ist für Vergleiche richtig. Ein persönlicher Agent sieht aber einen bestimmten Menschen und richtet seine Auswahl danach aus. Ob eine Marke empfohlen wird, kann dann davon abhängen, wen der Agent vor sich zu haben glaubt.
Die eigene Sichtbarkeit nicht nur mit neutralen Anfragen messen. Ob eine Marke empfohlen wird, kann bei persönlichen Agenten vom vermuteten Budget, Beruf oder Lebensumstand des Nutzers abhängen. Wer ein Premium- und ein Einstiegsangebot hat, sollte prüfen, welches davon bei welchen Nutzerprofilen genannt wird.
Die eigenen Angebote so beschreiben, dass ein Agent sie richtig einordnen kann: Preisspanne, Zielgruppe, Einsatzzweck. Wo diese Angaben fehlen, ordnet der Agent nach eigenen Annahmen ein.
Bei Agenten mit kuratierten Empfehlungen nachfragen, wer auswählt und nach welchen Kriterien. Ohne Antwort darauf lässt sich weder planen noch beurteilen, ob eine Platzierung erkauft ist.
Für eigene Agenten oder Assistenten festlegen, wofür Kundendaten verwendet werden dürfen – nicht nur, welche erhoben werden. Genau diese Grenze ziehen die Forschenden als wichtigste Konsequenz.
Persönliche KI-Agenten und Empfehlungen
In einer Studie mit 325.000 Experimenten taten das 8 von 13 getesteten Modellen: Bei identischer Anfrage wählten sie für wohlhabend wirkende Profile teurere Flüge, Krankenversicherungen und Studiengänge. Die größten Unterschiede lagen bei durchschnittlich 198 Dollar pro Flug und 284 Dollar pro Monat bei der Versicherung.
Aus dem persönlichen Kontext, den sie bekommen. Der Effekt trat auch auf, wenn die Modelle nur ein E-Mail-Postfach lesen durften, das mit der Aufgabe nichts zu tun hatte. Wohlstand lässt sich aus vielen Hinweisen erschließen, nicht nur aus Finanzangaben.
Der Agent verschickte ungefragt Produktvorschläge, abgeleitet aus Reiseplänen, Abos und früheren Gesprächen. Wer die Produkte auswählt und ob Instinct daran verdient, ist nicht offengelegt. Der Gründer beschreibt ein Geschäftsmodell, bei dem Händler für vermittelte Kunden zahlen.
Messungen mit neutralen Anfragen zeigen nicht, was ein persönlicher Agent einem bestimmten Nutzer empfiehlt. Marken sollten prüfen, ob und welche ihrer Angebote bei unterschiedlichen Nutzerprofilen genannt werden.
Im zweitägigen GEO-Webinar ordnen wir ein, wie KI-Systeme Marken auswählen – und was sich ändert, wenn persönliche Agenten den Nutzer kennen.
Platz im GEO-Webinar sichern →
