Das Telefon klingelt. Am anderen Ende meldet sich eine Stimme, die jede Zweifel sofort erstickt, weil sie exakt so klingt wie die des eigenen Kindes oder Enkelkindes. Die Person weint, ist außer Atem, berichtet von einem Unfall oder einer Festnahme und braucht in den nächsten Minuten Geld. Genau dieses Szenario erleben in Deutschland derzeit tausende Familien pro Monat, und in einem wachsenden Teil der Fälle stammt die vertraute Stimme gar nicht von einem Menschen, sondern aus einer Software. Der klassische Enkeltrick, den es seit den 1990er-Jahren gibt, hat ein technologisches Upgrade erhalten. Fachleute sprechen inzwischen vom Enkeltrick 2.0.
Dieser Artikel erklärt, wie Kriminelle künstliche Intelligenz für diese Betrugsmasche einsetzen, was technisch dahintersteckt, welche Schutzmechanismen es gibt – und warum sie im Ernstfall trotzdem oft zu spät kommen.
Vom Enkeltrick zum Enkeltrick 2.0: Was ist neu?
Der ursprüngliche Enkeltrick funktionierte über Psychologie, nicht über Technik. Ein Anrufer eröffnete das Gespräch mit einer Frage wie „Rate mal, wer hier spricht?" und ließ das Opfer selbst einen Namen nennen, den der Betrüger dann übernahm. Wer genau hinhörte, konnte den Betrug oft an der fremden Stimme oder an fehlendem Detailwissen erkennen. Genau diese beiden Schutzmechanismen hebelt die neue Generation des Betrugs aus.
Für einen überzeugenden Stimmklon reichen heute wenige Sekunden Audiomaterial, häufig aus einem öffentlich zugänglichen Social-Media-Video. Damit lässt sich eine synthetische Kopie erzeugen, die nicht nur den Klang, sondern auch Sprachmelodie, Betonung und sogar emotionale Nuancen wie Weinen oder Zittern nachbildet. Der wichtigste Erkennungsfaktor der alten Masche, die unbekannte Stimme, fällt damit komplett weg.
Kriminelle nutzen die Technik heute in drei typischen Varianten:
- Modernisierter Enkeltrick: Die geklonte Stimme eines Kindes oder Enkelkindes meldet sich mit einem angeblichen Notfall.
- CEO-Fraud: Mitarbeitende erhalten eine vermeintlich dringende Anweisung der Geschäftsführung, meist verbunden mit einer Geldüberweisung.
- Schockanruf: Eine angebliche Polizei- oder Behördenstimme baut mit einem dramatischen Szenario sofortigen Handlungsdruck auf.
So funktioniert Voice Cloning: Die Technik hinter der Täuschung
Um zu verstehen, warum diese Betrugsmasche so wirkungsvoll geworden ist, lohnt sich ein Blick auf die Technik. Zwei Verfahren kommen dabei zum Einsatz, die oft verwechselt werden:
Text-to-Speech (TTS) wandelt geschriebenen Text in gesprochene Sprache um, meist mit einer vorgefertigten, generischen KI-Stimme. Das kennt man von Navigationsgeräten oder Vorlesefunktionen.
Voice Cloning geht einen Schritt weiter: Es rekonstruiert die Stimme einer ganz bestimmten, realen Person. Dafür analysiert ein Modell eine kurze Referenzaufnahme und extrahiert daraus ein sogenanntes Stimm-Embedding, eine mathematische Repräsentation von Tonhöhe, Klangfarbe, Sprechtempo und charakteristischen Eigenheiten. Mit diesem Embedding kann das System anschließend beliebigen neuen Text in genau dieser Stimme aussprechen, inklusive Atempausen und emotionaler Färbung.

Bis vor wenigen Jahren brauchte ein überzeugender Klon noch mehrere Minuten sauberes Audiomaterial. Heute genügen professionellen wie kriminellen Anbietern teils schon wenige Sekunden aus einem Instagram-Video oder einer Sprachnachricht. Diese gesunkene technische Hürde ist der eigentliche Grund, warum sich der Enkeltrick 2.0 so schnell verbreitet.
Die unsichtbare Tool-Chain: Was bei jeder KI-Anfrage im Hintergrund passiert
Was viele nicht wissen: Hinter jeder Anfrage an ein KI-System, ob es sich um einen harmlosen Chat oder eine Sprachsynthese handelt, läuft im Hintergrund eine mehrstufige Verarbeitungskette ab. Diese Tool-Chain ist bei seriösen Anbietern unabhängig davon aktiv, wofür man die KI gerade nutzt, und sie erklärt sowohl die Stärken als auch die Schwachstellen der heutigen Schutzmechanismen.
Eingabe und Normalisierung. Zunächst wird die Eingabe technisch aufbereitet. Bei Sprachklon-Diensten bedeutet das etwa, dass hochgeladenes Audiomaterial auf ein einheitliches Lautstärkeniveau gebracht und von Störgeräuschen bereinigt wird, damit das nachfolgende Modell sauber arbeiten kann.
Prüfung vor der Verarbeitung. Noch bevor die eigentliche KI-Anfrage bearbeitet wird, läuft bei vielen Anbietern ein vorgeschalteter Sicherheitsfilter. Dieser gleicht ab, ob eine Anfrage gegen Nutzungsrichtlinien verstößt, etwa weil eine fremde, nicht autorisierte Stimme geklont werden soll. Seriöse Anbieter verlangen inzwischen einen Einwilligungsnachweis: Die Person, deren Stimme geklont werden soll, muss einen vom System vorgegebenen Satz einsprechen, der dann mit der Anfrage abgeglichen und als Nachweis gespeichert wird.
Die eigentliche Modell-Inferenz. Erst danach verarbeitet das eigentliche KI-Modell die Anfrage. Bei der Sprachsynthese wird der gewünschte Text zunächst in eine phonetische Struktur übersetzt, mit dem zuvor extrahierten Stimm-Embedding verknüpft und von einem sogenannten Vocoder in eine tatsächliche Audiowellenform umgewandelt.
Prüfung nach der Verarbeitung. Nach der Generierung läuft häufig ein weiterer, nachgelagerter Filter, der das Ergebnis noch einmal bewertet, bevor es ausgeliefert wird. In diesem Schritt betten viele Anbieter inzwischen auch unsichtbare Wasserzeichen in ihre Audioausgaben ein, damit KI-generierte Inhalte später als solche identifiziert werden können.
Protokollierung und Missbrauchserkennung. Im Hintergrund werten Anbieter zudem Nutzungsmuster aus, um verdächtige Häufungen zu erkennen, etwa auffällig viele Klon-Anfragen zu prominenten oder öffentlichen Personen.
Diese gesamte Kette läuft bei jeder einzelnen Anfrage in Sekundenbruchteilen ab, egal ob jemand für ein Hörbuch, einen Werbespot oder eben für einen Betrugsanruf eine Stimme erzeugen lässt. Genau hier liegt aber auch die Grenze dieses Schutzsystems: Es funktioniert nur, wenn der Anbieter die Kette tatsächlich implementiert hat. Kriminelle greifen stattdessen auf frei verfügbare, quelloffene Klon-Werkzeuge ohne Einwilligungsprüfung zurück, betreiben eigene, nicht regulierte Infrastruktur oder nutzen Dienste außerhalb der EU, die sich nicht an die hier beschriebenen Standards halten. Aktuelle Forschung zeigt zudem, dass selbst technische Schutzmaßnahmen wie akustische Störsignale, die eigentlich das Klonen einer Stimme verhindern sollen, sich mit spezialisierten Bereinigungsverfahren teilweise wieder umgehen lassen. Die Tool-Chain ist also kein Selbstläufer, sondern ein Wettlauf zwischen Schutzmechanismen und ihrer Umgehung, der branchenübergreifend weitergeht.

Der Ablauf eines Betrugsanrufs: So gehen die Täter vor
Die Masche folgt einem wiederkehrenden Muster. Anrufe erfolgen bevorzugt spät abends oder am Wochenende, wenn die vermeintlich betroffene Person selbst schwerer erreichbar ist und Familienmitglieder weniger Zeit zur Rückversicherung haben. Über sogenanntes Nummern-Spoofing erscheint auf dem Display häufig eine vertrauenswürdig wirkende deutsche Rufnummer, obwohl der Anruf tatsächlich aus dem Ausland kommt.
Nach den ersten emotionalen Sätzen der geklonten Stimme schalten sich in vielen Fällen weitere Anrufer dazu, die sich als Polizeibeamte oder Rechtsanwälte ausgeben und mit Fachjargon zusätzlichen Druck aufbauen. Ziel ist immer, so wenig Bedenkzeit wie möglich zu lassen, denn jede Minute, in der das Opfer nachdenkt oder Rücksprache hält, erhöht das Risiko, dass der Betrug auffliegt.
Zahlen, die aufhorchen lassen
Das Ausmaß der Entwicklung zeigt sich in mehreren aktuellen Kennzahlen. Die Bundesnetzagentur registrierte allein im Januar 2026 über 555.000 gemeldete betrügerische Anrufe, wobei von einer erheblichen Dunkelziffer auszugehen ist. In einer weltweiten Umfrage des Sicherheitsunternehmens McAfee gab etwa ein Viertel der Befragten an, selbst einen Betrugsanruf mit einer geklonten KI-Stimme erlebt zu haben oder ein Opfer aus dem eigenen Umfeld zu kennen.
Das Bundeskriminalamt erfasste für das Jahr 2024 im Bereich Enkeltrick und Schockanrufe rund 6.700 Fälle, KI-gestützte Betrugsversuche werden dabei bislang noch nicht separat ausgewiesen. Allein in Bayern erbeuteten Betrüger im Jahr 2023 über 18 Millionen Euro durch diese Betrugsform, mit Einzelfällen im sechsstelligen Bereich.
Wie konkret die Schäden ausfallen können, zeigen dokumentierte Fälle der vergangenen Monate: In Düsseldorf verlor ein Ehepaar rund 230.000 Euro in Bargeld und Goldmünzen an einen angeblichen Anwalt. In Pfaffenhofen übergab eine 60-Jährige 60.000 Euro auf einem Supermarktparkplatz. Im Kanton Schwyz in der Schweiz überwies ein Unternehmer im Januar 2026 mehrere Millionen Franken, nachdem Täter die Stimme seines Geschäftspartners geklont hatten. Bereits 2019 hatte ein früher Fall von KI-CEO-Betrug in Großbritannien Aufsehen erregt, bei dem eine geklonte Stimme mit leichtem deutschen Akzent eine Überweisung von 220.000 Euro auslöste.
Warnsignale, auf die man sich nicht mehr verlassen kann
Viele der klassischen Ratschläge zur Erkennung von Betrugsanrufen stammen aus einer Zeit vor leistungsfähigem Voice Cloning und sind inzwischen überholt. Wer auf eine „roboterhaft klingende" oder monoton wirkende Stimme wartet, wird enttäuscht: Moderne Klone transportieren mittlerweile auch Atmen, Zögern und emotionale Ausbrüche glaubwürdig. Auch die früher hilfreiche Kontrollfrage nach einem gemeinsamen Familiengeheimnis verliert an Wirkung, wenn Täter zuvor gezielt Informationen aus sozialen Netzwerken gesammelt haben.
Was stattdessen tatsächlich schützt, ist weniger eine Frage des genauen Hinhörens als eine feste Verhaltensregel, die unabhängig davon funktioniert, wie perfekt eine Stimme klingt.
Konkrete Schutzmaßnahmen für Familien
Verbraucherschützer und Polizeibehörden empfehlen inzwischen ein klares, einfach zu merkendes Vorgehen:

Ein Familien-Codewort vereinbaren. Legen Sie gemeinsam mit engen Angehörigen ein geheimes Wort fest, das nur die Familie kennt und das bei einem verdächtigen Notruf abgefragt wird. Ein Sprachklon kann eine Stimme nachbilden, aber kein vorher nicht bekanntes Codewort erraten.
Grundsätzlich aktiv zurückrufen. Legen Sie bei einem unerwarteten Notruf auf und rufen Sie die betroffene Person aktiv unter der Ihnen bereits bekannten, gespeicherten Nummer zurück, niemals unter einer vom Anrufer genannten Nummer.
Zeitdruck als Alarmsignal werten. Jede Aufforderung, sofort und ohne Rücksprache mit anderen Familienmitgliedern zu handeln, sollte grundsätzlich misstrauisch machen, unabhängig davon, wie überzeugend die Stimme klingt.
Nie Bargeld an Unbekannte übergeben. Weder Polizei noch Staatsanwaltschaft fordern in Deutschland jemals telefonisch die Übergabe von Bargeld, Schmuck oder Kaution an der Haustür oder auf offener Straße. Jede derartige Forderung ist ein eindeutiges Betrugsmerkmal.
Eigene Social-Media-Inhalte bewusst einschränken. Da bereits wenige Sekunden öffentlich zugänglichen Videomaterials für einen Klon ausreichen, lohnt sich ein kritischer Blick auf die Reichweite eigener Sprachaufnahmen in sozialen Netzwerken, besonders bei älteren und potenziell gefährdeten Familienmitgliedern.
Ältere Angehörige aktiv einbeziehen. Da Sprachklon-Betrug besonders auf ältere Menschen abzielt, hilft es, das Thema offen im Familienkreis anzusprechen und die Codewort-Regelung gemeinsam einzuüben, statt nur allgemein zu warnen.
Kennzeichnungspflicht seit August 2026: Was der EU AI Act ändert
Seit dem 2. August 2026 gelten die Transparenzpflichten aus Artikel 50 der europäischen KI-Verordnung verbindlich. Anbieter von KI-Systemen müssen seither sicherstellen, dass ihre generierten Ausgaben maschinenlesbar als künstlich erzeugt gekennzeichnet werden, bei Deepfakes zusätzlich auch für Menschen direkt erkennbar. Das gilt ausdrücklich auch für synthetische Stimmen: Wird eine Sprachnachricht oder ein Anruf mit einer geklonten Stimme erzeugt, muss die betroffene Person formal darüber informiert werden.
Technisch setzt die Branche dafür zunehmend auf offene Standards wie C2PA, die Herkunft und Bearbeitungsschritte einer Datei kryptografisch signieren, sowie auf unsichtbare Wasserzeichen wie SynthID von Google DeepMind, das inzwischen auch von anderen großen Anbietern für KI-generierte Audioinhalte eingesetzt wird.
Für die Praxis bedeutet das allerdings nur bedingt Entwarnung. Die Kennzeichnungspflicht richtet sich an den Anrufer, und bei einer kriminell organisierten Bande greift diese Vorschrift naturgemäß ins Leere. Für ein Opfer am Telefon ändert das gesetzliche Gebot im Moment des Anrufs zunächst nichts, wertvoll wird die Regulierung vor allem im Nachhinein, etwa bei der strafrechtlichen Aufarbeitung von Fällen, sowie langfristig durch den Druck auf seriöse Anbieter, ihre Schutzmechanismen weiter auszubauen.
Was tun, wenn der Ernstfall eintritt
Wer einen verdächtigen Anruf erhalten oder bereits Geld überwiesen hat, sollte umgehend die Polizei über den Notruf 110 informieren, keinesfalls über eine vom Anrufer genannte Nummer. Bereits getätigte Überweisungen sollten sofort bei der eigenen Bank gemeldet werden, da ein Rückruf innerhalb der ersten Stunden die Chance auf eine Rückbuchung deutlich erhöht. Zusätzlich empfiehlt es sich, den Vorfall auch bei der Verbraucherzentrale zu melden, da diese Daten helfen, Warnmuster frühzeitig zu erkennen und weiterzugeben.
Fazit
Der Enkeltrick 2.0 ist deshalb so wirkungsvoll, weil er eine jahrzehntealte psychologische Betrugsmasche mit einer Technik verbindet, die noch vor wenigen Jahren undenkbar war. Die gute Nachricht: Der wirksamste Schutz ist nicht technischer, sondern organisatorischer Natur.
Ein vereinbartes Familien-Codewort und die feste Regel, im Zweifel aufzulegen und aktiv zurückzurufen, funktionieren unabhängig davon, wie perfekt eine geklonte Stimme irgendwann klingen wird. Während Gesetzgeber und Anbieter mit Kennzeichnungspflichten und Wasserzeichen technisch nachziehen, bleibt für Familien im Alltag vor allem eines entscheidend: eine vorher getroffene Verabredung schlägt jede noch so überzeugende Stimme am Telefon.
KI-Beratung, KI-Lösungen
Leistungsangebot:
- Erstberatung inkl. Machbarkeitsaussagen
- Schulungen und Workshops für Führungskräfte, Berufsgeheimnisträger, Angestellte, Entwickler
- KI-Lösungen mit und ohne ChatGPT/Azure. Cloud oder eigener KI-Server

gekennzeichnet.

Mein Name ist Klaus Meffert. Ich bin promovierter Informatiker und beschäftige mich seit über 30 Jahren professionell und praxisbezogen mit Informationstechnologie. In IT & Datenschutz bin ich auch als Sachverständiger tätig. Ich stehe für pragmatische Lösungen mit Mehrwert. Meine Firma, die 