Viele denken, eine KI-Companion-App sei eine einzige Intelligenz, die reden, zeichnen und sprechen kann. In Wahrheit sind es drei oder vier getrennte Systeme, die die App zusammenschaltet. Die meisten Ärgernisse in diesem Bereich entstehen an den Nahtstellen dazwischen.
Drei Motoren, eine Oberfläche
Das Sprachmodell führt das Gespräch. Es erzeugt Text und sonst nichts.
Das Bildmodell ist ein völlig anderes System, meist ein Diffusionsmodell. Es bekommt eine Textbeschreibung und liefert ein Bild. Dein Gespräch hat es nie gesehen.
Das Sprachsystem wandelt Text in Audio um. Auch das ist getrennt und kennt nur den einen Satz, den es bekommt.
Wenn du deine Companion-Figur um ein Selfie bittest, passiert Folgendes: Das Sprachmodell schreibt eine kurze Beschreibung des gewünschten Bildes, die App hängt die gespeicherten Aussehens-Tags der Figur an, dieser kombinierte Prompt geht ans Bildmodell, und ein Bild kommt zurück. Der Chat reagiert dann auf ein Bild, das er nicht sehen kann, nur anhand der Beschreibung, die er selbst geschrieben hat.
Diese Staffette ist die Quelle fast aller Beschwerden über Medien in dieser Kategorie.
Warum sich das Gesicht ständig ändert
Ein Diffusionsmodell ruft deine Figur nicht ab, es erzeugt jemanden, der zu einer Beschreibung passt. „Lange dunkle Haare, grüne Augen, Mitte zwanzig“ passt auf Millionen Gesichter, und du bekommst jedes Mal ein anderes.
Apps lösen das unterschiedlich gut:
- Gespeicherte Aussehens-Tags: jedes Mal dieselbe Beschreibung. Billig, aber nur grob konsistent.
- Ein Referenzbild, das jede Erzeugung steuert. Deutlich besser und der übliche Weg, wenn Gesichter wiedererkennbar bleiben.
- Ein angepasstes Modell pro Figur: am konsistentesten und mit Abstand am teuersten, deshalb meist nur in höheren Tarifen.
Das ist ein echtes Unterscheidungsmerkmal, das du in der Gratis-Version testen solltest, bevor du zahlst. Erzeuge vier Bilder derselben Figur in verschiedenen Situationen. Bekommst du vier verschiedene Frauen, behebt kein Abo das Problem. Die Konsistenz über mehrere Bilder ist ein großer Grund, warum Candy AI unser Ranking anführt und warum Secret Desires, das Aussehen, Stimme und Persönlichkeit gemeinsam aufbaut und kurze Videos ergänzt, hier punktet.
Warum Medien immer begrenzt sind
Text ist billig. Eine Chat-Antwort kostet den Betreiber einen Bruchteil eines Cents.
Ein Bild kostet pro Erzeugung spürbar mehr. Sprache wird pro Sekunde Audio abgerechnet. Video ist noch einmal dramatisch teurer als beide.
Dieser Kostenunterschied erklärt die gesamte Preisstruktur, die du überall in dieser Kategorie siehst: großzügige Nachrichtenkontingente, knappe Bildlimits, Sprachminuten separat, Video nur in oberen Tarifen. Das ist keine künstliche Verknappung, um dir etwas aufzudrängen, sondern die tatsächliche Form der Rechnung, die der Betreiber bekommt und weiterreicht.
Deshalb heißt „unbegrenzt“ in diesem Markt fast immer unbegrenzter Text. Wenn du es so liest, ergeben die Preisseiten plötzlich Sinn. Die Rechnung steht in was KI-Bilder wirklich kosten.
Was Sprache bringt und was sie kostet
Sprache verändert das Erlebnis stärker, als die meisten erwarten. Eine Nachricht zu lesen und sie zu hören ist etwas anderes, und der Unterschied ist größer, als die technische Beschreibung vermuten lässt.
Zwei Dinge solltest du prüfen, bevor du dafür zahlst:
Latenz. Eine Pause von drei Sekunden vor jeder Antwort zerstört die Illusion völlig. Teste das in einer Gratis-Version oder einem Test, nicht anhand eines Demovideos.
Anruf oder Nachricht? Sprachnachrichten, bei denen die Figur ihre Antwort vorliest, sind verbreitet und billig. Echtzeit-Anrufe, bei denen du sprichst und sie antwortet, sind ein anderes Produkt und meist ein anderer Tarif. Nomi führt Sprachanrufe unter seinen Funktionen auf. Viele Apps schreiben „Sprache“ und meinen Sprachnachrichten.
Was Bilder nicht können
Zwei Grenzen, die du kennen solltest, bevor du enttäuscht wirst:
Hände, Text und feine Details bleiben bei jedem Generator in dieser Kategorie unzuverlässig. Niemand hat das gelöst, und eine App, die etwas anderes verspricht, beschreibt ihr bestes Ergebnis statt ihres Durchschnitts.
Das Bild kennt deine Szene nicht. Das Chat-Modell schreibt einen einzeiligen Prompt, alles, was nicht in dieser Zeile steht, geht verloren: der Raum, den du beschrieben hast, was sie vor drei Nachrichten trug, die Tageszeit. Wer in der Anfrage ausdrücklich wird, behebt mehr davon als mit jeder Einstellung.
So beurteilst du die Medienseite an einem Abend
Verbrauche das gesamte Kontingent einer Gratis-Version in einer Sitzung, statt ein Bild pro Tag zu erzeugen. Du testest vier Dinge:
- Konsistenz: vier Bilder, dieselbe Figur, verschiedene Situationen.
- Prompt-Treue: Bitte um etwas Bestimmtes und sieh, wie viel davon ankommt.
- Latenz: bei Bildern und bei Sprache.
- Was aufs Limit zählt: ob auch eine fehlgeschlagene oder abgelehnte Erzeugung etwas kostet.
Das Letzte ist am schlechtesten dokumentiert und nach dem Bezahlen am ärgerlichsten. Zusammen mit dem Rest von was die Gratis-Versionen wirklich enthalten zeigt es sich nur, wenn du das Produkt richtig benutzt.

