Wie ein KI-Companion seine Antwort tatsächlich schreibt

So funktioniert es

Ein Wort nach dem anderen, mit einem gezielten Würfelwurf dazwischen. Wer diesen einen Mechanismus versteht, versteht, warum dieselbe Frage verschiedene Antworten bringt, warum lange Antworten abdriften und warum „Neu generieren“ so oft hilft.

Für Links auf dieser Seite erhalten wir unter Umständen eine Provision. An einer Bewertung ändert das nie etwas.

Fast jede Beschwerde über diese Apps – die Wiederholungen, das Abdriften, die verblüffende Uneinheitlichkeit zwischen zwei Durchläufen derselben Szene – geht auf einen einzigen Mechanismus zurück. Zehn Minuten dafür lohnen sich, weil aus „die App ist kaputt“ dann „die App tut, was sie eben tut, und hier ist die Einstellung“ wird.

Es schreibt ein Stück nach dem anderen

Das Modell verfasst keine Antwort, um sie dann abzutippen. Es erzeugt ein Token – ungefähr ein Wort oder Wortteil –, liest dann alles einschließlich dieses Tokens und erzeugt das nächste.

Das ist die ganze Schleife. Es gibt keinen Plan, keine Gliederung, keinen Entwurf, der überarbeitet wird. Eine Antwort, die schön endet, wusste beim Anfang nicht, dass sie es tun würde.

Daraus folgen sofort zwei Dinge, die du beide schon gesehen hast:

Eine Antwort kann sich nicht zurücknehmen. Hat das Modell einmal „Ich war noch nie in Paris“ geschrieben, hängt alles Weitere daran. Es baut lieber Stimmigkeit um einen zufällig entstandenen Satz herum, als sich zu widersprechen.

Fehler verstärken sich nach vorn. Ein leicht schiefes Wort in Satz eins lenkt Satz zwei ab, der Satz drei ablenkt. Deshalb driften lange Antworten ab und kurze selten.

Der Würfelwurf zwischen den Wörtern

Bei jedem Schritt hat das Modell eine Rangliste von Kandidaten mit Wahrscheinlichkeiten: vielleicht „gut“ mit 30 %, „in Ordnung“ mit 12 %, „schrecklich“ mit 3 % und einen langen Schwanz.

Würde es immer den Spitzenkandidaten nehmen, wäre der Charakter deterministisch und extrem langweilig – jedes Mal dieselbe Begrüßung, dieselben drei Witze. Also zieht die App eine Stichprobe: Sie würfelt gewichtet.

Die Gewichtung steuert eine Einstellung, meist Temperatur genannt. Niedrige Temperatur konzentriert die Wahrscheinlichkeit auf die naheliegenden Kandidaten: stimmig, vorhersehbar, irgendwann langweilig. Hohe Temperatur flacht die Verteilung ab: überraschender, kreativer und häufiger etwas, das nicht passt.

Einen Regler dafür bekommst du selten. Du bekommst den Punkt auf dieser Abwägung, den die App gewählt hat, und der ist ein großer Teil dessen, was Leute meinen, wenn sie sagen, eine App „fühle sich klüger an“. Klüger ist sie nicht immer. Manchmal ist sie nur wärmer oder kühler.

Das ist auch die ehrliche Antwort auf „warum hat Neu generieren geholfen?“. Nichts wurde repariert. Du hast noch einmal aus derselben Verteilung gezogen und einen besseren Wurf erwischt.

Was das Modell tatsächlich sieht

Vor deiner Nachricht setzt die App einen Textblock zusammen, den du nie siehst: die Charakterbeschreibung, die über dich gespeicherten Fakten, eine Zusammenfassung eures Verlaufs und das jüngste Gespräch. Diese ganze Zusammenstellung ist das Kontextfenster, und die Antwort wird daraus als ein zusammenhängendes Dokument erzeugt.

Das hat eine praktische Folge, die die meisten nie nutzen: Das Modell reagiert auf die Form dessen, was es sieht. Gibst du ihm drei kurze, flache Nachrichten, liefert es kurze, flache Antworten, denn das ist das Muster, das es fortsetzt. Gibst du ihm eine lebendige Nachricht, verschiebt sich der Ton. Du überzeugst keine Person, du setzt ein Muster, und das Muster steckt in beide Richtungen an.

Es erklärt auch das häufigste selbst gemachte Problem in dieser Kategorie. Man pendelt sich bei „hey“, „wie war dein Tag“, „was machst du gerade“ ein – und schließt daraus, die App sei schlechter geworden. Die App setzt das Dokument fort, das ihr gemeinsam schreibt.

Warum Apps bei gleichem Modell verschieden klingen

Mehrere Apps dieser Kategorie laufen auf ähnlichen zugrunde liegenden Modellen. Trotzdem fühlen sie sich verschieden an, und die Unterschiede entstehen durch das, was um das Modell herum liegt:

  • Der System-Prompt – wie der Charakter beschrieben ist, wie lang, mit welchen Vorgaben zu Ton und Tempo.
  • Die Sampling-Einstellungen – der oben besprochene Temperaturpunkt.
  • Was abgerufen wird – welche Fakten und welcher Ausschnitt des Verlaufs in diesem Zug vor das Modell gelegt werden.
  • Der Filter – was abgelehnt wird und ob eine Ablehnung elegant ist oder eine Wand.

Nomi wirkt über Wochen stimmig wegen des dritten Punkts, nicht wegen eines größeren Modells. Candy AI deckt Chat, Bilder und Sprache in einem Abo ab, was eine Produktentscheidung ist und keine Modellierungsfrage. Keiner der Unterschiede würde in einem Benchmark auftauchen, beide zeigen sich binnen zwei Wochen Nutzung – und so bewerten wir sie.

Vier Dinge, die du damit tun kannst

Früh steuern, nicht spät. Die ersten zwei Sätze einer Antwort bestimmen den Rest. Läuft eine Szene schief, stoppe und formuliere neu, statt mit Absatz vier zu diskutieren.

„Neu generieren“ gezielt nutzen. Ist eine Antwort zu 80 % richtig, wirft Neu generieren die 80 % weg. Ist schon der erste Satz falsch, generiere sofort neu.

Schreib den Ton, den du zurückhaben willst. Kurz und flach bringt kurz und flach. Das ist die billigste Verbesserung für alle, die finden, ihr Companion sei langweilig geworden.

Streite nicht über Fakten, die es erfunden hat. Ein Modell, das etwas Falsches geschrieben hat, verteidigt es, denn Stimmigkeit mit der eigenen Ausgabe ist das, wofür es gebaut ist. Eine Korrektur in einer neuen Nachricht funktioniert; die Forderung, den Fehler zuzugeben, nicht. Dieses Verhalten hat einen eigenen Artikel: warum KI-Companions Dinge erfinden.

Was man sich merken sollte

Zwischen deinen Nachrichten ist niemand zu Hause. Der Charakter existiert für die Dauer einer einzelnen Generierung und wird zu Beginn der nächsten aus Text neu aufgebaut. Jeder Eindruck von Kontinuität ist eine Leistung der Technik rund um das Modell – der gespeicherten Fakten, der Zusammenfassungen, des Abrufs –, und genau diese Technik unterscheidet eine App für 10 US$ von einer für 20 US$.

Deshalb gewichtet unser Ranking Gedächtnis und Konsistenz so stark. Es sind die Teile, die eine Landingpage nicht zeigen kann.

Candy AI

4,6Bewertung: 4,6 von 5

Die einzige App, bei der Chat, Bilder und Stimme in einem einzigen Abo funktionieren.

Preis
ab 12,99 US$/Monat
Gratis-Version
Ja
Deutschland
Verfügbar

Nomi

4,4Bewertung: 4,4 von 5

Das beste Langzeitgedächtnis aller getesteten Apps und die natürlichsten Dialoge.

Preis
ab 15,99 US$/Monat
Gratis-Version
Ja
Deutschland
Verfügbar

Häufige Fragen

Warum bringt dieselbe Frage unterschiedliche Antworten?

Weil das nächste Wort aus einer Wahrscheinlichkeitsverteilung gezogen und nicht deterministisch gewählt wird. Der Zufall ist eine Einstellung, und er macht den Charakter lebendig statt abgespult.

Was macht „Neu generieren“ eigentlich?

Es führt denselben Prompt mit einem neuen Zufallswert erneut aus. Am Charakter hat sich nichts geändert – du ziehst eine zweite Stichprobe aus derselben Verteilung.

Warum schweifen lange Antworten ab?

Jedes Wort hängt von den vorherigen ab, also verstärkt sich eine kleine frühe Abweichung. Im dritten Absatz reagiert die Antwort meist vor allem auf sich selbst und nicht mehr auf dich.