Skip to content
DigitalNeuron

Erklärt

Verständliche Antworten auf wiederkehrende KI-Fragen. Wird laufend aktualisiert.

Wie man ein KI-Modell für ein reales Produkt auswählt

Gehen Sie von den Rahmenbedingungen aus, nicht von der Bestenliste. Notieren Sie Ihr Latenzbudget, Ihre Kostenobergrenze pro Anfrage, Ihren Kontextbedarf, ob Sie Tool-Calling oder strukturierte Ausgaben benötigen und wohin die Daten fließen dürfen. Diese fünf Punkte scheiden meist schon die meisten Kandidaten aus. Testen Sie die verbleibenden zwei oder drei an fünfzig realen Fällen aus Ihrem eigenen Traffic, vergleichen Sie fallweise statt im Durchschnitt, und wählen Sie das günstigste Modell, das besteht.

5 Min. Lesezeit

Feinabstimmung, Retrieval oder ein besserer Prompt: So treffen Sie die richtige Wahl

Diagnostizieren Sie zuerst den Fehler. Wenn das Modell etwas nicht weiß, besteht eine Wissenslücke, die sich durch Retrieval schließen lässt. Wenn das Modell über das nötige Wissen verfügt, aber in der falschen Form, im falschen Ton oder Format antwortet, liegt eine Verhaltenslücke vor: Zunächst hilft Prompting, an zweiter Stelle die Feinabstimmung. Scheitert das Modell trotz beider Maßnahmen an einer spezialisierten Fähigkeit, bleibt die Feinabstimmung. Prompting ist am günstigsten und leicht umkehrbar, Retrieval ist die richtige Standardlösung für Fakten, und die Feinabstimmung ist von den drei Optionen die teuerste und am schwersten rückgängig zu machen.

6 Min. Lesezeit

Warum verbraucht KI so viel Strom?

KI-Beschleuniger verbrauchen pro Rack weitaus mehr Strom als herkömmliche Server, und diese Leistung muss kontinuierlich bereitgestellt, gekühlt und bezahlt werden. Das Training eines großen Modells ist ein einmaliger Spitzenbedarf; die Bereitstellung für Millionen von Benutzern ist eine permanente Last, und die Inferenz dominiert den Energieverbrauch über die Lebensdauer eines eingesetzten Modells.

4 Min. Lesezeit

Was ist RAG (Retrieval-Augmented Generation) und wann braucht man es?

Retrieval-augmented Generation ist ein Muster, bei dem das System Ihre eigenen Dokumente nach relevanten Passagen zu einer Frage durchsucht, diese Passagen in den Prompt des Modells einfügt und das Modell bittet, diese zu verwenden, um zu antworten. Die Gewichte des Modells ändern sich nie; das Wissen kommt zur Laufzeit als Kontext.

4 Min. Lesezeit

Open Weights vs. Open Source bei KI: was die Bezeichnungen wirklich bedeuten

Open Weights heißt, dass die trainierte Modelldatei heruntergeladen und selbst betrieben werden kann — unter der Lizenz, die der Herausgeber gewählt hat. Open Source ist ein strengerer rechtlicher Standard, der Freiheit zur Nutzung, Untersuchung, Änderung und Weitergabe ohne Einsatzbeschränkungen verlangt. Viele verbreitete Modelle sind Open Weights, aber nicht Open Source.

3 Min. Lesezeit

Wie KI-Modellpreise tatsächlich funktionieren: Tokens, Caching und Batching

Fast jede KI-API rechnet pro Million Tokens ab, mit separaten Preisen für Input und Output. Output kostet in der Regel ein Vielfaches des Inputs. Gecachter Input, Batch-Verarbeitung und kleinere Modelle können die Rechnung jeweils erheblich senken, und die Gesamtkosten für eine Konversation steigen mit der Historie, da die meisten APIs den gesamten Thread bei jedem Durchgang erneut senden.

3 Min. Lesezeit

Was ist ein Kontextfenster, und warum ist es ausgeschöpft?

Ein Kontextfenster ist die maximale Menge an Text, gemessen in Token, die ein Modell in einer einzelnen Anfrage berücksichtigen kann. Es enthält die Systemanweisungen, die aktuelle Konversation, beliebige Dokumente, die Sie einfügen, und die gerade erzeugte Antwort. Wenn die Gesamtsumme die Grenze überschreitet, muss etwas verworfen oder zusammengefasst werden.

4 Min. Lesezeit