Gehen Sie von den Rahmenbedingungen aus, nicht von der Bestenliste. Notieren Sie Ihr Latenzbudget, Ihre Kostenobergrenze pro Anfrage, Ihren Kontextbedarf, ob Sie Tool-Calling oder strukturierte Ausgaben benötigen und wohin die Daten fließen dürfen. Diese fünf Punkte scheiden meist schon die meisten Kandidaten aus. Testen Sie die verbleibenden zwei oder drei an fünfzig realen Fällen aus Ihrem eigenen Traffic, vergleichen Sie fallweise statt im Durchschnitt, und wählen Sie das günstigste Modell, das besteht.
Diagnostizieren Sie zuerst den Fehler. Wenn das Modell etwas nicht weiß, besteht eine Wissenslücke, die sich durch Retrieval schließen lässt. Wenn das Modell über das nötige Wissen verfügt, aber in der falschen Form, im falschen Ton oder Format antwortet, liegt eine Verhaltenslücke vor: Zunächst hilft Prompting, an zweiter Stelle die Feinabstimmung. Scheitert das Modell trotz beider Maßnahmen an einer spezialisierten Fähigkeit, bleibt die Feinabstimmung. Prompting ist am günstigsten und leicht umkehrbar, Retrieval ist die richtige Standardlösung für Fakten, und die Feinabstimmung ist von den drei Optionen die teuerste und am schwersten rückgängig zu machen.
KI-Beschleuniger verbrauchen pro Rack weitaus mehr Strom als herkömmliche Server, und diese Leistung muss kontinuierlich bereitgestellt, gekühlt und bezahlt werden. Das Training eines großen Modells ist ein einmaliger Spitzenbedarf; die Bereitstellung für Millionen von Benutzern ist eine permanente Last, und die Inferenz dominiert den Energieverbrauch über die Lebensdauer eines eingesetzten Modells.
Retrieval-augmented Generation ist ein Muster, bei dem das System Ihre eigenen Dokumente nach relevanten Passagen zu einer Frage durchsucht, diese Passagen in den Prompt des Modells einfügt und das Modell bittet, diese zu verwenden, um zu antworten. Die Gewichte des Modells ändern sich nie; das Wissen kommt zur Laufzeit als Kontext.
Ein KI-Agent ist ein Sprachmodell, dem Werkzeuge zum Aufrufen, ein Ziel und die Erlaubnis gegeben wurden, mehrere Schritte zu gehen, ohne dazwischen einen Menschen zu fragen. Ein Chatbot beantwortet eine Frage und hört auf; ein Agent handelt weiter, bis er das Ziel für erreicht hält oder sein Budget aufgebraucht ist.
Open Weights heißt, dass die trainierte Modelldatei heruntergeladen und selbst betrieben werden kann — unter der Lizenz, die der Herausgeber gewählt hat. Open Source ist ein strengerer rechtlicher Standard, der Freiheit zur Nutzung, Untersuchung, Änderung und Weitergabe ohne Einsatzbeschränkungen verlangt. Viele verbreitete Modelle sind Open Weights, aber nicht Open Source.
Fast jede KI-API rechnet pro Million Tokens ab, mit separaten Preisen für Input und Output. Output kostet in der Regel ein Vielfaches des Inputs. Gecachter Input, Batch-Verarbeitung und kleinere Modelle können die Rechnung jeweils erheblich senken, und die Gesamtkosten für eine Konversation steigen mit der Historie, da die meisten APIs den gesamten Thread bei jedem Durchgang erneut senden.
Ein Kontextfenster ist die maximale Menge an Text, gemessen in Token, die ein Modell in einer einzelnen Anfrage berücksichtigen kann. Es enthält die Systemanweisungen, die aktuelle Konversation, beliebige Dokumente, die Sie einfügen, und die gerade erzeugte Antwort. Wenn die Gesamtsumme die Grenze überschreitet, muss etwas verworfen oder zusammengefasst werden.