Skip to content
DigitalNeuron

Modelle & Forschung

Neue Frontier-Modelle, Benchmarks, Trainingsmethoden und die Forschung dahinter.

14 Beiträge

Google DeepMind rekonstruiert mit KI unaufgezeichnete Erinnerung eines Paares in „Love, Rendered“

Google DeepMind teilt mit, gemeinsam mit Filmemachern an „Love, Rendered“ gearbeitet zu haben, einer Dokumentation, die mithilfe generativer Bildrestaurierung und Performance-Capture-Modelle eine Erinnerung für Burt und Ethelle Shatz nachbildete, ein seit über 70 Jahren verheiratetes Paar, die nie fotografiert oder gefilmt worden war. Google weist zudem darauf hin, dass Nutzer mit der Gemini-App Familienfotos restaurieren und kolorieren können.

2 Min. Lesezeit

Upstage stellt Syn Pro vor, ein gemeinsam mit Karakuri entwickeltes japanischsprachiges Sprachmodell

Upstage hat mit Syn Pro ein japanischsprachiges Large Language Model veröffentlicht, das gemeinsam mit Karakuri Inc. entwickelt wurde. Nach Angaben von Upstage belegt das Modell unter den lokal trainierten japanischen LLMs mit weniger als 32 Milliarden Parametern den ersten Platz, führt zudem die globale Top-20-Liste des Nejumi Leaderboard an und lässt sich sowohl on-premises als auch in einer Private Cloud oder auf kundeneigenen GPUs betreiben.

2 Min. Lesezeit

DeepSeek veröffentlicht V4.1-Flash mit nativem Bildverständnis

DeepSeek hat V4.1-Flash veröffentlicht, ein Mixture-of-Experts-Modell mit 552 Milliarden Parametern und nativem visuellem Verständnis. Das Unternehmen erklärt, seine asymmetrische Architektur aktiviere 8 Milliarden Parameter für die Eingabe und 16 Milliarden für die Ausgabe. Das Modell ist über die DeepSeek-API verfügbar, wo es mit neuen Preisen für Spitzen- und Nebenzeiten abgerechnet wird.

2 Min. Lesezeit

Upstage stellt Solar Mini vor, ein kompaktes Open-Source-Sprachmodell

Upstage hat Solar Mini vorgestellt, ein kompaktes großes Sprachmodell, das auf einer 32-schichtigen Llama-2-Architektur basiert und mit den Gewichten von Mistral 7B initialisiert wurde. Nach Angaben des Unternehmens kombiniert die Depth-Up-Scaling-Methode eine Skalierung in die Tiefe mit fortgesetztem Vortraining. Solar Mini ist unter der Apache-2.0-Lizenz öffentlich verfügbar.

2 Min. Lesezeit

Anthropic erläutert, wie Forschungslabore wissenschaftliche Agenten auf Basis von Claude entwickeln

Anthropic veröffentlichte am 15. Januar 2026 eine Fallstudie über drei Forschungslabore — das Biomni-Projekt und das Lundberg Lab der Stanford University sowie das Cheeseman Lab des MIT —, die Claude-gestützte Systeme für Aufgaben wie die Interpretation von Genclustern, die Analyse biomedizinischer Daten und die Auswahl experimentell zu untersuchender Gene entwickelt haben.

3 Min. Lesezeit

Feinabstimmung, Retrieval oder ein besserer Prompt: So treffen Sie die richtige Wahl

Diagnostizieren Sie zuerst den Fehler. Wenn das Modell etwas nicht weiß, besteht eine Wissenslücke, die sich durch Retrieval schließen lässt. Wenn das Modell über das nötige Wissen verfügt, aber in der falschen Form, im falschen Ton oder Format antwortet, liegt eine Verhaltenslücke vor: Zunächst hilft Prompting, an zweiter Stelle die Feinabstimmung. Scheitert das Modell trotz beider Maßnahmen an einer spezialisierten Fähigkeit, bleibt die Feinabstimmung. Prompting ist am günstigsten und leicht umkehrbar, Retrieval ist die richtige Standardlösung für Fakten, und die Feinabstimmung ist von den drei Optionen die teuerste und am schwersten rückgängig zu machen.

6 Min. Lesezeit

Analyse: Lange Kontextfenster haben Retrieval nicht überflüssig gemacht – sie haben seine Aufgabe verändert

Nein, aber sie verändern dessen Aufgabe. Ein sehr großes Fenster vollständig zu befüllen, verschlechtert die Genauigkeit bei Informationen, die in der Mitte vergraben sind, vervielfacht Latenz und Kosten bei jeder Anfrage und erschwert es, die Quelle einer Antwort nachzuvollziehen. Retrieval bleibt die richtige Standardlösung für große oder sich ändernde Datenbestände, für alles, was Zitierfähigkeit oder Zugriffskontrolle erfordert, sowie für kostensensible Anwendungen mit hohem Volumen. Lange Kontextfenster eignen sich heute vor allem für das Verständnis ganzer Dokumente, als Arbeitsgedächtnis von Agenten innerhalb einer Aufgabe und als zweite Stufe, nachdem Retrieval die Auswahl bereits eingegrenzt hat.

7 Min. Lesezeit

Analyse: Öffentliche Benchmarks sagen die Qualität im Produktiveinsatz nicht mehr voraus – so entsteht ein aussagekräftiger Evaluierungsdatensatz

Öffentliche Benchmarks messen eng umrissene, statische und weithin veröffentlichte Aufgaben. Zudem sind sie zunehmend durch Trainingsdaten verunreinigt und werden direkt zum Optimierungsziel. Die Qualität im Produktiveinsatz hängt von Ihren Prompts, Dokumenten, Werkzeugschemata und Ihrer Fehlertoleranz ab – Faktoren, die keine Rangliste erfasst. Die praktikable Lösung ist ein privater Evaluierungsdatensatz mit 50 bis 300 realen Fällen und dokumentiertem Sollverhalten. Er wird bei jeder Änderung am Modell oder Prompt ausgeführt und, soweit möglich, anhand exakter Prüfungen bewertet, andernfalls durch ein Modell, das nach einem festgelegten Kriterienkatalog urteilt.

6 Min. Lesezeit

Anthropic veröffentlicht zweiten Economic-Index-Bericht zur Nutzung von Claude 3.7 Sonnet

Der zweite Economic-Index-Bericht von Anthropic zeigt eine steigende Nutzung von Claude.ai in den Bereichen Programmierung, Bildung, Wissenschaft und Gesundheitswesen nach dem Start von Claude 3.7 Sonnet. Der erweiterte Denkmodus wurde am häufigsten von technischen Berufsgruppen genutzt. Der Anteil der Augmentierung blieb mit 57 Prozent der Nutzung stabil, und Anthropic veröffentlichte eine neue Nutzungstaxonomie mit 630 Kategorien sowie Daten zur Automatisierung auf Aufgabenebene.

3 Min. Lesezeit

MiniMax veröffentlicht Speech 2.8 mit Sound-Tags und Stimmenklonen

MiniMax stellte Speech 2.8 vor, ein synthetisches Sprachmodell mit nativen Sound-Tags für Atmen und Zögern, Stimmklonung aus einer 10-Sekunden-Probe und einer Verarbeitung, die Rauschen und Verzerrungen reduzieren soll. Das Unternehmen gibt außerdem an, die sprachübergreifende Sprachverarbeitung für Mandarin und Japanisch verbessert und das Modell über seine Plattform und sein Audio-Produkt verfügbar gemacht zu haben.

2 Min. Lesezeit

DeepSeek veröffentlicht das multimodale Modell V4-Flash-Vision-Exp

DeepSeek hat DeepSeek-V4-Flash-Vision-Exp veröffentlicht, ein experimentelles multimodales Modell auf seiner API-Plattform. Das Unternehmen gibt an, dass es bei Textaufgaben mit DeepSeek-V4-Flash gleichzieht und dabei Vision hinzufügt, und beansprucht einen deutlichen Sprung bei der Leistung in multimodalen Agenten-Benchmarks gegenüber V4-Flash, nahe an Opus-4.8. DeepSeek hat zudem eine kostenlose Files API sowie DeepSeek Harness 0.1.1 eingeführt.

1 Min. Lesezeit

Was ist RAG (Retrieval-Augmented Generation) und wann braucht man es?

Retrieval-augmented Generation ist ein Muster, bei dem das System Ihre eigenen Dokumente nach relevanten Passagen zu einer Frage durchsucht, diese Passagen in den Prompt des Modells einfügt und das Modell bittet, diese zu verwenden, um zu antworten. Die Gewichte des Modells ändern sich nie; das Wissen kommt zur Laufzeit als Kontext.

4 Min. Lesezeit

Was ist ein Kontextfenster, und warum ist es ausgeschöpft?

Ein Kontextfenster ist die maximale Menge an Text, gemessen in Token, die ein Modell in einer einzelnen Anfrage berücksichtigen kann. Es enthält die Systemanweisungen, die aktuelle Konversation, beliebige Dokumente, die Sie einfügen, und die gerade erzeugte Antwort. Wenn die Gesamtsumme die Grenze überschreitet, muss etwas verworfen oder zusammengefasst werden.

4 Min. Lesezeit