Google DeepMind teilt mit, gemeinsam mit Filmemachern an „Love, Rendered“ gearbeitet zu haben, einer Dokumentation, die mithilfe generativer Bildrestaurierung und Performance-Capture-Modelle eine Erinnerung für Burt und Ethelle Shatz nachbildete, ein seit über 70 Jahren verheiratetes Paar, die nie fotografiert oder gefilmt worden war. Google weist zudem darauf hin, dass Nutzer mit der Gemini-App Familienfotos restaurieren und kolorieren können.
Upstage hat mit Syn Pro ein japanischsprachiges Large Language Model veröffentlicht, das gemeinsam mit Karakuri Inc. entwickelt wurde. Nach Angaben von Upstage belegt das Modell unter den lokal trainierten japanischen LLMs mit weniger als 32 Milliarden Parametern den ersten Platz, führt zudem die globale Top-20-Liste des Nejumi Leaderboard an und lässt sich sowohl on-premises als auch in einer Private Cloud oder auf kundeneigenen GPUs betreiben.
DeepSeek hat V4.1-Flash veröffentlicht, ein Mixture-of-Experts-Modell mit 552 Milliarden Parametern und nativem visuellem Verständnis. Das Unternehmen erklärt, seine asymmetrische Architektur aktiviere 8 Milliarden Parameter für die Eingabe und 16 Milliarden für die Ausgabe. Das Modell ist über die DeepSeek-API verfügbar, wo es mit neuen Preisen für Spitzen- und Nebenzeiten abgerechnet wird.
Upstage hat Solar Mini vorgestellt, ein kompaktes großes Sprachmodell, das auf einer 32-schichtigen Llama-2-Architektur basiert und mit den Gewichten von Mistral 7B initialisiert wurde. Nach Angaben des Unternehmens kombiniert die Depth-Up-Scaling-Methode eine Skalierung in die Tiefe mit fortgesetztem Vortraining. Solar Mini ist unter der Apache-2.0-Lizenz öffentlich verfügbar.
Upstage launched Solar Pro 4, an API-accessible model designed for multi-step agent work involving documents, tools and terminal tasks. The company says it supports a 512K-token context window, produces up to 128K output tokens, handles English, Korean and Japanese, and reports when supplied evidence cannot support an answer.
Anthropic veröffentlichte am 15. Januar 2026 eine Fallstudie über drei Forschungslabore — das Biomni-Projekt und das Lundberg Lab der Stanford University sowie das Cheeseman Lab des MIT —, die Claude-gestützte Systeme für Aufgaben wie die Interpretation von Genclustern, die Analyse biomedizinischer Daten und die Auswahl experimentell zu untersuchender Gene entwickelt haben.
Diagnostizieren Sie zuerst den Fehler. Wenn das Modell etwas nicht weiß, besteht eine Wissenslücke, die sich durch Retrieval schließen lässt. Wenn das Modell über das nötige Wissen verfügt, aber in der falschen Form, im falschen Ton oder Format antwortet, liegt eine Verhaltenslücke vor: Zunächst hilft Prompting, an zweiter Stelle die Feinabstimmung. Scheitert das Modell trotz beider Maßnahmen an einer spezialisierten Fähigkeit, bleibt die Feinabstimmung. Prompting ist am günstigsten und leicht umkehrbar, Retrieval ist die richtige Standardlösung für Fakten, und die Feinabstimmung ist von den drei Optionen die teuerste und am schwersten rückgängig zu machen.
Nein, aber sie verändern dessen Aufgabe. Ein sehr großes Fenster vollständig zu befüllen, verschlechtert die Genauigkeit bei Informationen, die in der Mitte vergraben sind, vervielfacht Latenz und Kosten bei jeder Anfrage und erschwert es, die Quelle einer Antwort nachzuvollziehen. Retrieval bleibt die richtige Standardlösung für große oder sich ändernde Datenbestände, für alles, was Zitierfähigkeit oder Zugriffskontrolle erfordert, sowie für kostensensible Anwendungen mit hohem Volumen. Lange Kontextfenster eignen sich heute vor allem für das Verständnis ganzer Dokumente, als Arbeitsgedächtnis von Agenten innerhalb einer Aufgabe und als zweite Stufe, nachdem Retrieval die Auswahl bereits eingegrenzt hat.
Öffentliche Benchmarks messen eng umrissene, statische und weithin veröffentlichte Aufgaben. Zudem sind sie zunehmend durch Trainingsdaten verunreinigt und werden direkt zum Optimierungsziel. Die Qualität im Produktiveinsatz hängt von Ihren Prompts, Dokumenten, Werkzeugschemata und Ihrer Fehlertoleranz ab – Faktoren, die keine Rangliste erfasst. Die praktikable Lösung ist ein privater Evaluierungsdatensatz mit 50 bis 300 realen Fällen und dokumentiertem Sollverhalten. Er wird bei jeder Änderung am Modell oder Prompt ausgeführt und, soweit möglich, anhand exakter Prüfungen bewertet, andernfalls durch ein Modell, das nach einem festgelegten Kriterienkatalog urteilt.
Der zweite Economic-Index-Bericht von Anthropic zeigt eine steigende Nutzung von Claude.ai in den Bereichen Programmierung, Bildung, Wissenschaft und Gesundheitswesen nach dem Start von Claude 3.7 Sonnet. Der erweiterte Denkmodus wurde am häufigsten von technischen Berufsgruppen genutzt. Der Anteil der Augmentierung blieb mit 57 Prozent der Nutzung stabil, und Anthropic veröffentlichte eine neue Nutzungstaxonomie mit 630 Kategorien sowie Daten zur Automatisierung auf Aufgabenebene.
MiniMax stellte Speech 2.8 vor, ein synthetisches Sprachmodell mit nativen Sound-Tags für Atmen und Zögern, Stimmklonung aus einer 10-Sekunden-Probe und einer Verarbeitung, die Rauschen und Verzerrungen reduzieren soll. Das Unternehmen gibt außerdem an, die sprachübergreifende Sprachverarbeitung für Mandarin und Japanisch verbessert und das Modell über seine Plattform und sein Audio-Produkt verfügbar gemacht zu haben.
DeepSeek hat DeepSeek-V4-Flash-Vision-Exp veröffentlicht, ein experimentelles multimodales Modell auf seiner API-Plattform. Das Unternehmen gibt an, dass es bei Textaufgaben mit DeepSeek-V4-Flash gleichzieht und dabei Vision hinzufügt, und beansprucht einen deutlichen Sprung bei der Leistung in multimodalen Agenten-Benchmarks gegenüber V4-Flash, nahe an Opus-4.8. DeepSeek hat zudem eine kostenlose Files API sowie DeepSeek Harness 0.1.1 eingeführt.
Retrieval-augmented Generation ist ein Muster, bei dem das System Ihre eigenen Dokumente nach relevanten Passagen zu einer Frage durchsucht, diese Passagen in den Prompt des Modells einfügt und das Modell bittet, diese zu verwenden, um zu antworten. Die Gewichte des Modells ändern sich nie; das Wissen kommt zur Laufzeit als Kontext.
Ein Kontextfenster ist die maximale Menge an Text, gemessen in Token, die ein Modell in einer einzelnen Anfrage berücksichtigen kann. Es enthält die Systemanweisungen, die aktuelle Konversation, beliebige Dokumente, die Sie einfügen, und die gerade erzeugte Antwort. Wenn die Gesamtsumme die Grenze überschreitet, muss etwas verworfen oder zusammengefasst werden.