Google DeepMind afirma que colaboró con cineastas en 'Love, Rendered', un documental que empleó modelos generativos de restauración de imágenes y captura de interpretación para recrear un recuerdo de Burt y Ethelle Shatz, una pareja casada desde hace más de 70 años, que nunca fue fotografiado ni filmado. Google también señala que los usuarios pueden restaurar y colorear fotos familiares con la aplicación Gemini.
Upstage ha lanzado Syn Pro, un modelo de lenguaje de gran escala en japonés desarrollado junto con Karakuri Inc. Upstage afirma que el modelo ocupa el primer puesto entre los LLM japoneses entrenados localmente con menos de 32.000 millones de parámetros, se sitúa entre los 20 primeros a nivel mundial en el Nejumi Leaderboard, y puede implementarse de forma local (on-premises), en una nube privada o en GPU propias del cliente.
DeepSeek lanzó V4.1-Flash, un modelo de mezcla de expertos con 552.000 millones de parámetros y comprensión visual nativa. La compañía afirma que su arquitectura asimétrica activa 8.000 millones de parámetros para la entrada y 16.000 millones para la salida. El modelo ya está disponible a través de la API de DeepSeek, donde cuenta con nuevos precios de hora punta y de hora valle.
Upstage presentó Solar Mini, un modelo de lenguaje de gran tamaño compacto basado en una arquitectura Llama 2 de 32 capas e inicializado con los pesos de Mistral 7B. La empresa afirma que su método de ampliación de profundidad combina el escalado en profundidad con un preentrenamiento continuo. Solar Mini está disponible públicamente bajo la licencia Apache 2.0.
Upstage lanzó Solar Pro 4, un modelo accesible mediante API y diseñado para tareas de agentes de varios pasos que implican documentos, herramientas y operaciones en terminal. La empresa afirma que admite una ventana de contexto de 512K tokens, genera hasta 128K tokens de salida, trabaja en inglés, coreano y japonés, e informa cuando las pruebas aportadas no permiten sustentar una respuesta.
Anthropic publicó un caso de estudio el 15 de enero de 2026 en el que describe tres laboratorios de investigación —el proyecto Biomni de Stanford, el Cheeseman Lab del MIT y el Lundberg Lab de Stanford— que desarrollaron sistemas basados en Claude para tareas como la interpretación de clústeres genéticos, el análisis de datos biomédicos y la selección de genes para estudiar experimentalmente.
Primero, diagnostique el fallo. Si el modelo desconoce algo, existe una carencia de conocimiento y la recuperación la subsana. Si el modelo sabe la respuesta, pero la presenta con una estructura, un tono o un formato incorrectos, existe una carencia de comportamiento: se corrige primero mediante prompting y, en segundo lugar, con ajuste fino. Si, pese a ambas medidas, el modelo falla en una habilidad especializada, la opción restante es el ajuste fino. El prompting es lo más barato y reversible; la recuperación es la opción predeterminada adecuada para los datos factuales; y el ajuste fino es la alternativa más cara y menos reversible de las tres.
No, pero cambian su función. Llenar una ventana muy grande reduce la precisión cuando la información está oculta en la parte central, multiplica la latencia y el coste de cada solicitud y dificulta determinar de qué fuente procede una respuesta. La recuperación sigue siendo la opción predeterminada adecuada para corpus grandes o cambiantes, para cualquier tarea que requiera citas o control de acceso y para procesos de gran volumen sensibles al coste. Ahora, el contexto extenso se aprovecha mejor para razonar sobre documentos completos, como memoria de trabajo de los agentes durante una tarea y como segunda etapa después de que la recuperación haya acotado el campo.
Los benchmarks públicos miden tareas estrechas, estáticas y ampliamente publicadas, y cada vez están más contaminados por los datos de entrenamiento y optimizados de forma directa para superarlos. La calidad en producción depende de los prompts propios, los documentos propios, los esquemas de herramientas propios y la tolerancia a fallos de cada equipo, nada de lo cual mide ninguna tabla de clasificación. La respuesta práctica es un conjunto de evaluación privado de entre 50 y 300 casos reales con el comportamiento esperado registrado, que se ejecuta con cada cambio de modelo o de prompt, puntuado mediante comprobaciones exactas cuando es posible y, cuando no, mediante un modelo juez guiado por una rúbrica.
El segundo informe del Índice Económico de Anthropic constató un aumento del uso de Claude.ai en programación, educación, ciencia y atención sanitaria tras el lanzamiento de Claude 3.7 Sonnet. El modo de pensamiento extendido fue utilizado sobre todo en profesiones técnicas. La ampliación de capacidades se mantuvo estable en el 57% del uso, y Anthropic publicó una nueva taxonomía de 630 categorías de uso, además de datos sobre automatización a nivel de tareas.
MiniMax presentó Speech 2.8, un modelo de voz sintética con etiquetas de sonido nativas para respiraciones y vacilaciones, clonación de voz a partir de una muestra de 10 segundos y un procesamiento diseñado para reducir el ruido y la distorsión. La empresa también afirma que mejoró la síntesis de voz interlingüística para el mandarín y el japonés, y que puso el modelo a disposición a través de su plataforma y su producto Audio.
DeepSeek lanzó DeepSeek-V4-Flash-Vision-Exp, un modelo multimodal experimental disponible en su plataforma API. La empresa afirma que iguala a DeepSeek-V4-Flash en tareas de texto, al tiempo que incorpora capacidades de visión, y asegura que ofrece una importante mejora en el rendimiento de las pruebas de referencia para agentes multimodales respecto a V4-Flash, acercándose a Opus-4.8. DeepSeek también lanzó una API de archivos gratuita y DeepSeek Harness 0.1.1.
La generación aumentada por recuperación es un patrón en el que el sistema busca en sus propios documentos pasajes relevantes para una pregunta, introduce esos pasajes en el prompt del modelo y le pide al modelo que responda utilizándolos. Los pesos del modelo nunca cambian; el conocimiento llega como contexto en el momento de la solicitud.
Una ventana de contexto es la cantidad máxima de texto, medida en tokens, que un modelo puede considerar en una sola solicitud. Contiene las instrucciones del sistema, la conversación hasta el momento, cualquier documento que pegues y la respuesta que se está generando. Cuando el total supera el límite, algo debe ser descartado o resumido.