구글 딥마인드는 생성형 이미지 복원 및 퍼포먼스 캡처 모델을 활용해, 70년 넘게 결혼 생활을 이어온 버트와 에셀 샤츠 부부의 한 번도 사진이나 영상으로 남지 않았던 추억을 재현한 다큐멘터리 '러브, 렌더드(Love, Rendered)' 제작에 영화 제작진과 협력했다고 밝혔다. 구글은 또한 사용자들이 제미니 앱을 통해 가족사진을 복원하고 채색할 수 있다고 덧붙였다.
업스테이지가 카라쿠리(Karakuri Inc.)와 공동 개발한 일본어 대규모 언어모델 '신 프로(Syn Pro)'를 출시했다. 업스테이지에 따르면 이 모델은 320억 개 미만 매개변수를 가진 자체 학습 일본어 LLM 중 1위를 차지했으며, 네주미 리더보드(Nejumi Leaderboard) 글로벌 상위 20위 안에 들었다. 온프레미스, 프라이빗 클라우드, 고객 보유 GPU 환경 등 다양한 방식으로 배포할 수 있다.
딥시크가 5,520억 개의 파라미터를 갖춘 전문가 혼합(MoE) 모델 V4.1-Flash를 공개했다. 이 모델은 시각 정보를 기본적으로 이해할 수 있다. 회사 측에 따르면 비대칭 구조를 채택해 입력 처리에는 80억 개, 출력 처리에는 160억 개의 파라미터를 활성화한다. 해당 모델은 딥시크 API를 통해 이미 서비스되고 있으며, 새로운 피크·오프피크 요금 체계가 적용된다.
업스테이지는 32개 층의 Llama 2 아키텍처를 기반으로 하고 Mistral 7B 가중치로 초기화한 소형 대규모 언어 모델 Solar Mini를 공개했다. 회사 측은 자체 뎁스 업스케일링 기법이 깊이 방향 확장과 지속적 사전학습을 결합한다고 설명했다. Solar Mini는 Apache 2.0 라이선스로 공개돼 있다.
Upstage launched Solar Pro 4, an API-accessible model designed for multi-step agent work involving documents, tools and terminal tasks. The company says it supports a 512K-token context window, produces up to 128K output tokens, handles English, Korean and Japanese, and reports when supplied evidence cannot support an answer.
앤트로픽은 2026년 1월 15일 사례 연구를 발표해 스탠퍼드의 바이옴니 프로젝트, MIT의 치즈먼 연구실, 스탠퍼드의 룬드버그 연구실 등 세 연구실이 유전자 군집 해석, 생의학 데이터 분석, 실험적으로 연구할 유전자 선정 등의 작업을 수행하는 클로드 기반 시스템을 구축한 과정을 소개했다.
먼저 «무엇이 실패했는가»를 진단한다. 모델이 «모르는 것»이면 지식 결손이고 검색이 고친다. 알고는 있는데 «모양·어조·형식»이 틀린 것이면 동작 결손이고 프롬프트가 먼저, 파인튜닝이 나중이다. 둘을 다 하고도 «특수한 기술»에서 실패하면 그때 남는 선택지가 파인튜닝이다. 프롬프트가 가장 싸고 되돌리기 쉽고, 검색이 사실에 대한 기본값이며, 파인튜닝이 셋 중 가장 비싸고 가장 되돌리기 어렵다.
아니다. 다만 역할이 바뀐다. 아주 큰 창을 채우면 «가운데 묻힌 정보»에서 정확도가 떨어지고, 매 요청마다 지연과 비용이 배로 늘며, 답이 어느 출처에서 나왔는지 말하기 어려워진다. 크거나 자주 바뀌는 말뭉치, 인용이나 접근 권한이 필요한 일, 비용에 민감한 대량 경로에서는 검색이 여전히 기본값이다. 긴 컨텍스트는 이제 «문서 전체를 놓고 하는 추론», «한 작업 안에서의 에이전트 작업기억», 그리고 «검색이 후보를 좁힌 뒤의 2단계»에 가장 잘 쓰인다.
공개 벤치마크는 좁고 고정돼 있으며 널리 공개된 과제를 잰다. 게다가 학습 데이터 오염이 심해지고 있고, 그 숫자 자체가 최적화 대상이 됐다. 프로덕션 품질은 우리 프롬프트·우리 문서·우리 도구 스키마·우리가 견딜 수 있는 실패에 달려 있는데, 어느 리더보드도 그것을 재지 않는다. 실무의 답은 «실제 사례 50~300건 + 기대 동작 기록»으로 된 비공개 평가셋을 만들어 모델·프롬프트가 바뀔 때마다 돌리고, 가능한 것은 코드로 정확히 검사하고 나머지만 채점 기준을 준 모델 심판에게 맡기는 것이다.
앤스로픽의 두 번째 경제지수 보고서에 따르면 클로드 3.7 소네트 출시 이후 코딩, 교육, 과학, 의료 분야에서 클로드닷에이아이(Claude.ai) 사용이 늘어난 것으로 나타났다. 확장 사고 모드는 기술 직종에서 가장 많이 사용됐다. 보조적 활용 비중은 전체 사용량의 57%로 안정적으로 유지됐으며, 앤스로픽은 630개 범주로 구성된 새로운 사용 분류 체계와 작업 단위 자동화 데이터도 함께 공개했다.
MiniMax가 호흡과 망설임을 위한 네이티브 사운드 태그, 10초 샘플을 이용한 음성 클로닝, 노이즈와 왜곡을 줄이도록 설계된 처리 기능을 갖춘 합성 음성 모델인 Speech 2.8을 공개했다. 이 회사는 또한 중국어(만다린)와 일본어에 대한 교차 언어 음성을 개선했으며, 이 모델을 자사 플랫폼과 Audio 제품을 통해 이용할 수 있도록 했다고 밝혔다.
딥시크(DeepSeek)가 자사 API 플랫폼에서 실험적 멀티모달 모델인 DeepSeek-V4-Flash-Vision-Exp를 공개했다. 회사 측은 텍스트 작업에서 DeepSeek-V4-Flash와 동등한 성능을 보이면서 비전 기능을 추가했으며, V4-Flash 대비 멀티모달 에이전트 벤치마크 성능이 크게 향상되어 Opus-4.8에 근접했다고 밝혔다. 딥시크는 또한 무료 Files API와 DeepSeek Harness 0.1.1도 함께 출시했다.