Skip to content
DigitalNeuron
모델·연구

업스테이지, 다단계 에이전트 작업용 ‘솔라 프로 4’ 출시

Solar Pro 4 supports tool use, terminal tasks and long-document reasoning, with a 512K-token context window and multilingual input and output.

DigitalNeuron Desk2분 읽기

한 줄 답

업스테이지는 Solar Pro 4와 함께 무엇을 발표했나요?

Upstage launched Solar Pro 4, an API-accessible model designed for multi-step agent work involving documents, tools and terminal tasks. The company says it supports a 512K-token context window, produces up to 128K output tokens, handles English, Korean and Japanese, and reports when supplied evidence cannot support an answer.

핵심 요약

  • Upstage says Solar Pro 4 is designed to complete multi-step work across documents, tools and terminal environments.
  • 이 모델은 51만 2천 토큰의 컨텍스트 창과 최대 12만 8천 개의 출력 토큰을 지원하며, 영어·한국어·일본어로 입력하고 출력할 수 있다.
  • Upstage lists standard API pricing of $0.30 per million input tokens, $0.06 per million cached input tokens and $1.20 per million output tokens.
  • Solar Pro 4는 Upstage Console, SolarChat, OpenRouter, Hermes Agent, Upstage Studio를 통해 이용할 수 있으며, 전용 및 온프레미스 배포도 지원됩니다.
  • The company says the model identifies unsupported claims and discrepancies rather than supplying unverified answers.

Upstage가 여러 문서와 도구 호출, 터미널 작업을 아우르는 업무용 에이전트형 언어 모델 Solar Pro 4를 출시했다. 회사 측은 이 모델이 주어진 업무를 완성된 결과물까지 이어서 수행하는 동시에, 확보된 근거만으로는 답변할 수 없는 경우를 식별하도록 설계됐다고 밝혔다.

Solar Pro 4는 51만2천 토큰의 컨텍스트 창과 최대 12만8천 개의 출력 토큰을 지원한다. 입력과 출력 모두 영어, 한국어, 일본어를 처리한다. 사용자는 추론 강도도 조절할 수 있어, 심층 분석에는 높게, 빠른 상호작용에는 낮게 설정할 수 있다.

에이전트 및 문서 업무

Upstage는 Terminal-Bench v2.1에서 57.0점, τ³-Banking에서 23.0점, AA-LCR에서 71.0점을 기록했다고 발표했다. 회사는 이 평가들이 각각 터미널 실행, 여러 차례에 걸친 도구 사용, 장문 문서 전반에 대한 추론 능력을 측정한다고 설명했다. 세 점수는 2026년 8월 기준 Artificial Analysis에서 나온 결과이며, 공개 등재도 예정돼 있다고 밝혔다.

회사 측은 Solar Pro 4가 11개 산업 분야와 12개 업무 유형에 걸쳐 공개 데이터로 사무 업무를 합성하는 자사 파이프라인 OfficeVerse를 활용해 학습됐다고 밝혔다. 업무는 최종 결과물을 기준으로 통과 또는 실패 판정을 받는다. Upstage는 한국어 사무 업무 벤치마크인 Ko-GDPval도 같은 작업을 통해 개발됐다고 설명했다.

모델 시연을 위해 Upstage는 정책 문서 1개와 시장 데이터 파일 6개로 구성된 가상의 매장 입지 선정 업무를 부여했다. 회사 측에 따르면 Solar Pro 4는 세 개의 프롬프트에 따라 후보지 10곳을 검토한 뒤 엑셀 통합 문서, 검토 보고서, 슬라이드 자료를 차례로 작성했다. Upstage는 통합 문서에서 계산된 값이 변경 없이 보고서에 반영됐다고 밝혔다.

Upstage는 Solar Pro 4 Agent Cookbook을 통해 업무 에이전트 7종도 공개한다. 예제에는 엑셀 통합 문서 생성, 근거 기반 워드 보고서 작성, 차트와 발표자 노트가 포함된 파워포인트 프레젠테이션 제작 등이 담겼다. 각 예제에는 시스템 프롬프트와 출력 결과, 통과 기준이 포함된다.

근거 처리

Upstage는 Solar Pro 4가 근거가 뒷받침되는 답변과 정보가 없거나 상충하는 경우를 구분할 수 있다고 설명했다. 회사는 가상의 서비스 계약서와 견적서를 활용한 시험에서 질문 10개를 제시했으며, 이 가운데 절반만 제공된 문서에서 답을 찾을 수 있도록 구성했다. 회사 측에 따르면 모델은 문서에 있는 조항을 인용하고, 없는 내용은 문서에 없다고 표시했으며, 서로 다른 수치는 불일치로 보고했다.

Cookbook에는 Upstage의 설명에 따르면 모든 문장을 출처와 연결하고 근거를 확인할 수 없는 내용에는 ‘검증되지 않음’이라는 표시를 붙이는 리서치 에이전트도 포함된다.

이용 방법 및 가격

Solar Pro 4는 Upstage Console API에서 모델명 solar-pro4로 이용할 수 있다. Upstage는 이 API가 OpenAI와 호환된다고 밝혔다. SolarChat, OpenRouter, Hermes Agent, Upstage Studio에서도 제공된다. 전용 및 온프레미스 배포는 회사에 문의하면 된다.

Upstage가 제시한 100만 토큰당 가격은 입력 0.30달러, 캐시된 입력 0.06달러, 출력 1.20달러다. 회사는 Upstage Console에서 9월 10일 23시 59분(UTC)까지 90% 할인한다고 발표했으며, OpenRouter에서도 9월 10일까지 90% 할인 프로모션을 진행한다고 밝혔다. Hermes Agent에서는 별도의 혜택이 9월 15일까지 제공된다.

출처: 2026년 8월 11일 발표된 Upstage의 “Solar Pro 4: 업무를 끝까지 완수하는 에이전트형 모델” 발표문.

자주 묻는 질문

Solar Pro 4는 어떤 용도로 설계되었나요?
Upstage describes Solar Pro 4 as an agentic model for multi-step work involving tool calls, terminal tasks and reasoning across long documents.
Solar Pro 4는 어떤 컨텍스트 및 출력 한도를 지원하나요?
The company says the model supports a 512K-token context window and up to 128K output tokens.
Solar Pro 4는 어떤 언어를 지원하나요?
Upstage says Solar Pro 4 accepts and generates English, Korean and Japanese.
고객은 Solar Pro 4를 어떻게 이용할 수 있나요?
Upstage lists access through its Console API, SolarChat, OpenRouter, Hermes Agent and Upstage Studio. It also offers dedicated and on-premises deployment.

출처

  1. Solar Pro 4: The Agentic Model That Finishes the JobUpstage
태그upstagesolar-pro-4agentic-ailanguage-modelstool-usemultilingual-ai

함께 읽기

앤트로픽, 연구실들이 클로드 기반 과학 에이전트를 구축하는 방식 공개

앤트로픽은 2026년 1월 15일 사례 연구를 발표해 스탠퍼드의 바이옴니 프로젝트, MIT의 치즈먼 연구실, 스탠퍼드의 룬드버그 연구실 등 세 연구실이 유전자 군집 해석, 생의학 데이터 분석, 실험적으로 연구할 유전자 선정 등의 작업을 수행하는 클로드 기반 시스템을 구축한 과정을 소개했다.

3분 읽기

앤스로픽, 클로드 3.7 소네트 사용 실태 다룬 두 번째 경제지수 보고서 발표

앤스로픽의 두 번째 경제지수 보고서에 따르면 클로드 3.7 소네트 출시 이후 코딩, 교육, 과학, 의료 분야에서 클로드닷에이아이(Claude.ai) 사용이 늘어난 것으로 나타났다. 확장 사고 모드는 기술 직종에서 가장 많이 사용됐다. 보조적 활용 비중은 전체 사용량의 57%로 안정적으로 유지됐으며, 앤스로픽은 630개 범주로 구성된 새로운 사용 분류 체계와 작업 단위 자동화 데이터도 함께 공개했다.

3분 읽기

분석: 공개 벤치마크는 더 이상 «프로덕션 품질»을 예측하지 않는다 — 예측하는 평가셋 만드는 법

공개 벤치마크는 좁고 고정돼 있으며 널리 공개된 과제를 잰다. 게다가 학습 데이터 오염이 심해지고 있고, 그 숫자 자체가 최적화 대상이 됐다. 프로덕션 품질은 우리 프롬프트·우리 문서·우리 도구 스키마·우리가 견딜 수 있는 실패에 달려 있는데, 어느 리더보드도 그것을 재지 않는다. 실무의 답은 «실제 사례 50~300건 + 기대 동작 기록»으로 된 비공개 평가셋을 만들어 모델·프롬프트가 바뀔 때마다 돌리고, 가능한 것은 코드로 정확히 검사하고 나머지만 채점 기준을 준 모델 심판에게 맡기는 것이다.

6분 읽기