Skip to content
DigitalNeuron
도구·제품

AWS, 베드록에서 OpenAI 모델 비교하는 오픈소스 벤치마크 공개

AWS가 아마존 베드록에서 제공되는 OpenAI 모델을 OpenAI API 기준 모델과 비용, 에이전트 턴 수, 결과물 품질 측면에서 비교하는 오픈소스 벤치마킹 하네스와 블로그 게시물을 공개했다.

DigitalNeuron Desk2분 읽기

한 줄 답

AWS는 아마존 베드록에서의 OpenAI 모델 비교와 관련해 무엇을 발표했나?

AWS는 블로그 게시물을 통해 openai-on-aws/benchmarks-openai라는 오픈소스 벤치마킹 하네스를 공개했다. 이 도구는 단순히 토큰당 가격을 비교하는 대신, 아마존 베드록에서 제공되는 세 가지 OpenAI 모델을 두 가지 OpenAI API 기준 모델과 정답당 비용, 멀티턴 에이전트 비용, 루브릭 채점 방식의 전문 결과물 평가 항목에서 비교한다.

핵심 요약

  • AWS는 openai-on-aws/benchmarks-openai라는 오픈소스 벤치마킹 하네스를 공개했으며, 이는 동일한 OpenAI Responses API 코드 경로를 아마존 베드록과 OpenAI API 상의 모델 양쪽에 실행한다.
  • 이 하네스는 아마존 베드록의 세 가지 OpenAI 모델(gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol)을 두 가지 비용 효율적인 OpenAI API 모델(gpt-5.4-mini, gpt-5.4-nano)과 비교하는데, AWS는 후자를 동일 세대의 직접적인 대응 모델이 아니라 일반적으로 쓰이는 비용 최적화형 기준 모델이라고 설명한다.
  • AWS는 이 평가가 토큰당 가격 비교에만 의존하는 대신 정답당 비용, 멀티턴 에이전트 궤적의 비용, 루브릭 채점 방식의 전문 결과물 성능을 살펴본다고 밝혔다.
  • AWS에 따르면 아마존 베드록 모델은 추론 기능을 비활성화한 채 실행됐고 OpenAI API 모델은 기본 설정으로 실행됐으며, 그 결과는 모델의 본질적 성능을 통제된 방식으로 측정한 것이 아니라 실질적인 배포 구성을 반영한 것이라고 설명한다.
  • 이 하네스의 채점 방식은 결정론적 검증과 LLM 심사 모델인 gpt-5.5를 고정 프롬프트와 함께 결합하며, AWS는 벤치마크별 표본 크기가 48개에서 198개 항목에 이른다고 밝혔다.

AWS는 자사의 인공지능 블로그에 아마존 베드록에서 이용 가능한 OpenAI 모델을 OpenAI API를 통해 직접 접근하는 OpenAI 모델과 비교하는 오픈소스 벤치마킹 하네스를 소개하는 게시물을 게재했다. 이 게시물은 AWS 소속 저자인 닉 매카시, 샤라다 칸다수브라마니안, 수디시 사시다란, 사우라브 트리칸데가 작성했다.

AWS에 따르면 조직들은 통상 모델을 100만 토큰당 달러 비용, 즉 모든 가격표에 등장하는 그 숫자로 비교한다. 그러나 이 게시물은 이 수치가 실제 비용에 영향을 미치는 요소들을 놓친다고 지적한다. 모델이 정답을 내놓는 빈도, 정답에 도달하기까지 소비하는 토큰 수, 그리고 에이전트형 워크로드의 경우 대화가 길어질수록 매 턴마다 누적된 대화 기록을 다시 전송해야 하는 만큼 대화 턴수가 이에 해당한다.

하네스와 테스트 대상 모델

AWS는 openai-on-aws/benchmarks-openai라는 이름으로 공개된 이 하네스를 자체 개발해 오픈소스로 공개했다고 밝혔다. 이 하네스는 백엔드와 모델 ID만 전환하고 평가 로직은 그대로 유지한 채, 동일한 코드 경로인 OpenAI Responses API를 아마존 베드록과 OpenAI API 양쪽에 적용해 실행한다.

게시물에 따르면 이 하네스는 다음 다섯 개 모델을 평가한다.

  • 아마존 베드록의 OpenAI 모델 3종: gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol
  • OpenAI API 모델 2종: gpt-5.4-mini, gpt-5.4-nano

AWS는 이 두 OpenAI API 모델을 베드록 모델과 동일 세대의 직접적인 대응 모델이 아니라, 많은 팀이 이미 사용 중인 비용 최적화형 기준 모델로 설명한다. 이는 미니 또는 나노 모델을 사용하던 팀이 더 최신 베드록 모델로 옮겨갈 만한 가치가 있는지를 따져보는 질문을 중심으로 비교를 구성한 것이다.

평가 내용

AWS에 따르면 이 하네스는 세 가지 질문을 다룬다. 토큰 하나의 비용이 아니라 정답 하나의 비용은 얼마인가, 턴 수가 청구 비용을 좌우할 수 있는 상황에서 멀티턴 에이전트 궤적의 비용은 얼마인가, 그리고 퀴즈식 문제가 아니라 실제 직무 결과물을 기준으로 삼았을 때 모델이 전문가가 받아들일 만한 결과물을 내놓을 수 있는가 하는 것이다.

AWS는 이 평가가 AIME 수학 경시대회, 대학원 수준 과학 문제인 GPQA 다이아몬드, 그리고 MMLU-Pro에서의 단일 호출 정확도와 비용을 측정하며, 여기에 더해 실시간 웹 조사 과제에서의 멀티턴 에이전트 궤적과 루브릭 채점 방식의 전문 결과물 평가도 함께 진행한다고 설명한다. 채점은 결정론적 검증과 LLM 심사자인 gpt-5.5를 결합해 이뤄지는데, AWS는 이 심사 모델이 평가 대상 모델에는 포함되지 않는다고 밝혔으며, 각 결과 파일에 해시값이 기록된 고정 프롬프트를 사용한다.

AWS는 이 하네스를 실행할 때마다 타임스탬프가 찍힌 JSON 형식의 결과 파일이 생성되며, 게시물에 실린 모든 수치와 차트는 빌드 시점에 이 파일들로부터 생성됐다고 밝혔다. 제공된 원문 자료에는 하네스가 산출한 구체적인 정확도, 비용, 벤치마크 결과 수치는 포함되어 있지 않다.

출처: AWS 머신러닝 블로그, "Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload," 2026년 9월 11일 게재.

자주 묻는 질문

openai-on-aws/benchmarks-openai란 무엇인가?
AWS에 따르면 이는 아마존 베드록에 호스팅된 OpenAI 모델과 OpenAI API를 대상으로 동일한 OpenAI Responses API 코드 경로를 실행하는 오픈소스 벤치마킹 하네스로, 사용자가 자신의 워크로드에서 이 비교를 재현할 수 있게 해준다.
AWS 벤치마크는 어떤 모델들을 비교하는가?
AWS는 아마존 베드록의 세 가지 OpenAI 모델인 gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol을 두 가지 OpenAI API 모델인 gpt-5.4-mini, gpt-5.4-nano와 비교하며, 후자를 널리 사용되는 비용 효율적 기준 모델이라고 부른다.
AWS는 토큰당 가격 외에 무엇을 측정한다고 밝혔나?
AWS는 AIME, GPQA 다이아몬드, MMLU-Pro를 포함한 벤치마크에서 정답 하나의 비용, 실시간 웹 조사 과제에서의 멀티턴 에이전트 궤적 비용, 그리고 루브릭 채점 방식의 전문 결과물 성능을 측정한다고 밝혔다.
AWS는 비교 대상 모델들을 동일한 설정으로 실행했나?
아니다. AWS는 아마존 베드록 모델은 추론 기능을 비활성화한 채 실행했고 OpenAI API 기준 모델은 기본 설정으로 실행했다고 밝혔으며, 이 비교는 모델의 본질적 성능을 통제된 방식으로 시험한 것이 아니라 실질적인 배포 구성을 반영한 것이라고 설명한다.

출처

  1. Beyond the price per token: Choosing the right OpenAI model on Amazon Bedrock for your workload | Artificial IntelligenceAmazon Web Services (AWS)
태그awsamazon-bedrockopenaibenchmarkingopen-sourcemodel-evaluation

함께 읽기

AWS, 세이지메이커 서버리스 모델 커스터마이징으로 구축한 AI 상품 태깅 시스템 공개

AWS published a technical walkthrough describing how to build a product tagging system by customizing the Qwen3-8B open-weight model with SageMaker serverless model customization, using supervised fine-tuning and reinforcement learning with verifiable rewards, then deploying the result to SageMaker Asynchronous Inference for catalog enrichment.

3분 읽기

데이터브릭스, 카탈로그 간 거버넌스를 위한 아파치 아이스버그 신규 사양 두 건 공개

Databricks says the Apache Iceberg community has adopted two new specifications, read restrictions and catalog labels, to the Iceberg REST Catalog. Read restrictions let catalogs delegate policy enforcement to trusted engines, while catalog labels let catalogs exchange governance metadata, such as PII tags, across federated systems like Unity Catalog and Snowflake.

3분 읽기

아마존 퀵 데스크톱 앱, 정식 출시

AWS는 아마존 퀵 데스크톱 애플리케이션이 macOS와 Windows에서 정식 출시됐다고 발표했다. 또한 iOS와 Android용 모바일 앱에 이메일, 캘린더, CRM, 메시징을 하나의 우선순위 화면으로 통합하는 새로운 활동 피드를 추가한다고 밝혔다.

2분 읽기