실제 제품에 쓸 AI 모델 고르는 법
리더보드가 아니라 «제약»에서 출발한다. 지연 예산, 요청당 비용 상한, 필요한 컨텍스트 길이, 도구 호출·구조화 출력이 필요한지, 그리고 데이터가 어디까지 갈 수 있는지를 적는다. 이 다섯이 대개 후보 대부분을 지운다. 남은 둘셋을 우리 트래픽에서 뽑은 실제 사례 50건으로 시험하고, 평균이 아니라 «사례별»로 비교한 뒤, 통과한 것 중 «가장 싼 것»을 고른다.
반복해서 나오는 AI 질문에 대한 쉬운 말 답변. 분야가 바뀌면 함께 갱신합니다.
리더보드가 아니라 «제약»에서 출발한다. 지연 예산, 요청당 비용 상한, 필요한 컨텍스트 길이, 도구 호출·구조화 출력이 필요한지, 그리고 데이터가 어디까지 갈 수 있는지를 적는다. 이 다섯이 대개 후보 대부분을 지운다. 남은 둘셋을 우리 트래픽에서 뽑은 실제 사례 50건으로 시험하고, 평균이 아니라 «사례별»로 비교한 뒤, 통과한 것 중 «가장 싼 것»을 고른다.
먼저 «무엇이 실패했는가»를 진단한다. 모델이 «모르는 것»이면 지식 결손이고 검색이 고친다. 알고는 있는데 «모양·어조·형식»이 틀린 것이면 동작 결손이고 프롬프트가 먼저, 파인튜닝이 나중이다. 둘을 다 하고도 «특수한 기술»에서 실패하면 그때 남는 선택지가 파인튜닝이다. 프롬프트가 가장 싸고 되돌리기 쉽고, 검색이 사실에 대한 기본값이며, 파인튜닝이 셋 중 가장 비싸고 가장 되돌리기 어렵다.
AI 가속기는 랙당 전력이 기존 서버보다 훨씬 크고, 그 전력을 계속 공급하고 식히고 지불해야 한다. 대형 모델 학습은 한 번의 스파이크지만 수백만 사용자에게 서비스하는 일은 영구적인 부하이며, 배포된 모델의 생애 에너지는 추론이 지배한다.
검색 증강 생성은 질문과 관련된 대목을 우리 문서에서 찾아 모델의 프롬프트에 넣고, 그것을 근거로 답하게 하는 방식이다. 모델의 가중치는 그대로다. 지식은 요청 시점에 «컨텍스트»로 도착한다.
AI 에이전트는 호출할 수 있는 도구와 추구할 목표를 받고, 단계마다 사람에게 묻지 않고 여러 걸음을 진행할 권한을 얻은 언어모델이다. 챗봇은 질문에 답하고 멈추지만, 에이전트는 목표가 달성됐다고 판단하거나 예산이 소진될 때까지 계속 행동한다.
오픈 웨이트는 학습된 모델 파일을 내려받아 직접 돌릴 수 있다는 뜻이며, 조건은 발행자가 고른 라이선스에 달렸다. 오픈소스는 사용·연구·수정·재배포의 자유를 보장하고 용도 제한을 두지 않는 더 엄격한 법적 기준이다. 널리 쓰이는 모델 상당수가 오픈 웨이트이지만 오픈소스는 아니다.
거의 모든 AI API 는 100만 토큰 단위로 과금하며 입력과 출력의 단가가 다르다. 출력이 보통 입력의 몇 배로 비싸다. 캐싱된 입력, 배치 처리, 더 작은 모델은 각각 청구서를 크게 줄인다. 그리고 대화 비용은 이력이 매 턴 다시 전송되기 때문에 길이에 따라 불어난다.
컨텍스트 윈도우는 모델이 한 번의 요청에서 고려할 수 있는 텍스트의 최대량이며 토큰 단위로 잰다. 시스템 지시, 지금까지의 대화, 붙여 넣은 문서, 그리고 생성 중인 답변이 모두 그 안에 들어간다. 합이 한도를 넘으면 무언가는 버리거나 요약해야 한다.