먼저 어떻게 셌는지 밝히겠습니다. OpenRouter의 공개 목록을 그대로 받아 413종을 전부 대상으로 삼았습니다. 최신을 가리키는 별명(id가 ~로 시작하는 것)은 실제 모델과 겹쳐서 뺐습니다. 단가는 100만 토큰당 달러이고, 평균과 중간값은 무료 모델을 뺀 유료 387종만으로 냈습니다. 무료를 넣으면 평균이 무너져서 비교가 무의미해집니다.
값이 얼마나 벌어져 있나
가장 싼 유료 모델은 입력 100만 토큰에 $0.017, 가장 비싼 것은 $150.00입니다. 8,824배 차이입니다. 같은 문장을 넣어도 그렇습니다. 이 숫자를 처음 보면 대개 잘못 본 줄 압니다.
가장 두꺼운 구간은 $0.10 ~ $1입니다. 186종이 여기 몰려 있습니다. 실무에서 고르게 되는 자리도 대개 여기입니다. 그 위 $5 이상 구간에도 34종이 있는데, 이쪽은 정말 어려운 일에만 쓰는 자리입니다.
출력이 입력보다 비싸다
입력 단가 중간값이 $0.50인데 출력 단가 중간값은 $1.92입니다. 3.8배입니다. 실무에서 이게 뜻하는 바는 분명합니다. 긴 답을 받는 습관이 값에서 가장 크게 새는 지점입니다.
얼마나 긴 글을 넣을 수 있나
한 번에 넣을 수 있는 길이(컨텍스트)의 중간값은 26만 토큰, 가장 긴 것은 200만 토큰입니다. 한글 1,000자가 대략 1,500토큰이니, 중간값짜리 모델에도 A4 수십 장은 통째로 들어갑니다.
100만 이상 구간에 135종이 있습니다. 예전에는 긴 문서를 잘라 넣는 작업이 필수였는데 지금은 대부분 그냥 들어갑니다. 다만 넣을 수 있게 된 것과 넣는 게 나은 것은 다른 이야기입니다. 넣는 만큼 값이 나가고, 관계없는 내용이 섞이면 답도 흐려집니다.
점수가 매겨진 모델
413종 가운데 지능 점수가 있는 것은 163종, 코딩 점수가 있는 것은 180종입니다. 나머지는 점수가 없어서 고를 근거가 부족합니다. 지능 최고점은 63.1점, 중간값은 37.9점입니다. 코딩 최고점은 78점입니다.
| 지능 상위 | 점수 | 입력 단가 |
|---|---|---|
| Claude Opus 5 | 63.1 | $5.00 |
| Claude Opus 5 | 63.1 | $2.50 |
| Claude Fable 5 | 62.1 | $10.00 |
| Claude Fable 5 | 62.1 | $5.00 |
| Grok 4.6 | 60.9 | $2.00 |
그런데 이 목록을 그대로 고르시면 안 됩니다. 점수를 단가로 나눠보면 순서가 완전히 달라집니다. 같은 돈으로 얼마나 똑똑한 답을 받는지를 보는 숫자입니다.
| 값어치 상위 | 점수 | 입력 단가 | 1달러당 점수 |
|---|---|---|---|
| Ling-3.0-flash | 37.8 | $0.021 | 1800.0 |
| Solar Pro 4 | 41.6 | $0.030 | 1386.7 |
| DeepSeek V4 Flash 0731 | 51.8 | $0.065 | 796.9 |
| GLM 5.3 Flash | 57.5 | $0.075 | 766.7 |
| gpt-oss-120b | 24.1 | $0.037 | 651.4 |
가장 똑똑한 모델이 가장 좋은 선택인 경우는 드뭅니다. 점수가 몇 점 높은데 값이 열 배라면, 그 몇 점이 정말 필요한 일인지 따져봐야 합니다.
50점 이상 구간에 45종이 있습니다. 여기가 흔히 말하는 상위권입니다. 다만 이 구간 안에서도 단가는 제각각이라, 같은 점수대에서 더 싼 것을 고르는 여지가 늘 남아 있습니다.
코딩은 따로 봐야 합니다
지능 점수와 코딩 점수는 다릅니다. 코딩 점수가 매겨진 180종 가운데 최고점은 78점입니다. 코딩 상위와 지능 상위가 겹치기도 하고 안 겹치기도 합니다. 코드를 시키실 거라면 지능 순서 말고 이쪽을 보셔야 합니다.
| 코딩 상위 | 점수 | 입력 단가 |
|---|---|---|
| Claude Opus 5 | 78 | $5.00 |
| Claude Opus 5 | 78 | $2.50 |
| GPT-5.6 Sol | 77.4 | $2.00 |
| GPT-5.6 Sol | 77.4 | $1.00 |
| Grok 4.6 | 76.8 | $2.00 |
공짜로 어디까지 되나
입력과 출력이 모두 0인 모델이 26종 있습니다. 전체의 6%입니다. 다만 공짜라고 다 같은 공짜는 아닙니다. 대개 분당·하루 요청 수에 한도가 걸려 있고, 넣은 내용이 모델 개선에 쓰일 수 있다고 적혀 있는 경우가 많습니다.
| 공짜 모델 | 지능 | 컨텍스트 |
|---|---|---|
| GLM 5.2 | 52.6 | 26만 |
| MiniMax M3 | 45.4 | 105만 |
| Inkling | 42.3 | 105만 |
| Inkling Small | 41.2 | 105만 |
| MiniMax M2.7 | 38.9 | 20만 |
긴 글을 넣는 값은 얼마인가
컨텍스트가 100만 이상인 모델의 입력 단가 중간값은 $1.00입니다. 전체 중간값 $0.50과 견주면 더 비쌉니다. 길게 넣을 수 있다는 것과 넣는 값이 싸다는 것은 별개입니다. 넣는 만큼 그대로 곱해져 나갑니다.
누가 얼마나 올렸나
제공사는 51곳입니다. 상위 몇 곳이 목록의 상당 부분을 차지합니다.
한 제공사가 여러 종을 올리는 이유는 같은 모델의 크기별·용도별 변형이 각각 한 자리를 차지하기 때문입니다. 그래서 제공사 수보다 실제로 고를 수 있는 갈래는 더 적습니다.
| 제공사 | 유료 모델 | 입력 단가 중간값 |
|---|---|---|
| tencent | 7종 | $0.083 |
| nvidia | 5종 | $0.085 |
| meta-llama | 8종 | $0.14 |
| qwen | 53종 | $0.21 |
| bytedance-seed | 6종 | $0.25 |
| deepseek | 16종 | $0.27 |
| minimax | 9종 | $0.30 |
| mistralai | 25종 | $0.30 |
제공사에 따라 중간값이 몇 배씩 벌어집니다. 다만 이건 그 회사가 싸다는 뜻이 아니라, 어떤 급의 모델을 많이 올려뒀는지에 가깝습니다. 작은 모델을 여럿 올린 곳은 중간값이 낮게 잡힙니다.
최근에 들어온 것들
| 모델 | 등록일 | 입력 단가 |
|---|---|---|
| Granite 4.2 8B | 2026년 8월 31일 | $0.100 |
| Hy4 preview | 2026년 8월 28일 | $0.83 |
| Ling 3.0 Flash Fin | 2026년 8월 27일 | 무료 |
| Qwen3.8 Flash | 2026년 8월 26일 | $0.15 |
| GLM 5.3 Flash | 2026년 8월 26일 | $0.075 |
| GLM 5.3 Flash | 2026년 8월 26일 | $0.15 |
| Muse Spark 1.2 Contributor | 2026년 8월 21일 | $0.100 |
| DeepSeek V4 Flash Vision Exp | 2026년 8월 21일 | $0.22 |
목록이 이 속도로 바뀝니다. 그래서 특정 모델 이름을 코드 곳곳에 박아두지 마시라는 말을 계속 하게 됩니다. 한 군데서 갈아 끼울 수 있게 해두면, 값이 내릴 때마다 그 이득을 그대로 가져갈 수 있습니다.
글 말고 다른 것도 받는 모델
이미지나 소리처럼 글이 아닌 것도 받는 모델이 259종입니다. 전체의 63%입니다. 이제는 이쪽이 예외가 아니라 기본에 가깝습니다.
왜 이렇게까지 벌어져 있나
8,824배라는 숫자가 이상하게 보이는 게 정상입니다. 같은 일을 하는 물건의 값이 이만큼 벌어지는 시장은 드뭅니다. 이유는 셋쯤으로 정리됩니다.
- 1모델의 크기가 다릅니다. 작은 모델은 돌리는 데 드는 자원이 적어 그만큼 싸게 낼 수 있습니다. 그리고 작은 모델로도 되는 일이 생각보다 많습니다.
- 2같은 회사가 크기별로 여러 종을 함께 올립니다. 목록에서 이름이 비슷한 것들이 나란히 보이는 이유입니다. 가장 비싼 것만 이름을 아시고 그것만 쓰시면 손해입니다.
- 3새 모델이 나오면 이전 것의 값을 내립니다. 그래서 목록 아래쪽에는 한때 최상급이었다가 지금은 싸진 것들이 섞여 있습니다.
세 번째가 실무에서 가장 쓸모 있는 대목입니다. 지금 상위권과 몇 점 차이 안 나면서 값은 몇 분의 일인 모델이 목록 안에 늘 있습니다. 위의 값어치 표가 바로 그 자리를 찾아 놓은 것입니다.
점수를 어디까지 믿을까
여기 쓴 지능·코딩 점수는 시험 성적입니다. 시험을 잘 보는 것과 내 일을 잘하는 것은 다릅니다. 점수가 몇 점 높은 모델이 제 업무에서는 더 못하는 경우를 여러 번 봤습니다. 그래서 이 집계는 후보를 좁히는 데까지만 쓰시고, 마지막 결정은 직접 돌려보고 하시는 게 맞습니다.
413종 중 점수가 없는 250종은 이 표에 아예 안 나옵니다. 점수가 없다고 나쁜 모델은 아닙니다. 시험을 안 봤거나 새로 들어와서 아직 안 매겨진 것뿐입니다. 다만 고를 근거가 부족하니 후보에서 뒤로 미시는 게 안전합니다.
이 집계로 할 수 있는 일
- 1지금 쓰는 모델이 어느 구간인지 본다
$0.10 ~ $1 구간에 있으면 무난합니다. $5 이상 구간을 평소 일에 쓰고 계시면 거기가 첫 번째로 볼 자리입니다.
- 2값어치 표에서 대체할 것을 찾는다
점수가 비슷한데 단가만 낮은 것이 거의 항상 있습니다. 위의 값어치 상위 목록이 그 후보입니다.
- 3출력 길이를 조인다
출력이 입력의 3.8배입니다. 모델을 안 바꿔도 여기서 줄어듭니다.
- 4같은 질문 열 개로 견줘본다
값이 반이 됐는데 답이 못 쓰게 됐다면 아낀 게 아닙니다. 바꾸기 전후를 반드시 같은 질문으로 확인하세요.
한 가지 더. 이 집계에는 각 회사가 자기 사이트에서 직접 파는 값이 안 들어 있습니다. OpenRouter를 거치면 약간의 수수료가 붙는 대신 여러 회사를 한 곳에서 부를 수 있습니다. 규모가 커지면 직접 계약이 싸질 수 있으니, 값이 어느 정도 올라가면 그때 비교해보세요.
평균과 중간값이 이렇게 벌어지면
입력 단가 평균이 $2.07인데 중간값은 $0.50입니다. 평균이 중간값의 4.1배입니다. 이 정도로 벌어지면 평균은 대표값 노릇을 못 합니다. 아주 비싼 몇 개가 끌어올린 값이기 때문입니다. 어디선가 "AI 평균 단가"라는 숫자를 보시면 중간값도 같이 나와 있는지 확인해보세요.
제공사 수보다 갈래가 적은 이유
제공사 51곳에 모델 413종이면 한 곳이 평균 8.1종입니다. 그런데 실제로 고를 수 있는 갈래는 이보다 훨씬 적습니다. 같은 모델의 크기별 변형, 생각을 더 하는 모드, 묶어 보내는 모드가 각각 한 자리씩 차지하기 때문입니다.
목록을 훑다 보면 이름이 거의 같은 것들이 나란히 보이는 이유가 이것입니다. 뒤에 붙은 말이 크기이거나 모드입니다. 처음 고르실 때는 이 변형들을 하나로 묶어 보시면 후보가 확 줄어듭니다.
새 모델이 나왔을 때 볼 것
목록이 자주 바뀌니 새 이름이 뜰 때마다 흔들리기 쉽습니다. 그때 볼 것은 셋입니다. 점수가 지금 쓰는 것보다 높은가, 단가가 지금 쓰는 것보다 낮은가, 둘 다 아니면 무엇이 나아졌다는 것인가. 셋 다 아니면 바꿀 이유가 없습니다.
새로 나온 모델은 대개 며칠 동안 붐빕니다. 그래서 처음 재본 속도는 실제보다 느리게 나옵니다. 속도 때문에 판단하실 거라면 일주일쯤 뒤에 다시 재보세요. 값과 점수는 바로 봐도 되지만 속도는 그렇지 않습니다.