Qwen3.5 9B H100-SXM-80GB (Lambda 1x) ×1 · bf16 ◇ 처리량: 근거 없는 추정GPU H100-SXM-80GB (Lambda 1x) × 1 인스턴스, 시간당 $4.29(GPU 1장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다.처리량 가정 근거: 9B bf16은 약 18GB로 H100 80GB에 여유롭게 적재되어 KV 캐시에 60GB 이상을 쓸 수 있고 배치가 크게 잡힌다. | $4.29 GPU 1장 포함 · 오버헤드 ×1.2 | $0.5107 ~ $6.81 낙관 ~ 보수 · 기준값 $1.59 | $21 ~ $276 낙관 ~ 보수 · 기준값 $64 | 입력 $0.1000 출력 $0.1500 | 2026-08-31 |
gpt-oss-20b A100-SXM-40GB (Lambda 1x) ×1 · mxfp4 (네이티브) ◇ 처리량: 근거 없는 추정GPU A100-SXM-40GB (Lambda 1x) × 1 인스턴스, 시간당 $1.99(GPU 1장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다.처리량 가정 근거: 20B 모델의 mxfp4 적재는 40GB로 충분하나 긴 컨텍스트 KV 캐시를 쓰면 배치 크기가 급격히 줄어 처리량이 conservative 아래로 내려갈 수 있다. | $1.99 GPU 1장 포함 · 오버헤드 ×1.2 | $0.6317 ~ $8.84 낙관 ~ 보수 · 기준값 $1.90 | $26 ~ $358 낙관 ~ 보수 · 기준값 $77 | 입력 $0.0500 출력 $0.2000 | 2026-08-31 |
Mistral Small 3.2 24B Instruct H100-SXM-80GB (Lambda 1x) ×1 · fp8 ◇ 처리량: 근거 없는 추정GPU H100-SXM-80GB (Lambda 1x) × 1 인스턴스, 시간당 $4.29(GPU 1장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다. | $4.29 GPU 1장 포함 · 오버헤드 ×1.2 | $0.9286 ~ $11.92 낙관 ~ 보수 · 기준값 $2.86 | $38 ~ $483 낙관 ~ 보수 · 기준값 $116 | 입력 $0.0750 출력 $0.2000 | 2026-08-31 |
gpt-oss-120b H100-80GB (DeepInfra 전용 인스턴스 1x) ×1 · mxfp4 (네이티브) ◇ 처리량: 근거 없는 추정GPU H100-80GB (DeepInfra 전용 인스턴스 1x) × 1 인스턴스, 시간당 $2.2(GPU 1장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다. | $2.20 GPU 1장 포함 · 오버헤드 ×1.2 | $1.05 ~ $12.22 낙관 ~ 보수 · 기준값 $2.93 | $42 ~ $495 낙관 ~ 보수 · 기준값 $119 | 입력 $0.1500 출력 $0.6000 | 2026-08-31 |
Qwen3.6 27B H100-SXM-80GB (Lambda 1x) ×1 · fp8 ◇ 처리량: 근거 없는 추정GPU H100-SXM-80GB (Lambda 1x) × 1 인스턴스, 시간당 $4.29(GPU 1장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다. | $4.29 GPU 1장 포함 · 오버헤드 ×1.2 | $1.02 ~ $13.62 낙관 ~ 보수 · 기준값 $3.18 | $41 ~ $552 낙관 ~ 보수 · 기준값 $129 | 입력 $0.3200 출력 $3.20 | 2026-08-31 |
Gemma 4 31B IT H100-SXM-80GB (Lambda 1x) ×1 · fp8 ◇ 처리량: 근거 없는 추정GPU H100-SXM-80GB (Lambda 1x) × 1 인스턴스, 시간당 $4.29(GPU 1장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다.처리량 가정 근거: 256K 컨텍스트를 실제로 쓰면 KV 캐시가 커져 배치가 줄고 처리량이 conservative 근처로 내려간다. | $4.29 GPU 1장 포함 · 오버헤드 ×1.2 | $1.13 ~ $15.89 낙관 ~ 보수 · 기준값 $3.57 | $46 ~ $644 낙관 ~ 보수 · 기준값 $145 | 입력 $0.3900 출력 $0.9700 | 2026-08-31 |
Solar Open 100B A100-80GB (DeepInfra 전용 인스턴스 4x, 최소 구성) ×4 · bf16 ◇ 처리량: 근거 없는 추정GPU A100-80GB (DeepInfra 전용 인스턴스 4x, 최소 구성) × 4 인스턴스, 시간당 $3.56(GPU 4장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다.처리량 가정 근거: throughput_tps는 근거 없는 추정치이며, A100은 H100 대비 메모리 대역폭이 낮아 같은 활성 파라미터라도 디코드가 느리다는 점을 반영해 보수적으로 잡았다. | $3.56 GPU 4장 포함 · 오버헤드 ×1.2 | $1.13 ~ $15.82 낙관 ~ 보수 · 기준값 $3.65 | $46 ~ $641 낙관 ~ 보수 · 기준값 $148 | 입력 미공개 출력 미공개 | 2026-08-31 |
gpt-oss-120b H100-SXM-80GB (Lambda 4x, TP=4) ×4 · mxfp4 (네이티브) ◆ 처리량: 3자 벤치마크 ◇ 구성 간 원가 역전 — 가정의 결과GPU H100-SXM-80GB (Lambda 4x, TP=4) × 4 인스턴스, 시간당 $16.36(GPU 4장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다.처리량 가정 근거: 1장 구성 대비 GPU가 4배인데 처리량은 4.4배로 잡아 약한 초선형을 반영했다(배치 크기 확대 효과). | $16.36 GPU 4장 포함 · 오버헤드 ×1.2 | $1.73 ~ $20.20 낙관 ~ 보수 · 기준값 $4.96 | $70 ~ $818 낙관 ~ 보수 · 기준값 $201 | 입력 $0.1500 출력 $0.6000 | 2026-08-31 |
NVIDIA Nemotron 3 Super 120B A12B H100-SXM-80GB (Lambda 2x, TP=2) ×2 · fp8 ◇ 처리량: 근거 없는 추정GPU H100-SXM-80GB (Lambda 2x, TP=2) × 2 인스턴스, 시간당 $8.38(GPU 2장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다. | $8.38 GPU 2장 포함 · 오버헤드 ×1.2 | $1.60 ~ $23.28 낙관 ~ 보수 · 기준값 $5.08 | $65 ~ $943 낙관 ~ 보수 · 기준값 $206 | 입력 $0.0850 출력 $0.4000 | 2026-08-31 |
Llama 4 Scout 17B 16E H100-SXM-80GB (Lambda 2x, TP=2) ×2 · fp8 ◇ 처리량: 근거 없는 추정GPU H100-SXM-80GB (Lambda 2x, TP=2) × 2 인스턴스, 시간당 $8.38(GPU 2장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다.처리량 가정 근거: 모델 카드상 10M 컨텍스트지만 그 길이를 실제로 쓰면 KV 캐시가 GPU 메모리를 압도해 이 프로파일은 성립하지 않는다 — 일반 업무용 8K~32K 컨텍스트 전제. | $8.38 GPU 2장 포함 · 오버헤드 ×1.2 | $1.60 ~ $23.28 낙관 ~ 보수 · 기준값 $5.08 | $65 ~ $943 낙관 ~ 보수 · 기준값 $206 | 입력 $0.1000 출력 $0.3000 | 2026-08-31 |
gpt-oss-120b H100-SXM-80GB (Lambda 1x) ×1 · mxfp4 (네이티브) ◆ 처리량: 3자 벤치마크 ◇ 구성 간 원가 역전 — 가정의 결과GPU H100-SXM-80GB (Lambda 1x) × 1 인스턴스, 시간당 $4.29(GPU 1장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다.처리량 가정 근거: vLLM 문서 자체는 '처리량은 TP·max-num-seqs·메모리 설정에 크게 좌우되며 고정 벤치마크를 제공하지 않는다'고 명시하고 있어 A/B등급 처리량 근거는 존재하지 않는다. | $4.29 GPU 1장 포함 · 오버헤드 ×1.2 | $2.04 ~ $23.83 낙관 ~ 보수 · 기준값 $5.72 | $83 ~ $965 낙관 ~ 보수 · 기준값 $232 | 입력 $0.1500 출력 $0.6000 | 2026-08-31 |
Solar Open 2 250B H200-141GB (DeepInfra 전용 인스턴스 8x, TP=8) ×8 · bf16 (모델 카드 권장 구성 기준, 양자화 언급 없음) ◇ 처리량: 근거 없는 추정 ◇ 구성 간 원가 역전 — 가정의 결과GPU H200-141GB (DeepInfra 전용 인스턴스 8x, TP=8) × 8 인스턴스, 시간당 $21.52(GPU 8장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다.처리량 가정 근거: 반면 throughput_tps는 **근거 없는 추정치**다 — 활성 15B가 Qwen3.5-397B-A17B(17B 활성)와 비슷하다는 전제로 잡았고 conservative를 optimistic의 1/6로 넓게 두었다. | $21.52 GPU 8장 포함 · 오버헤드 ×1.2 | $2.28 ~ $34.16 낙관 ~ 보수 · 기준값 $7.17 | $92 ~ $1,383 낙관 ~ 보수 · 기준값 $291 | 입력 미공개 출력 미공개 | 2026-08-31 |
gpt-oss-120b H100-80GB (Baseten 전용 배포 1x) ×1 · mxfp4 (네이티브) ◇ 처리량: 근거 없는 추정GPU H100-80GB (Baseten 전용 배포 1x) × 1 인스턴스, 시간당 $6.5(GPU 1장을 포함한 인스턴스 총액), 오버헤드 배수 1.1배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다. | $6.50 GPU 1장 포함 · 오버헤드 ×1.1 | $2.84 ~ $33.10 낙관 ~ 보수 · 기준값 $7.94 | $115 ~ $1,341 낙관 ~ 보수 · 기준값 $322 | 입력 $0.1500 출력 $0.6000 | 2026-08-31 |
Solar Open 2 250B H200-141GB (DeepInfra 전용 인스턴스 4x, 최소 구성) ×4 · bf16 ◇ 처리량: 근거 없는 추정 ◇ 구성 간 원가 역전 — 가정의 결과GPU H200-141GB (DeepInfra 전용 인스턴스 4x, 최소 구성) × 4 인스턴스, 시간당 $10.76(GPU 4장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다.처리량 가정 근거: 8장 권장 구성 대비 절반 비용이지만 KV 캐시 여유가 줄어 배치 크기가 작아지므로 처리량을 8장의 절반보다 낮게 잡았다. | $10.76 GPU 4장 포함 · 오버헤드 ×1.2 | $2.33 ~ $39.85 낙관 ~ 보수 · 기준값 $7.97 | $94 ~ $1,614 낙관 ~ 보수 · 기준값 $323 | 입력 미공개 출력 미공개 | 2026-08-31 |
Llama 3.3 70B Instruct Turbo H100-SXM-80GB (Lambda 2x, TP=2) ×2 · fp8 ◆ 처리량: 3자 벤치마크GPU H100-SXM-80GB (Lambda 2x, TP=2) × 2 인스턴스, 시간당 $8.38(GPU 2장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다.처리량 가정 근거: 70B 덴스 모델은 fp8이면 약 70GB로 1장에 겨우 들어가지만 KV 캐시 여유가 없어 실무에서는 2장 구성이 표준. | $8.38 GPU 2장 포함 · 오버헤드 ×1.2 | $2.85 ~ $37.24 낙관 ~ 보수 · 기준값 $8.59 | $115 ~ $1,508 낙관 ~ 보수 · 기준값 $348 | 입력 $0.1000 출력 $0.3200 | 2026-08-31 |
Qwen3.5 397B A17B H100-SXM-80GB (Lambda 8x, TP=8) ×8 · fp8 ◇ 처리량: 근거 없는 추정GPU H100-SXM-80GB (Lambda 8x, TP=8) × 8 인스턴스, 시간당 $31.92(GPU 8장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다.처리량 가정 근거: 397B fp8 약 400GB → 8x80GB=640GB에 적재 후 KV 캐시 여유 확보. | $31.92 GPU 8장 포함 · 오버헤드 ×1.2 | $3.04 ~ $44.33 낙관 ~ 보수 · 기준값 $9.67 | $123 ~ $1,796 낙관 ~ 보수 · 기준값 $392 | 입력 $0.4500 출력 $3.00 | 2026-08-31 |
DeepSeek V4 Flash (0731) H100-SXM-80GB (Lambda 8x, TP=8) ×8 · fp8 ◇ 처리량: 근거 없는 추정GPU H100-SXM-80GB (Lambda 8x, TP=8) × 8 인스턴스, 시간당 $31.92(GPU 8장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다. | $31.92 GPU 8장 포함 · 오버헤드 ×1.2 | $3.38 ~ $47.29 낙관 ~ 보수 · 기준값 $10.64 | $137 ~ $1,915 낙관 ~ 보수 · 기준값 $431 | 입력 $0.0800 출력 $0.1800 | 2026-08-31 |
DeepSeek V4 Pro (0813) B200-SXM6-180GB (Lambda 8x, TP=8) ×8 · nvfp4 (fp8로는 단일 노드에 들어가지 않음) ◇ 처리량: 근거 없는 추정GPU B200-SXM6-180GB (Lambda 8x, TP=8) × 8 인스턴스, 시간당 $53.52(GPU 8장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다. | $53.52 GPU 8장 포함 · 오버헤드 ×1.2 | $8.50 ~ $132.15 낙관 ~ 보수 · 기준값 $27.45 | $344 ~ $5,352 낙관 ~ 보수 · 기준값 $1,112 | 입력 $1.32 출력 $3.96 | 2026-08-31 |
GLM-5.3 B200-SXM6-180GB (Lambda 8x, TP=8) ×8 · fp8 ◇ 처리량: 근거 없는 추정GPU B200-SXM6-180GB (Lambda 8x, TP=8) × 8 인스턴스, 시간당 $53.52(GPU 8장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다.처리량 가정 근거: 753B fp8 약 753GB → 1.44TB에 적재 가능하고 KV 캐시 여유도 남는다. | $53.52 GPU 8장 포함 · 오버헤드 ×1.2 | $8.50 ~ $132.15 낙관 ~ 보수 · 기준값 $27.45 | $344 ~ $5,352 낙관 ~ 보수 · 기준값 $1,112 | 입력 $1.40 출력 $4.40 | 2026-08-31 |
Llama 3.3 70B Instruct Turbo H100-80GB (Azure Standard_ND96isr_H100_v5, 8x) ×8 · fp8 ◇ 처리량: 근거 없는 추정GPU H100-80GB (Azure Standard_ND96isr_H100_v5, 8x) × 8 인스턴스, 시간당 $98.32(GPU 8장을 포함한 인스턴스 총액), 오버헤드 배수 1.2배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다. | $98.32 GPU 8장 포함 · 오버헤드 ×1.2 | $11.70 ~ $156.06 낙관 ~ 보수 · 기준값 $36.41 | $474 ~ $6,321 낙관 ~ 보수 · 기준값 $1,475 | 입력 $0.1000 출력 $0.3200 | 2026-08-31 |
Kimi K3 B200-SXM6-180GB (Lambda 16x, 2노드) ×16 · fp8 ◇ 처리량: 근거 없는 추정GPU B200-SXM6-180GB (Lambda 16x, 2노드) × 16 인스턴스, 시간당 $107.04(GPU 16장을 포함한 인스턴스 총액), 오버헤드 배수 1.3배(운영·인건비·네트워크 흡수), 가동률 0.3~0.7 가정. 모델 가중치 다운로드·스토리지·유휴 시간 비용은 오버헤드 배수에 포함된 것으로 본다.처리량 가정 근거: 2.8T 파라미터 fp8 약 2.8TB → 16x180GB=2.88TB로 겨우 들어가며 KV 캐시 여유가 거의 없다. | $107.04 GPU 16장 포함 · 오버헤드 ×1.3 | $22.09 ~ $368.13 낙관 ~ 보수 · 기준값 $77.31 | $895 ~ $14,909 낙관 ~ 보수 · 기준값 $3,131 | 입력 $3.00 출력 $15.00 | 2026-08-31 |