무료로 쓸 수 있는 LLM API와 키 후보
2026년 6월 26일 기준으로 무료 API key, 무료 모드, trial credit이 명시된 LLM API 후보를 구분해 정리한 노트.
무료로 쓸 수 있는 LLM API와 키 후보
한 줄 요약
무료 API key로 실제 개발과 프로토타이핑을 시작하려면 Gemini API, GroqCloud, Cerebras Cloud, NVIDIA NIM, OpenRouter를 먼저 보고, Mistral, Cloudflare Workers AI, GitHub Models를 보조 후보로 두는 편이 현실적이다.
먼저 읽을 결론
2026년 6월 26일 기준으로 "무료 LLM API"는 세 부류로 나눠야 한다.
| 분류 | 의미 | 대표 후보 |
|---|---|---|
| 무료 티어 / 무료 모드 | 계정과 API key를 만들면 제한된 쿼터 안에서 계속 테스트 가능 | Gemini API, GroqCloud, Cerebras Cloud, Mistral, Cloudflare Workers AI, GitHub Models |
| 개발자 프로그램 / 평가용 무료 접근 | 프로토타이핑, 연구, 개발, 테스트 목적에는 무료이나 production 사용은 별도 조건 | NVIDIA NIM |
| trial credit | 가입 시 소액 크레딧을 주지만, 다 쓰면 결제나 billing 설정이 필요 | Hugging Face, SambaNova, AI21, Fireworks, Cohere, Replicate |
바로 붙여볼 1차 shortlist는 다음이다.
| 우선순위 | 서비스 | 무료 정책 요약 | 추천 용도 | 주의점 |
|---|---|---|---|---|
| 1 | Google Gemini API / AI Studio | Free tier에서 제한된 모델 접근, 무료 input/output token, AI Studio 접근 제공 | 범용 챗봇, 요약, 멀티모달, 긴 컨텍스트 실험 | Free tier 입력은 제품 개선에 사용될 수 있고, rate limit과 모델명이 자주 바뀔 수 있음 |
| 2 | GroqCloud | Free Plan Limits 공개. 예: llama-3.1-8b-instant 30 RPM / 14.4K RPD / 6K TPM / 500K TPD | 빠른 응답 UX, 데모, 오픈모델 에이전트 | 모델별 제한이 다르고 무료 쿼터가 작을 수 있음 |
| 3 | Cerebras Cloud | Free tier에서 Cerebras powered model 접근 가능 | 초고속 추론, coding/reasoning 모델 실험 | Developer tier는 $10부터이며 free tier보다 10배 높은 rate limit 제공 |
| 4 | NVIDIA NIM / build.nvidia.com | Developer Program 회원은 프로토타이핑용 NIM API endpoint 무료 접근 | 모델 카탈로그 탐색, NIM PoC, self-host 검토 | production은 NVIDIA AI Enterprise license 필요 |
| 5 | OpenRouter free models | :free 모델은 20 RPM, 구매 크레딧이 $10 미만이면 50 requests/day, $10 이상이면 1000 requests/day | 여러 무료 모델 비교, fallback 테스트 | free 라우팅과 모델 가용성이 변동적 |
개인 프로젝트나 MVP라면 Gemini API + GroqCloud + OpenRouter 조합이 가장 실용적이다. Gemini는 범용 메인 모델, Groq는 빠른 오픈모델 응답, OpenRouter는 여러 무료 모델 비교와 fallback 테스트에 적합하다.
속도와 추론 latency를 보고 싶다면 GroqCloud + Cerebras Cloud + NVIDIA NIM을 같이 테스트하는 편이 좋다. Cloudflare Workers로 배포할 계획이면 Workers AI를 별도 후보로 두고, GitHub 중심 개발 workflow라면 GitHub Models도 확인할 만하다.
다만 이 노트의 결론은 "무료로 제품을 안정 운영할 수 있다"가 아니다. 무료 API key는 대부분 개발, 평가, 프로토타이핑에 맞춰져 있다. 사용자 트래픽이 생기는 서비스라면 처음부터 rate limit, 데이터 사용 정책, production 허용 여부, billing 전환 비용을 같이 확인해야 한다.
왜 저장했나
LLM API 후보는 블로그 글이나 커뮤니티 글만 보고 판단하기 어렵다. 무료처럼 보이지만 실제로는 trial credit이거나, API key는 만들 수 있어도 호출 전에 credit을 넣어야 하는 곳이 많다.
이 노트는 "지금 무료 key로 프로토타입을 만들 수 있는가"라는 기준으로 provider를 나누고, 나중에 API 후보를 다시 고를 때 볼 수 있는 기준표로 남긴다.
정리한 질문
2026년 6월 말 기준으로 무료 API key, 무료 pricing 정책, 무료 trial credit이 있는 LLM API는 무엇이며, 개인 개발이나 프로토타이핑에서 어떤 순서로 테스트하는 것이 좋은가?
상시 무료 또는 무료 모드 후보
Google Gemini API
Gemini API는 1차 후보로 가장 무난하다. 공식 pricing 문서상 Free tier는 제한된 모델 접근, 무료 input/output token, Google AI Studio 접근을 제공한다. 현재 문서에는 gemini-3.5-flash와 gemini-3.1-flash-lite 같은 모델의 Free tier input/output이 무료로 표시되어 있다.
주의할 점도 분명하다. Free tier에서는 content가 Google 제품 개선에 사용될 수 있다고 명시되어 있고, production 성격의 높은 rate limit이나 고급 기능은 paid tier 쪽에 가깝다. 원문 분석에는 Gemini 2.5 Flash 계열이 중심으로 적혀 있었지만, 공개 pricing 문서를 확인한 시점에는 Gemini 3.5 Flash와 3.1 Flash-Lite 항목이 보인다. 이 모델명 drift는 실제 구현 전에 다시 확인해야 한다.
추천 용도:
- 일반 챗봇
- 문서 요약
- 이미지 입력과 멀티모달 실험
- 긴 컨텍스트 기반 MVP
GroqCloud
GroqCloud는 속도 체감이 필요한 프로토타입에 강하다. 공식 rate limit 문서가 Free Plan Limits를 모델별로 공개한다. 예를 들어 llama-3.1-8b-instant는 30 RPM, 14.4K RPD, 6K TPM, 500K TPD이고, llama-3.3-70b-versatile은 30 RPM, 1K RPD, 12K TPM, 100K TPD다. openai/gpt-oss-120b도 30 RPM, 1K RPD, 8K TPM, 200K TPD로 표시된다.
OpenAI-compatible endpoint로 붙이기 쉬운 점도 장점이다. 기존 OpenAI SDK 스타일 코드에서 base URL과 model만 바꿔 실험하기 좋다.
추천 용도:
- 빠른 챗봇 데모
- 실시간 UX 테스트
- 오픈모델 기반 tool-calling 또는 에이전트 실험
- latency benchmark
Cerebras Cloud
Cerebras Cloud는 무료 tier에서 Cerebras powered model 접근을 제공한다. pricing 문서상 Developer tier는 $10부터 시작하고 free tier보다 10배 높은 rate limit을 제공하므로, free tier는 초고속 inference를 먼저 맛보는 용도로 보는 편이 맞다.
추천 용도:
- coding/reasoning 오픈모델 테스트
- 속도 중심 모델 비교
- Groq와 함께 latency 비교
NVIDIA NIM
NVIDIA NIM은 일반적인 "상시 무료 SaaS API"라기보다 개발자 프로그램 기반의 평가용 접근에 가깝다. 공식 FAQ는 NVIDIA Developer Program 회원이 prototyping을 위한 NIM API endpoint에 무료 접근할 수 있고, 연구, 애플리케이션 개발, 실험 목적의 self-host NIM microservice 접근도 가능하다고 설명한다.
반대로 production 사용은 명확히 구분된다. NVIDIA 문서는 production use에는 NVIDIA AI Enterprise license가 필요하다고 설명한다. 따라서 NIM은 개인 프로젝트에서 모델 카탈로그를 확인하고 PoC를 만드는 데는 좋지만, 무료 endpoint를 그대로 상용 서비스 backend로 삼는 것은 피해야 한다.
추천 용도:
- NIM API endpoint 실험
- Llama, Nemotron, Kimi 등 모델 카탈로그 탐색
- enterprise 도입 전 PoC
- self-host inference 검토
OpenRouter free models
OpenRouter는 한 API key로 여러 provider와 모델을 테스트할 수 있다는 점이 좋다. :free 모델 변형은 최대 20 requests/minute가 적용된다. 다만 per-day limit도 있다. 구매 크레딧이 $10 미만이면 :free model request가 하루 50회로 제한되고, $10 이상 구매하면 하루 1000회로 늘어난다.
추천 용도는 production backend가 아니라 모델 비교와 fallback 테스트다. 무료 모델 availability와 라우팅 상태가 바뀔 수 있으므로, 안정 운영에는 직접 provider key나 paid routing을 검토해야 한다.
Mistral AI
Mistral은 Free mode가 기본으로 켜져 있고, evaluation과 prototyping 목적의 제한된 rate limit을 제공한다고 문서에 명시한다. Mistral 모델을 직접 API로 붙여보고 싶거나 유럽권 provider를 검토하는 경우 좋은 후보가 된다.
추천 용도:
- Mistral 모델 직접 테스트
- 오픈모델 계열 비교
- 유럽권 provider 검토
Cloudflare Workers AI
Cloudflare Workers AI는 Free와 Paid Workers plan에 포함된다. 공식 pricing 문서상 무료 할당량은 하루 10,000 Neurons이고, Paid Workers에서는 무료 할당량 초과분이 $0.011 / 1,000 Neurons로 과금된다.
Workers 기반 앱을 만들 계획이라면 특히 유용하다. API backend, edge function, 작은 LLM 기능을 한 플랫폼 안에서 묶을 수 있기 때문이다.
추천 용도:
- Cloudflare Workers 기반 앱
- edge inference
- 서버리스 LLM 기능
- 작은 요약, 분류, 답변 생성 기능
GitHub Models
GitHub Models는 모든 GitHub account에 no-cost, rate-limited access를 제공한다. 무료 사용은 모델별로 제한이 있고, Copilot plan에 따라 한도가 달라질 수 있다. paid usage는 별도 opt-in 구조로 다뤄진다.
추천 용도:
- GitHub 중심 개발 workflow
- 모델 비교
- 코드 예제와 playground 기반 실험
- repository 개발 도중 빠른 API 후보 확인
Trial credit 후보
아래 후보들은 무료 API backend라기보다 "가입 후 소액 크레딧으로 테스트"에 가깝다.
| 서비스 | 무료 형태 | 해석 |
|---|---|---|
| Hugging Face Inference Providers | Free user 월 $0.10 credit | 아주 작은 크레딧으로 provider routing을 맛보는 용도 |
| SambaNova Cloud | 가입 시 $5 API credits, credit card 불필요 | 오픈모델 고속 inference trial |
| AI21 | 신규 계정 $10 credit, 3개월 유효 | Jamba/AI21 API 평가용 |
| Fireworks AI | $1 free credits | 오픈모델 serverless inference trial |
| Cohere | Trial API key 호출 무료, trial key는 rate limited | RAG, rerank, embed, enterprise NLP 평가 |
| Replicate | 일부 모델 limited free runs | 이미지, 비디오, creative model 시험에 더 적합 |
Cohere는 trial API key 호출이 무료이지만 production이나 commercial 목적에는 맞지 않는다. Cohere rate limit 문서와 FAQ는 trial key가 월 1000 API calls 제한을 가진다고 설명한다. RAG, rerank, embedding까지 같이 볼 때는 여전히 평가 가치가 있다.
Hugging Face는 Free user에게 월 $0.10 credit을 제공한다. 이 금액만으로 지속적인 LLM backend를 운영하기는 어렵지만, 여러 provider를 한 인터페이스에서 라우팅해보는 테스트에는 유용하다.
SambaNova, AI21, Fireworks는 시작 크레딧이 명확하다. 각각 $5, $10, $1 수준이라 production 판단보다는 SDK 연동, latency, 모델 품질 확인용으로 봐야 한다.
Replicate의 Try for Free collection은 limited free runs이다. 일반 LLM chat API보다 이미지, 비디오, creative model 실험에 더 맞는다.
무료로 착각하기 쉬운 후보
Together AI
Together AI는 현재 일반 무료 trial 후보로 보기 어렵다. 공식 billing docs는 free trial을 제공하지 않으며, 플랫폼 접근에는 최소 $5 credit purchase와 positive balance가 필요하다고 설명한다.
xAI API
xAI quickstart는 계정을 만든 뒤 API를 사용하려면 credits를 load하라고 안내한다. 따라서 "무료 key를 받아 바로 호출"하는 후보에서는 제외하는 것이 안전하다.
DeepInfra
DeepInfra는 pay-as-you-use pricing을 전면에 내세운다. 스타트업 프로그램이나 이벤트성 credit은 있을 수 있지만, 누구나 즉시 받는 상시 무료 LLM API key 후보로 보기는 어렵다.
Anthropic Claude API
Anthropic은 모델 품질 때문에 후보로 자주 언급되지만, 현재 공개 pricing 문서만으로는 안정적인 상시 무료 API tier로 분류하기 어렵다. 신규 계정 credit이나 프로그램성 credit이 보일 수 있으나 계정, 지역, 시점에 따라 달라질 수 있으므로, 이 노트에서는 "상시 무료 후보"가 아니라 별도 확인 대상에 둔다.
추천 조합
가장 실용적인 개인 개발 조합
Gemini API
- 범용 메인 모델
GroqCloud
- 빠른 오픈모델 응답
OpenRouter
- 무료 모델 비교와 fallback 테스트
이 조합은 가입과 SDK 연동이 비교적 쉽고, 다양한 모델 성격을 빠르게 비교할 수 있다.
속도와 agent latency 테스트 조합
GroqCloud
Cerebras Cloud
NVIDIA NIM
세 후보 모두 빠른 inference나 모델 catalog 탐색에 강하다. 단, NIM은 production 조건을 반드시 별도로 봐야 한다.
Cloudflare 배포 조합
Cloudflare Workers
Cloudflare Workers AI
Gemini 또는 Groq fallback
Workers 기반 앱이라면 Workers AI 무료 일일 할당량을 먼저 쓰고, 부족하거나 모델 품질이 아쉬운 부분만 외부 provider로 빼는 구조가 깔끔하다.
GitHub 중심 개발 조합
GitHub Models
GroqCloud
Gemini API
GitHub Models는 playground와 개발 workflow 안에서 모델을 비교하기 좋고, 실제 앱 backend 후보는 Gemini나 Groq로 검증하는 식이 현실적이다.
API 선택 체크리스트
무료 API 후보를 고를 때는 가격표의 "Free"만 보면 안 된다.
- API key를 만들 수 있는가?
- 호출 전에 credit card나 prepaid credit이 필요한가?
- 무료 쿼터가 per minute, per day, per month 중 무엇으로 제한되는가?
- input/output token 모두 무료인가?
- 무료 tier의 prompt와 completion이 provider 제품 개선에 사용되는가?
- production 또는 commercial use가 허용되는가?
- OpenAI-compatible endpoint를 제공하는가?
- tool calling, streaming, JSON mode, embeddings, image input 같은 기능이 필요한가?
- billing auto-upgrade나 auto-recharge가 기본으로 켜지는가?
- rate limit 초과 시 fallback provider를 붙일 수 있는가?
주의점
- pricing과 rate limit은 자주 바뀐다. 실제 구현 전에는 각 provider의 dashboard와 pricing page를 다시 확인해야 한다.
- 무료 tier는 대부분 평가와 프로토타이핑을 위한 것이다. 사용자 트래픽이 생기는 순간 rate limit, availability, support 문제가 먼저 드러난다.
- 무료 provider를 여러 개 붙이는 구조는 비용을 줄일 수 있지만, 모델별 품질 차이와 context window 차이 때문에 prompt와 eval이 복잡해진다.
- Free tier에서 데이터가 학습이나 제품 개선에 쓰이는지 반드시 확인해야 한다. 민감한 코드, 고객 데이터, 비공개 문서는 무료 tier에 넣지 않는 편이 안전하다.
- Trial credit은 "무료 정책"이 아니라 "초기 테스트 비용 지원"에 가깝다. 크레딧이 끝난 뒤의 단가와 billing 조건을 같이 봐야 한다.
검증이 필요한 주장
- Gemini 무료 대상 모델명과 rate limit은 빠르게 바뀐다. 원문 분석의 Gemini 2.5 Flash 계열 언급은 현재 pricing 문서의 Gemini 3.5 Flash / 3.1 Flash-Lite 항목과 다르므로 구현 직전에 다시 확인해야 한다.
- GroqCloud의 model별 Free Plan Limits는 모델이 추가되거나 retire되면서 바뀔 수 있다.
- NVIDIA NIM의 Developer Program 무료 접근은 production license와 다르다. 상용 서비스에 넣기 전에는 license와 support 조건을 다시 확인해야 한다.
- OpenRouter
:free모델의 availability와 daily limit은 account credit 상태와 모델별 라우팅에 따라 달라질 수 있다. - Cohere, Anthropic, 기타 provider의 trial credit은 계정 상태, 지역, 프로그램 조건에 따라 다를 수 있다.
- DeepInfra, xAI, Together AI는 현재 일반 무료 후보로 보지 않았지만, 이벤트성 credit이나 정책 변경이 생길 수 있다.
Source Fidelity Notes
- Preserved key numbers: Gemini Free tier의 무료 input/output token, Groq
llama-3.1-8b-instant30 RPM / 14.4K RPD / 6K TPM / 500K TPD, Groqllama-3.3-70b-versatile30 RPM / 1K RPD / 12K TPM / 100K TPD, Groqopenai/gpt-oss-120b30 RPM / 1K RPD / 8K TPM / 200K TPD, Cerebras Developer tier $10 및 10배 rate limit, OpenRouter 20 RPM / 50 requests/day / 1000 requests/day, Cloudflare Workers AI 10,000 Neurons/day 및 $0.011 / 1,000 Neurons, Hugging Face $0.10 monthly credits, SambaNova $5 credits, AI21 $10 credits for three months, Fireworks $1 credits, Cohere 1000 API calls/month. - Preserved frameworks / categories: 상시 무료 또는 무료 모드, 개발자 프로그램 기반 평가용 접근, trial credit, 무료로 착각하기 쉬운 후보, 추천 조합, API 선택 체크리스트.
- Updated from current docs: 원문은 2026-06-25 기준 분석이었고 Gemini 2.5 Flash 계열을 중심으로 설명했다. 2026-06-26 공식 pricing 확인 결과, 공개 노트에는 Gemini 3.5 Flash와 Gemini 3.1 Flash-Lite 항목을 기준으로 반영했다.
- Omitted or compressed: provider별 긴 설명, 일부 중복 문장, 약한 2차 출처, live 호출 테스트가 없다는 반복 설명은 줄였다. 직접 live API 호출은 하지 않았다.
- Omission risk: 가격 정책은 시간에 민감하므로 이 노트만으로 결제나 production 의사결정을 하면 안 된다. 실제 사용 직전에는 공식 pricing, rate limit, dashboard quota를 다시 확인해야 한다. 원문은
sources/layer에 별도로 보존했다.
출처 / 참고자료
- 사용자 제공 Korean AI analysis. Raw source preserved at
../../sources/tools/2026-06-26-free-llm-api-keys.raw.md. - Gemini Developer API pricing
- Groq rate limits
- Cerebras pricing
- NVIDIA NIM FAQ
- OpenRouter API limits
- Mistral rate limits and usage tiers
- Cloudflare Workers AI pricing
- GitHub Models billing
- Hugging Face Inference Providers pricing and billing
- SambaNova Cloud plans
- AI21 usage costs
- Fireworks pricing
- Cohere pricing
- Cohere rate limits
- Together AI billing credits
- xAI quickstart
- DeepInfra pricing
- Replicate Try for Free collection