This lists various services that provide free access or credits towards API-based LLM usage.
This list explicitly excludes any services that are not legitimate (eg reverse engineers an existing chatbot)
| Provider | Provider Limits/Notes | Model Name | Model Limits |
|---|---|---|---|
| Groq | Distil Whisper Large v3 | 7200 audio-seconds/minute 2000 requests/day | |
| Gemma 2 9B Instruct | 14400 requests/day 15000 tokens/minute | ||
| Gemma 7B Instruct | 14400 requests/day 15000 tokens/minute | ||
| Llama 3 70B | 14400 requests/day 6000 tokens/minute | ||
| Llama 3 70B - Groq Tool Use Preview | 14400 requests/day 15000 tokens/minute | ||
| Llama 3 8B | 14400 requests/day 30000 tokens/minute | ||
| Llama 3 8B - Groq Tool Use Preview | 14400 requests/day 15000 tokens/minute | ||
| Llama 3.1 70B | 14400 requests/day 131072 tokens/minute | ||
| Llama 3.1 8B | 14400 requests/day 131072 tokens/minute | ||
| Llama Guard 3 8B | 14400 requests/day 15000 tokens/minute | ||
| Mixtral 8x7B | 14400 requests/day 5000 tokens/minute | ||
| Whisper Large v3 | 7200 audio-seconds/minute 2000 requests/day | ||
| OpenRouter | Gemma 2 9B Instruct | 20 requests/minute 200 requests/day | |
| Gemma 7B Instruct | 20 requests/minute 200 requests/day | ||
| Llama 3 8B Instruct | 20 requests/minute 200 requests/day | ||
| Llama 3.1 8B Instruct | 20 requests/minute 200 requests/day | ||
| Mistral 7B Instruct | 20 requests/minute 200 requests/day | ||
| Mythomist 7B | 20 requests/minute 200 requests/day | ||
| Nous Capybara 7B | 20 requests/minute 200 requests/day | ||
| OpenChat 7B | 20 requests/minute 200 requests/day | ||
| Phi-3 Medium 128k Instruct | 20 requests/minute 200 requests/day | ||
| Phi-3 Mini 128k Instruct | 20 requests/minute 200 requests/day | ||
| Qwen 2 7B Instruct | 20 requests/minute 200 requests/day | ||
| Toppy M 7B | 20 requests/minute 200 requests/day | ||
| Zephyr 7B Beta | 20 requests/minute 200 requests/day | ||
| Google AI Studio | Free tier Gemini API access not available within UK/CH/EEA/EU/ Data is used for training. |
Gemini 1.5 Flash | 1000000 tokens/minute 1500 requests/day 15 requests/minute |
| Gemini 1.5 Pro | 32000 tokens/minute 50 requests/day 2 requests/minute |
||
| Gemini 1.5 Pro (Experimental 0801) | 1000000 tokens/minute 50 requests/day 2 requests/minute |
||
| Gemini 1.0 Pro | 32000 tokens/minute 1500 requests/day 15 requests/minute |
||
| Embeddings are available in UK/CH/EEA/EU | text-embedding-004 | 1500 requests/min 100 content/batch |
|
| embedding-001 | 1500 requests/min 100 content/batch |
||
| glhf.chat (Free Beta) | Any model on Hugging Face runnable on vLLM and fits on a A100 node (~640GB VRAM), including Llama 3.1 405B at FP8 | ||
| Cohere | 10 requests/min 1000 requests/month |
Command-R | Shared Limit |
| Command-R+ | Shared Limit | ||
| HuggingFace Serverless Inference | Dynamic Rate Limits. Limited to models smaller than 10GB. Some popular models are supported even if they exceed 10GB. |
Various open models | |
| Hyperbolic (Free Testing Period) | Llama 3 70B Instruct | 200 requests/minute | |
| Hermes 3 Llama 3.1 70B | 200 requests/minute | ||
| Llama 3.1 70B Instruct | 200 requests/minute | ||
| Llama 3.1 405B Instruct | 200 requests/minute | ||
| Llama 3.1 405B Base (FP8) | 200 requests/minute | ||
| Llama 3.1 8B Instruct | 200 requests/minute | ||
| OVH AI Endpoints (Free Alpha) | Token expires every 2 weeks. | CodeLlama 13B Instruct | 12 requests/minute |
| Llama 2 13B Chat | 12 requests/minute | ||
| Llama 3 70B Instruct | 12 requests/minute | ||
| Llama 3 8B Instruct | 12 requests/minute | ||
| Mistral 7B Instruct | 12 requests/minute | ||
| Mixtral 8x22B Instruct | 12 requests/minute | ||
| Mixtral 8x7B Instruct | 12 requests/minute | ||
| Cloudflare Workers AI | 10000 neurons/day Beta models have unlimited usage. Typically 300 requests/min for text models. | Deepseek Coder 6.7B Base (AWQ) | |
| Deepseek Coder 6.7B Instruct (AWQ) | |||
| Deepseek Math 7B Instruct | |||
| Discolm German 7B v1 (AWQ) | |||
| Falcom 7B Instruct | |||
| Gemma 2B Instruct (LoRA) | |||
| Gemma 7B Instruct | |||
| Gemma 7B Instruct (LoRA) | |||
| Hermes 2 Pro Mistral 7B | |||
| Llama 2 13B Chat (AWQ) | |||
| Llama 2 7B Chat (FP16) | |||
| Llama 2 7B Chat (INT8) | |||
| Llama 2 7B Chat (LoRA) | |||
| Llama 3 8B Instruct | |||
| Llama 3 8B Instruct | |||
| Llama 3 8B Instruct (AWQ) | |||
| Llama 3.1 8B Instruct | |||
| Llama 3.1 8B Instruct (AWQ) | |||
| Llama 3.1 8B Instruct (FP8) | |||
| LlamaGuard 7B (AWQ) | |||
| Mistral 7B Instruct v0.1 | |||
| Mistral 7B Instruct v0.1 (AWQ) | |||
| Mistral 7B Instruct v0.2 | |||
| Mistral 7B Instruct v0.2 (LoRA) | |||
| Neural Chat 7B v3.1 (AWQ) | |||
| OpenChat 3.5 0106 | |||
| OpenHermes 2.5 Mistral 7B (AWQ) | |||
| Phi-2 | |||
| Qwen 1.5 0.5B Chat | |||
| Qwen 1.5 1.8B Chat | |||
| Qwen 1.5 14B Chat (AWQ) | |||
| Qwen 1.5 7B Chat (AWQ) | |||
| SQLCoder 7B 2 | |||
| Starling LM 7B Beta | |||
| TinyLlama 1.1B Chat v1.0 | |||
| Una Cybertron 7B v2 (BF16) | |||
| Zephyr 7B Beta (AWQ) | |||
| Lambda Labs (Free Preview) | Free for a limited time | Nous Hermes 3 Llama 3.1 405B (FP8) |
| Provider | Credits | Requirements | Models |
|---|---|---|---|
| Anthropic | $5 for 14 days | Phone number verification | Claude 3 |
| Mistral | 2 weeks 1 request/second 500,000 tokens/minute 1,000,000,000 tokens/month |
Mistral Open/Proprietary Models | |
| Together | $5 | Various open models | |
| Fireworks | $1 | Various open models | |
| OctoAI | $10 | Various open models | |
| Unify | $10 (+$40 for getting into contact) | Routes to other providers, various open models and proprietary models (OpenAI, Gemini, Anthropic, Mistral, Perplexity, etc) | |
| DeepInfra | $1.80 | Various open models | |
| NVIDIA NIM | 1000 API calls | Various open models | |
| AI21 | $10 for 3 months | Jamba/Jurrasic-2 | |
| NLP Cloud | $15 | Phone number verification | Various open models |