Free LLM Models

130 free models across 27 providers. Click any model for setup instructions and code.

Qwen3Guard-Gen-0.6B (Beta)

OVH AI Endpoints
32K tokens

DeepSeek-R1

PAID
Chutes.ai
64K

Allam 2 7B

PAID
Groq
7k RPD, 6k TPM

Any GGUF Model

KoboldCpp
Customizable

Gemini 3.1 Pro

Google AI Studio
2M Context, 5 RPM

GLM-4.5-Flash

Z.AI (GLM)
128K

MiniMax M2.7

Groq
196K tokens

Llama 3.2 11B Vision

Hugging Face Inference
128k

Jamba Large

AI21 Labs
Varies

Llama 4 Scout Instruct (Free)

PAID
Together.AI
512K tokens

Any GGUF Model

llama.cpp
RAM limited

LLaVA 1.5

llamafile
Local

GPT-OSS 120B (Cloud)

Ollama Cloud
131K tokens

DeepSeek-R1

Inference.net
64K

Llama 3.1 8B (Fast)

Cerebras
8K

Llama 3.1 (Any Size)

LM Studio
Varies

GPT-4o (via Coze)

Coze
128K

Llama 3.2 3B

Ollama
128K tokens

Mistral 7B

Mistral (La Plateforme)
32k

Snoozy

GPT4All
Local

Qwen3.6 27B

Groq
131K tokens

Grok-2

Grok (xAI)
128K

PrismML Ternary Bonsai 27B (Free)

Together.AI
Varies

Command R+ (08-2024)

Cohere
128K

Any Local Model

Text Generation WebUI
Varies

Hermes 4

Nous Portal
Varies

Llama 3.1 405B

Venice.ai
128K tokens

Google: Gemini 2.0 Flash (free)

OpenRouter
1M

Llama 3 (Local)

Jan.ai
System RAM dependent

Jamba Mini

AI21 Labs
Varies

Llama 3.1 8B Instruct

Cloudflare Workers AI
128K

Mistral 7B

llamafile
Local

GPT-OSS 20B (Cloud)

Ollama Cloud
131K tokens

Llama 3.1 8B Instruct

Inference.net
128K

Llama 3.1 70B (Fast)

Cerebras
8K

Gemma 2 (Any Size)

LM Studio
Varies

Gemini 1.5 Pro (via Coze)

Coze
1M

Gemma 2 9B

Ollama
8K tokens

Mixtral 8x7B

Mistral (La Plateforme)
32k

Llama 3 8B Quant

GPT4All
Local

Grok-2 Mini

Grok (xAI)
128K

Command R (08-2024)

Cohere
128K

Dolphin Mixtral

Venice.ai
32K tokens

Google: Gemini 2.0 Pro (free)

OpenRouter
1M

Mistral (Local)

Jan.ai
System RAM dependent

Llama 3.2 3B Instruct

Cloudflare Workers AI
128K

Qwen3Guard-Gen-8B (Beta)

OVH AI Endpoints
32K tokens

Llama 3.1 70B Instruct

PAID
Chutes.ai
128K

Llama 3.1 8B

Groq
14.4k RPD, 6k TPM

Gemini 3.1 Flash

Google AI Studio
1M Context, 15 RPM

GLM-4.7-Flash

Z.AI (GLM)
128K

Llama 3.1 8B Instruct

Hugging Face Inference
128k

DeepSeek-R1 (Free)

PAID
Together.AI
64K tokens

Meta: Llama 3.3 70B Instruct (free)

OpenRouter
128k

Stable Diffusion 3

Venice.ai
Image

Gemma 2 (Local)

Jan.ai
System RAM dependent

Mistral 7B Instruct v0.2

Cloudflare Workers AI
32K

stable-diffusion-xl-base-v10

OVH AI Endpoints
3.5B Params

Qwen 2.5 72B Instruct

PAID
Chutes.ai
32K

Llama 3.3 70B

Groq
1k RPD, 12k TPM

Gemini 3.0 Flash

Google AI Studio
1M Context, 30 RPM

Qwen 2.5 72B Instruct

Hugging Face Inference
32k

Apriel 1.6 15B Thinker (Free)

PAID
Together.AI
131K tokens

TinyLlama

llamafile
Local

Qwen3.5 (Cloud)

Ollama Cloud
Varies

Llama 3.1 70B Instruct

Inference.net
128K

Llama 4 Scout (Fast)

Cerebras
8K

Mistral (Any version)

LM Studio
Varies

Mistral Nemo 12B

Ollama
32K tokens

Mistral Small

Mistral (La Plateforme)
32k

Nomic Embed

GPT4All
Local

Grok-2 Vision

Grok (xAI)
32K

Command R7B (12-2024)

Cohere
128K

Gemini 3.0 Flash-Lite

Google AI Studio
1M Context, 30 RPM

Gemma 2 9B Instruct

Hugging Face Inference
8k

Apriel 1.5 15B Thinker (Free)

PAID
Together.AI
131K tokens

DeepSeek V4 Flash (Cloud)

Ollama Cloud
Varies

Qwen3 32B (Fast)

Cerebras
8K

Phi-3 (Any version)

LM Studio
Varies

Phi-3.5 Mini

Ollama
128K tokens

Mistral Nemo

Mistral (La Plateforme)
128k

Command A (111B)

Cohere
256K

NVIDIA: Llama 3.1 Nemotron 70B (free)

OpenRouter
128k

Qwen 1.5 7B Chat

Cloudflare Workers AI
32K

nvr-tts-es-es

OVH AI Endpoints
Audio

Llama 4 Maverick 17B

PAID
Groq
1k RPD, 6k TPM

Mistral Large

Mistral (La Plateforme)
128k

Command A+

Cohere
256K

DeepSeek: R1 (free)

OpenRouter
128k

DeepSeek Coder 6.7B

Cloudflare Workers AI
16K

nvr-tts-de-de

OVH AI Endpoints
Audio

Llama 4 Scout

PAID
Groq
1k RPD, 30k TPM

Gemini 2.5 Flash

Google AI Studio
1M Context, 15 RPM

Llama 3.3 70B Instruct

Hugging Face Inference
128K

DeepSeek Coder V2

Ollama
64K tokens

Whisper Large v3

Groq
7.2k audio-sec/min, 2k RPD

Gemini 2.5 Pro

Google AI Studio
1M Context, 5 RPM

Qwen3.5 72B Instruct

Hugging Face Inference
128K

Mistral Medium 3.5

Mistral (La Plateforme)
128k

Aya Expanse 32B

Cohere
128K

DeepSeek: R1 Distill Llama 70B (free)

OpenRouter
128k

Phi-2

Cloudflare Workers AI
2K

nvr-tts-en-us

OVH AI Endpoints
Audio

Codestral

Mistral (La Plateforme)
256k

Mistral: Small 3 (free)

OpenRouter
32k

nvr-tts-it-it

OVH AI Endpoints
Audio

Whisper Large v3 Turbo

Groq
7.2k audio-sec/min, 2k RPD

Gemini 2.0 Flash

Google AI Studio
1M Context, 15 RPM

Flux.1 Dev

Hugging Face Inference
Image

Qwen 2.5 7B Instruct (free)

OpenRouter
32k

Groq Compound

Groq
250 RPD, 70k TPM

Gemini 2.0 Flash Thinking

Google AI Studio
1M Context, 10 RPM

Qwen 2.5 VL 72B Instruct (free)

OpenRouter
32k

Groq Compound Mini

Groq
250 RPD, 70k TPM

Gemini 1.5 Flash

Google AI Studio
1M Context, 15 RPM

Microsoft: Phi-3 Medium (free)

OpenRouter
128k

Llama Guard 4 12B

PAID
Groq
14.4k RPD, 15k TPM

Gemini 1.5 Pro

Google AI Studio
2M Context, 2 RPM

Moonshot Kimi K2

Groq
1k RPD, 10k TPM

Microsoft: Phi-3 Mini (free)

OpenRouter
128k

DeepSeek: V4 Flash (free)

OpenRouter
1M

Moonshot Kimi K2 0905

PAID
Groq
1k RPD, 10k TPM

GPT-OSS 120B

Groq
1k RPD, 8k TPM

Meta: Llama 4 Maverick (free)

OpenRouter
128k

Meta: Llama 4 Scout (free)

OpenRouter
128k

GPT-OSS 20B

Groq
1k RPD, 8k TPM

OpenAI: gpt-oss-120b (free)

OpenRouter
128k

GPT-OSS Safeguard 20B

Groq
1k RPD, 8k TPM

Qwen3 32B

PAID
Groq
1k RPD, 6k TPM

NVIDIA: Nemotron 3 Ultra (free, promo)

OpenRouter
1M