Groq — LPU Inference Engine
Workload Suitability Matrix: Multi-Node Training: LPU architecture not optimized for distributed training; best suited for inference workloads. Spot Inference Prototyping: 30 RPM / 14,400 RPD free tie...
Hosted Models & Token Rates
| MODEL | TOKENS/SEC | INPUT /1M | OUTPUT /1M | FREE TIER | CONTEXT |
|---|---|---|---|---|---|
Llama 3.3 70B Instruct | 500 tok/s | $0.00 | $0.00 | 30 RPM / 14,400 RPD | 128K |
Llama 3.1 8B Instruct | 800 tok/s | $0.01 | $0.01 | 30 RPM / 14,400 RPD | 128K |
Llama 3.2 3B Instruct | 1,200 tok/s | $0.02 | $0.02 | 30 RPM / 14,400 RPD | 128K |
Llama 3.2 1B Instruct | 1,500 tok/s | $0.01 | $0.01 | 30 RPM / 14,400 RPD | 128K |
Gemma 2 27B | 250 tok/s | $0.10 | $0.10 | 30 RPM / 14,400 RPD | 8K |
Gemma 2 9B | 550 tok/s | $0.05 | $0.05 | 30 RPM / 14,400 RPD | 8K |
Gemma 3 12B | 400 tok/s | $0.07 | $0.07 | 30 RPM / 14,400 RPD | 128K |
Competitor Comparison
| PROVIDER | MIN PRICE / HR | AVG TOKEN RATE | FREE TIER | BILLING | KEY ADVANTAGE |
|---|---|---|---|---|---|
| Groq | — | $0.00/1M | 30 requests per minute (RPM) f... | per-token | ★ You are here |
| Cerebras | — | $0.00/1M | Limited free tier available; c... | per-token | Wafer-Scale AI Inference |
| DeepInfra | — | $0.00/1M | Generous free tier with rate l... | per-token | Serverless Open-Source Inference |
Technical Nuances & Editorial Analysis
Workload Suitability Matrix: Multi-Node Training: LPU architecture not optimized for distributed training; best suited for inference workloads. Spot Inference Prototyping: 30 RPM / 14,400 RPD free tier requires no credit card; API fully OpenAI-compatible for drop-in replacement; token generation 280-800 tok/s. Persistent Production API: Model catalog smaller than competitors; free tier available with rate limits; paid tier for higher throughput; ideal for real-time streaming, voice assistants, and latency-sensitive deployments.
Billing Granularity
per-token
How charges are calculated
Hidden Costs
No credit card required for free tier; paid tier requires API key
Watch out for these fees
Free Tier
30 requests per minute (RPM) free tier; no credit card required
Credit requirements and caps
Best Use Case
Best for API-based LLM inference
Ideal workload profile