⚡Under $0.50/hr🧠VRAM Estimator⚖Compare GPUs🎁Free LLM APIs🎯Model Index
ReasoningDenseContext: 125K

Qwen 2.5 72B Instruct

Comprehensive deployment profile and benchmark telemetry for Qwen 2.5 72B Instruct. Self-hosting memory footprints, verified token economics, and direct API endpoints.

Verified Engineering Benchmarks

SWE-bench
49.2%
LiveCodeBench
61.6%
MATH-500
94%
MMLU
90%

VRAM Requirements & Sizing

FP16 Weights
140 GB
INT4 / GGUF (Quantized)
40 GB
Recommended GPU
1x H200
🔗 Quick Actions
🖥️ Compatible GPUs & Self-Host Pricing

Deterministic VRAM math from entity graph. Green = fits in single GPU.

GPUVRAMFP16FP8INT4Calculator Link
H100 SXM580 GBOOMOOM✓ fitsPre-filled →
H200141 GB✓ fits✓ fits✓ fitsPre-filled →
B200192 GB✓ fits✓ fits✓ fitsPre-filled →
A100 80GB80 GBOOMOOM✓ fitsPre-filled →
L40S48 GBOOMOOM✓ fitsPre-filled →
RTX 409024 GBOOMOOMOOMPre-filled →
⚡ Verified Free API Available
GroqNo Card
30 RPM, 14,400 requests/day via Groq Console
OpenRouterNo Card
3 RPM, no credit card required for :free models

Active API Providers & Free Tiers

ProviderInput / 1MOutput / 1MSpeedFree Tier Status
DeepInfra$0.35$0.4050 tok/sPaid API Only
Together AI$0.90$0.9040 tok/sPaid API Only
OpenRouter$0.40$0.5045 tok/sPaid API Only

OpenAI SDK Drop-in

import OpenAI from "openai";

const client = new OpenAI({
  baseURL: "https://api.deepinfra.com/v1",
  apiKey: process.env.DEEPINFRA_API_KEY,
});

const response = await client.chat.completions.create({
  model: "qwen-2.5-72b",
  messages: [{ role: "user", content: "Hello" }],
});

What should I do next?