{"data":{"models":[{"id":"claude-fable-5","provider":"anthropic","family":"claude-fable","display_name":"Claude Fable 5","description":"Anthropic's most capable widely released model. Released June 9, 2026. Was suspended worldwide June 12 - June 30, 2026 under a US export-control directive; the directive was lifted and Fable 5 was restored globally starting July 1, 2026 (Claude API, Claude Platform on AWS, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry). Adaptive thinking always on, 1M context, 128k max output, new tokenizer (up to 35% more tokens vs. pre-4.7 models), web search, code execution, computer use. Temperature/top_p/top_k not supported.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-06-09","limits":{"context_window":1000000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":10,"cached_input_per_mtok":1,"cache_write_5m_per_mtok":12.5,"cache_write_1h_per_mtok":20,"output_per_mtok":50,"batch_input_per_mtok":5,"batch_output_per_mtok":25},"capabilities":{"tools":true,"parallel_tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"prefill":false,"system_prompt":true,"stop_sequences":true,"reasoning":true,"reasoning_modes":["low","medium","high","xhigh","max"],"reasoning_default":"medium","vision":true,"document_input":true,"computer_use":true,"web_search":true,"code_execution":true},"performance":{"intelligence_index":90},"api":{"endpoint":"https://api.anthropic.com/v1/messages","protocol":"anthropic","openai_compatible":false,"auth":{"type":"header","header_name":"x-api-key","env_var":"ANTHROPIC_API_KEY"},"sdks":{"anthropic":{"package":"@anthropic-ai/sdk","model_id":"claude-fable-5"},"vercel-ai":{"package":"@ai-sdk/anthropic","model_id":"claude-fable-5","factory":"anthropic('claude-fable-5')"}},"supported_params":["max_tokens","stop_sequences","system","tools","tool_choice","stream","metadata","thinking","service_tier"],"unsupported_params":["temperature","top_p","top_k"],"notes":"Adaptive thinking always on (no off mode). Temperature, top_p, and top_k return a 400 error when set to non-default values. New tokenizer: same text uses ~30% more tokens vs. pre-4.7 models. Full 1M context at standard pricing."},"aggregator_ids":{"openrouter":"anthropic/claude-fable-5","aws-bedrock":"anthropic.claude-fable-5","gcp-vertex":"claude-fable-5"},"manual_tags":["smartest","best_for_coding"],"sources":{"spec":"https://platform.claude.com/docs/en/about-claude/models/all-models","pricing":"https://platform.claude.com/docs/en/about-claude/pricing","release_notes":"https://www.anthropic.com/news/redeploying-fable-5"},"last_verified":"2026-08-10"},{"id":"claude-opus-5","provider":"anthropic","family":"claude-5","display_name":"Claude Opus 5","description":"For complex agentic coding and enterprise work. Step-change over Claude Opus 4.8, with the largest gains in deep reasoning, agentic/long-horizon tasks, and test-time compute scaling. 1M context window (default and maximum, no smaller variant), 128k max output. Adaptive thinking is on by default (breaking change vs. Opus 4.8, where omitting thinking meant no thinking); thinking:{type:\"disabled\"} is accepted only at effort high or below (400 at xhigh/max). Same price as Opus 4.8. Temperature/top_p/top_k and assistant-turn prefill are not supported. Web fetch tool is not available on this model (an exception to Opus feature parity).","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","limits":{"context_window":1000000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":5,"cached_input_per_mtok":0.5,"cache_write_5m_per_mtok":6.25,"cache_write_1h_per_mtok":10,"output_per_mtok":25,"batch_input_per_mtok":2.5,"batch_output_per_mtok":12.5,"notes":"Fast mode (research preview, Claude API only, incl. Claude Managed Agents): $10 input / $50 output per MTok; not available on Amazon Bedrock, Google Cloud, or Microsoft Foundry, and not available with the Batch API or Priority Tier. Prompt-cache minimum is 512 tokens (down from 1024 on Opus 4.8)."},"capabilities":{"tools":true,"parallel_tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"prefill":false,"system_prompt":true,"stop_sequences":true,"reasoning":true,"reasoning_modes":["low","medium","high","xhigh","max"],"reasoning_default":"high","vision":true,"document_input":true,"computer_use":true,"web_search":true,"code_execution":true},"api":{"endpoint":"https://api.anthropic.com/v1/messages","protocol":"anthropic","openai_compatible":false,"auth":{"type":"header","header_name":"x-api-key","env_var":"ANTHROPIC_API_KEY"},"sdks":{"anthropic":{"package":"@anthropic-ai/sdk","model_id":"claude-opus-5"},"vercel-ai":{"package":"@ai-sdk/anthropic","model_id":"claude-opus-5","factory":"anthropic('claude-opus-5')"}},"supported_params":["max_tokens","stop_sequences","system","tools","tool_choice","stream","metadata","thinking","service_tier"],"unsupported_params":["temperature","top_p","top_k"],"notes":"Adaptive thinking on by default (unlike Opus 4.8, where omitting thinking ran without it); thinking:{type:\"disabled\"} is accepted only at effort high or below, returning 400 at xhigh/max. Temperature, top_p, and top_k return a 400 error when set to non-default values. Assistant-turn prefill returns a 400 error — use output_config.format or system prompt instructions instead. Web fetch tool is not available on this model. Full 1M context (default and maximum) at standard pricing."},"aggregator_ids":{"aws-bedrock":"anthropic.claude-opus-5","gcp-vertex":"claude-opus-5"},"manual_tags":["best_for_coding"],"sources":{"spec":"https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5","pricing":"https://platform.claude.com/docs/en/about-claude/pricing"},"last_verified":"2026-08-10"},{"id":"claude-sonnet-5","provider":"anthropic","family":"claude-5","display_name":"Claude Sonnet 5","description":"Default model for Free and Pro plans; available on Max, Team, and Enterprise. Announced June 30, 2026. Introductory pricing of $2/$10 per MTok was made permanent on Aug 10, 2026 — the previously planned Sep 1, 2026 increase to $3/$15 will not occur, so Sonnet 5 is now permanently cheaper than Sonnet 4.6. Adaptive thinking on by default (no manual extended-thinking budget_tokens — returns a 400 error). 1M context, 128k max output (300k on Batch API with output-300k-2026-03-24 beta header). Training data cutoff January 2026. First Sonnet-tier model with real-time cybersecurity safeguards (refusals return HTTP 200, stop_reason: \"refusal\"). Temperature/top_p/top_k not supported.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-06-30","limits":{"context_window":1000000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":2,"cached_input_per_mtok":0.2,"cache_write_5m_per_mtok":2.5,"cache_write_1h_per_mtok":4,"output_per_mtok":10,"batch_input_per_mtok":1,"batch_output_per_mtok":5,"notes":"Introductory $2/$10 per-MTok pricing was made permanent on Aug 10, 2026 — the previously announced increase to $3/$15 on Sep 1, 2026 will not occur. $2/$10 is now the standard (non-introductory) rate; no future increase is scheduled."},"capabilities":{"tools":true,"parallel_tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"prefill":false,"system_prompt":true,"stop_sequences":true,"reasoning":true,"reasoning_modes":["low","medium","high","xhigh","max"],"reasoning_default":"high","vision":true,"document_input":true,"computer_use":true,"web_search":true,"code_execution":true},"api":{"endpoint":"https://api.anthropic.com/v1/messages","protocol":"anthropic","openai_compatible":false,"auth":{"type":"header","header_name":"x-api-key","env_var":"ANTHROPIC_API_KEY"},"sdks":{"anthropic":{"package":"@anthropic-ai/sdk","model_id":"claude-sonnet-5"},"vercel-ai":{"package":"@ai-sdk/anthropic","model_id":"claude-sonnet-5","factory":"anthropic('claude-sonnet-5')"}},"supported_params":["max_tokens","stop_sequences","system","tools","tool_choice","stream","metadata","thinking","service_tier"],"unsupported_params":["temperature","top_p","top_k"],"notes":"Adaptive thinking on by default; manual extended-thinking budget_tokens removed (returns 400). Effort parameter defaults to high on the API and Claude Code. Not available with Priority Tier. Supports zero data retention for ZDR orgs."},"aggregator_ids":{"openrouter":"anthropic/claude-sonnet-5","aws-bedrock":"anthropic.claude-sonnet-5","gcp-vertex":"claude-sonnet-5"},"manual_tags":["best_for_coding"],"sources":{"spec":"https://platform.claude.com/docs/en/about-claude/models/whats-new-sonnet-5","pricing":"https://platform.claude.com/docs/en/about-claude/pricing","release_notes":"https://www.anthropic.com/news/claude-sonnet-5"},"last_verified":"2026-08-17"},{"id":"claude-mythos-5","provider":"anthropic","family":"claude-mythos","display_name":"Claude Mythos 5","description":"Anthropic's highest-capability model, limited access via Project Glasswing (invitation only). Released June 9, 2026; suspended worldwide June 12 - June 26, 2026 under a US export-control directive. Restored June 26-30, 2026, but only to a specific set of US organizations approved by federal authorities under Project Glasswing — not broad GA. Expansion to more domestic/overseas partners is an ongoing discussion with the US government. Same token pricing as Claude Fable 5.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"preview","released":"2026-06-09","limits":{"context_window":1000000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":10,"cached_input_per_mtok":1,"cache_write_5m_per_mtok":12.5,"cache_write_1h_per_mtok":20,"output_per_mtok":50,"batch_input_per_mtok":5,"batch_output_per_mtok":25,"notes":"Invitation-only access via Project Glasswing. Same token pricing as Claude Fable 5."},"capabilities":{"tools":true,"parallel_tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"prefill":false,"system_prompt":true,"stop_sequences":true,"reasoning":true,"reasoning_modes":["low","medium","high","xhigh","max"],"reasoning_default":"medium","vision":true,"document_input":true,"computer_use":true,"web_search":true,"code_execution":true},"performance":{"intelligence_index":92},"api":{"endpoint":"https://api.anthropic.com/v1/messages","protocol":"anthropic","openai_compatible":false,"auth":{"type":"header","header_name":"x-api-key","env_var":"ANTHROPIC_API_KEY"},"sdks":{"anthropic":{"package":"@anthropic-ai/sdk","model_id":"claude-mythos-5"}},"unsupported_params":["temperature","top_p","top_k"],"notes":"Limited availability through Project Glasswing (invitation only). See https://anthropic.com/glasswing for access."},"aggregator_ids":{"aws-bedrock":"anthropic.claude-mythos-5","gcp-vertex":"claude-mythos-5"},"sources":{"spec":"https://platform.claude.com/docs/en/about-claude/models/all-models","pricing":"https://platform.claude.com/docs/en/about-claude/pricing","release_notes":"https://www.anthropic.com/news/redeploying-fable-5"},"last_verified":"2026-08-10"},{"id":"claude-opus-4-8","provider":"anthropic","family":"claude-4","display_name":"Claude Opus 4.8","description":"Anthropic's most capable Opus-tier model for complex reasoning and long-horizon agentic coding. 1M context, 128k max output, adaptive thinking (defaults to high effort). No extended thinking. Temperature/top_p/top_k not supported. Fast mode available at $10/$50 per MTok.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-05-28","limits":{"context_window":1000000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":5,"cached_input_per_mtok":0.5,"cache_write_5m_per_mtok":6.25,"cache_write_1h_per_mtok":10,"output_per_mtok":25,"batch_input_per_mtok":2.5,"batch_output_per_mtok":12.5,"notes":"Fast mode (research preview): $10 input / $50 output per MTok. Batch API not available in fast mode."},"capabilities":{"tools":true,"parallel_tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"prefill":false,"system_prompt":true,"stop_sequences":true,"reasoning":true,"reasoning_modes":["low","medium","high","xhigh","max"],"reasoning_default":"high","vision":true,"document_input":true,"computer_use":true,"web_search":true,"code_execution":true},"performance":{"intelligence_index":85},"api":{"endpoint":"https://api.anthropic.com/v1/messages","protocol":"anthropic","openai_compatible":false,"auth":{"type":"header","header_name":"x-api-key","env_var":"ANTHROPIC_API_KEY"},"sdks":{"anthropic":{"package":"@anthropic-ai/sdk","model_id":"claude-opus-4-8"},"vercel-ai":{"package":"@ai-sdk/anthropic","model_id":"claude-opus-4-8","factory":"anthropic('claude-opus-4-8')"}},"supported_params":["max_tokens","stop_sequences","system","tools","tool_choice","stream","metadata","thinking","service_tier"],"unsupported_params":["temperature","top_p","top_k"],"notes":"Adaptive thinking only; effort defaults to 'high'. Temperature, top_p, and top_k return a 400 error when set to non-default values. New tokenizer (same as Opus 4.7+). Full 1M context at standard pricing."},"aggregator_ids":{"openrouter":"anthropic/claude-opus-4.8","aws-bedrock":"anthropic.claude-opus-4-8","gcp-vertex":"claude-opus-4-8"},"manual_tags":["best_for_coding"],"sources":{"spec":"https://platform.claude.com/docs/en/about-claude/models/all-models","pricing":"https://platform.claude.com/docs/en/about-claude/pricing","release_notes":"https://www.anthropic.com/news/claude-opus-4-8"},"last_verified":"2026-08-10"},{"id":"claude-opus-4-7","provider":"anthropic","family":"claude-4","display_name":"Claude Opus 4.7","description":"Legacy Opus model; use Claude Opus 4.8 for new projects. 1M context, 128k max output, adaptive thinking. New tokenizer (up to 35% more tokens vs. pre-4.7 models). Temperature/top_p/top_k not supported.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-04-16","limits":{"context_window":1000000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":5,"cached_input_per_mtok":0.5,"cache_write_5m_per_mtok":6.25,"cache_write_1h_per_mtok":10,"output_per_mtok":25,"batch_input_per_mtok":2.5,"batch_output_per_mtok":12.5,"notes":"Fast mode (research preview) has been removed from this model as of 2026-07-27 confirmation: requests with speed=\"fast\" now return an error (unlike Opus 4.6, which silently falls back to standard speed/pricing). The model itself remains fully available at standard speed. Migrate to claude-opus-5 or claude-opus-4-8 to continue using fast mode."},"capabilities":{"tools":true,"parallel_tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"prefill":false,"system_prompt":true,"stop_sequences":true,"reasoning":true,"reasoning_modes":["low","medium","high","xhigh","max"],"reasoning_default":"medium","vision":true,"document_input":true,"computer_use":true,"web_search":true,"code_execution":true},"performance":{"intelligence_index":82,"benchmarks":{"swe_bench_verified":87.6,"swe_bench_pro":64.3,"cursor_bench":70}},"api":{"endpoint":"https://api.anthropic.com/v1/messages","protocol":"anthropic","openai_compatible":false,"auth":{"type":"header","header_name":"x-api-key","env_var":"ANTHROPIC_API_KEY"},"sdks":{"anthropic":{"package":"@anthropic-ai/sdk","model_id":"claude-opus-4-7"},"vercel-ai":{"package":"@ai-sdk/anthropic","model_id":"claude-opus-4-7","factory":"anthropic('claude-opus-4-7')"}},"supported_params":["max_tokens","stop_sequences","system","tools","tool_choice","stream","metadata","thinking","service_tier"],"unsupported_params":["temperature","top_p","top_k"],"notes":"Adaptive thinking only (no extended thinking switch). New tokenizer that may use up to ~35% more tokens for the same text. Full 1M context at standard pricing."},"aggregator_ids":{"openrouter":"anthropic/claude-opus-4.7","aws-bedrock":"anthropic.claude-opus-4-7","gcp-vertex":"claude-opus-4-7"},"sources":{"spec":"https://platform.claude.com/docs/en/about-claude/models/all-models","pricing":"https://platform.claude.com/docs/en/about-claude/pricing","docs":"https://platform.claude.com/docs/en/build-with-claude/fast-mode"},"last_verified":"2026-08-10"},{"id":"claude-opus-4-6","provider":"anthropic","family":"claude-4","display_name":"Claude Opus 4.6","description":"Legacy Opus model. 1M context, 128k max output, extended thinking and adaptive thinking, prompt caching. Fast Mode (research preview) was removed June 29, 2026; speed=\"fast\" requests now run at standard pricing.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-02-05","limits":{"context_window":1000000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":5,"cached_input_per_mtok":0.5,"cache_write_5m_per_mtok":6.25,"cache_write_1h_per_mtok":10,"output_per_mtok":25,"batch_input_per_mtok":2.5,"batch_output_per_mtok":12.5,"notes":"Fast Mode was removed June 29, 2026 — speed=\"fast\" requests now silently run at standard speed/pricing (no error)."},"capabilities":{"tools":true,"parallel_tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"prefill":false,"system_prompt":true,"stop_sequences":true,"reasoning":true,"reasoning_modes":["off","low","medium","high","max"],"vision":true,"document_input":true,"computer_use":true,"web_search":true,"code_execution":true},"performance":{"intelligence_index":78,"benchmarks":{"swe_bench_verified":80.8}},"api":{"endpoint":"https://api.anthropic.com/v1/messages","protocol":"anthropic","openai_compatible":false,"auth":{"type":"header","header_name":"x-api-key","env_var":"ANTHROPIC_API_KEY"},"sdks":{"anthropic":{"package":"@anthropic-ai/sdk","model_id":"claude-opus-4-6"},"vercel-ai":{"package":"@ai-sdk/anthropic","model_id":"claude-opus-4-6","factory":"anthropic('claude-opus-4-6')"}},"supported_params":["max_tokens","temperature","top_p","top_k","stop_sequences","system","tools","tool_choice","stream","metadata","thinking"]},"aggregator_ids":{"openrouter":"anthropic/claude-opus-4.6","aws-bedrock":"anthropic.claude-opus-4-6-v1","gcp-vertex":"claude-opus-4-6"},"sources":{"spec":"https://platform.claude.com/docs/en/about-claude/models/all-models","pricing":"https://platform.claude.com/docs/en/about-claude/pricing"},"last_verified":"2026-08-10"},{"id":"claude-opus-4-5-20251101","provider":"anthropic","family":"claude-4","display_name":"Claude Opus 4.5","description":"Legacy Opus model. 200k context, 64k max output, extended thinking, prompt caching. Active but superseded by Opus 4.8.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2025-11-01","limits":{"context_window":200000,"max_output":64000},"pricing":{"currency":"USD","input_per_mtok":5,"cached_input_per_mtok":0.5,"cache_write_5m_per_mtok":6.25,"cache_write_1h_per_mtok":10,"output_per_mtok":25,"batch_input_per_mtok":2.5,"batch_output_per_mtok":12.5},"capabilities":{"tools":true,"parallel_tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"prefill":true,"system_prompt":true,"stop_sequences":true,"reasoning":true,"reasoning_modes":["off","low","medium","high"],"vision":true,"computer_use":true},"performance":{"intelligence_index":75},"api":{"endpoint":"https://api.anthropic.com/v1/messages","protocol":"anthropic","openai_compatible":false,"auth":{"type":"header","header_name":"x-api-key","env_var":"ANTHROPIC_API_KEY"},"sdks":{"anthropic":{"package":"@anthropic-ai/sdk","model_id":"claude-opus-4-5"}}},"aggregator_ids":{"aws-bedrock":"anthropic.claude-opus-4-5-20251101-v1:0","gcp-vertex":"claude-opus-4-5@20251101"},"sources":{"spec":"https://platform.claude.com/docs/en/about-claude/models/all-models"},"last_verified":"2026-08-10"},{"id":"claude-sonnet-4-6","provider":"anthropic","family":"claude-4","display_name":"Claude Sonnet 4.6","description":"Best price-to-performance Claude model. 1M context window, 128k max output, extended thinking and adaptive thinking, prompt caching. 79.6% SWE-bench Verified, 72.5% OSWorld.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-02-17","limits":{"context_window":1000000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":3,"cached_input_per_mtok":0.3,"cache_write_5m_per_mtok":3.75,"cache_write_1h_per_mtok":6,"output_per_mtok":15,"batch_input_per_mtok":1.5,"batch_output_per_mtok":7.5},"capabilities":{"tools":true,"parallel_tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"prefill":false,"system_prompt":true,"stop_sequences":true,"reasoning":true,"reasoning_modes":["off","low","medium","high"],"vision":true,"document_input":true,"computer_use":true,"web_search":true,"code_execution":true},"performance":{"intelligence_index":73,"benchmarks":{"swe_bench_verified":79.6,"osworld":72.5}},"api":{"endpoint":"https://api.anthropic.com/v1/messages","protocol":"anthropic","openai_compatible":false,"auth":{"type":"header","header_name":"x-api-key","env_var":"ANTHROPIC_API_KEY"},"sdks":{"anthropic":{"package":"@anthropic-ai/sdk","model_id":"claude-sonnet-4-6"},"vercel-ai":{"package":"@ai-sdk/anthropic","model_id":"claude-sonnet-4-6","factory":"anthropic('claude-sonnet-4-6')"}},"supported_params":["max_tokens","temperature","top_p","top_k","stop_sequences","system","tools","tool_choice","stream","metadata","thinking"]},"aggregator_ids":{"openrouter":"anthropic/claude-sonnet-4.6","aws-bedrock":"anthropic.claude-sonnet-4-6","gcp-vertex":"claude-sonnet-4-6"},"sources":{"spec":"https://platform.claude.com/docs/en/about-claude/models/all-models","pricing":"https://platform.claude.com/docs/en/about-claude/pricing"},"last_verified":"2026-08-10"},{"id":"claude-sonnet-4-5-20250929","provider":"anthropic","family":"claude-4","display_name":"Claude Sonnet 4.5","description":"Legacy Sonnet model. 200k context, 64k max output, extended thinking, prompt caching. Active but superseded by Sonnet 4.6.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2025-09-29","limits":{"context_window":200000,"max_output":64000},"pricing":{"currency":"USD","input_per_mtok":3,"cached_input_per_mtok":0.3,"cache_write_5m_per_mtok":3.75,"cache_write_1h_per_mtok":6,"output_per_mtok":15,"batch_input_per_mtok":1.5,"batch_output_per_mtok":7.5},"capabilities":{"tools":true,"parallel_tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"prefill":true,"system_prompt":true,"stop_sequences":true,"reasoning":true,"reasoning_modes":["off","low","medium","high"],"vision":true,"computer_use":true},"performance":{"intelligence_index":70},"api":{"endpoint":"https://api.anthropic.com/v1/messages","protocol":"anthropic","openai_compatible":false,"auth":{"type":"header","header_name":"x-api-key","env_var":"ANTHROPIC_API_KEY"},"sdks":{"anthropic":{"package":"@anthropic-ai/sdk","model_id":"claude-sonnet-4-5"}}},"aggregator_ids":{"aws-bedrock":"anthropic.claude-sonnet-4-5-20250929-v1:0","gcp-vertex":"claude-sonnet-4-5@20250929"},"sources":{"spec":"https://platform.claude.com/docs/en/about-claude/models/all-models"},"last_verified":"2026-08-10"},{"id":"claude-haiku-4-5-20251001","provider":"anthropic","family":"claude-4","display_name":"Claude Haiku 4.5","description":"Fastest Claude with near-frontier intelligence. 200k context, 64k max output, extended thinking, prompt caching, vision.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2025-10-01","limits":{"context_window":200000,"max_output":64000},"pricing":{"currency":"USD","input_per_mtok":1,"cached_input_per_mtok":0.1,"cache_write_5m_per_mtok":1.25,"cache_write_1h_per_mtok":2,"output_per_mtok":5,"batch_input_per_mtok":0.5,"batch_output_per_mtok":2.5},"capabilities":{"tools":true,"parallel_tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"prefill":true,"system_prompt":true,"stop_sequences":true,"reasoning":true,"reasoning_modes":["off","low","medium","high"],"vision":true},"performance":{"speed_tps":130,"ttft_ms":400,"intelligence_index":60},"api":{"endpoint":"https://api.anthropic.com/v1/messages","protocol":"anthropic","openai_compatible":false,"auth":{"type":"header","header_name":"x-api-key","env_var":"ANTHROPIC_API_KEY"},"sdks":{"anthropic":{"package":"@anthropic-ai/sdk","model_id":"claude-haiku-4-5"},"vercel-ai":{"package":"@ai-sdk/anthropic","model_id":"claude-haiku-4-5","factory":"anthropic('claude-haiku-4-5')"}}},"aggregator_ids":{"openrouter":"anthropic/claude-haiku-4.5","aws-bedrock":"anthropic.claude-haiku-4-5-20251001-v1:0","gcp-vertex":"claude-haiku-4-5@20251001"},"sources":{"spec":"https://platform.claude.com/docs/en/about-claude/models/all-models","pricing":"https://platform.claude.com/docs/en/about-claude/pricing"},"last_verified":"2026-08-10"},{"id":"deepseek-v4-flash","provider":"deepseek","family":"deepseek-v4","display_name":"DeepSeek V4 Flash","description":"Fast V4 model with thinking and non-thinking modes. 1M context, 384k max output. Replaces deepseek-chat (retired 2026-07-24). Still on the DeepSeek-V4-Flash-0731 build from the 2026-07-31 release (the 2026-08-13 changelog entry updated only V4-Pro). Natively supports the OpenAI Responses API format (adapted for Codex). Thinking mode now offers three effort levels (low/high/max, default high) alongside the on/off toggle, per the 2026-08-13 changelog (\"more flexible thinking effort control\"). The \"significant price increase\" DeepSeek had been flagging without an effective date since early August has now shipped: the pricing page's footnote reverted to concrete peak/off-peak language and a real effective date — \"Off-peak rates are half of the peak rates. Peak hours are 01:00 - 04:00 and 06:00 - 10:00 UTC (all other hours are off-peak)\" — effective 16:00 UTC on 2026-08-16 (per the 2026-08-13 news post) and confirmed live on the pricing page as of 2026-08-17. Rates below are the off-peak tier (17 of 24 UTC hours); peak-hour rates are exactly double — see pricing.notes.","type":"chat","input_modalities":["text"],"output_modalities":["text"],"status":"ga","limits":{"context_window":1000000,"max_output":384000},"pricing":{"currency":"USD","input_per_mtok":0.22,"cached_input_per_mtok":0.007,"output_per_mtok":0.66,"notes":"Off-peak (default/shown) rates apply all hours except 01:00-04:00 and 06:00-10:00 UTC (17 of 24h). During those peak hours (7 of 24h), rates are exactly double: input (cache miss) $0.44/Mtok, input (cache hit) $0.014/Mtok, output $1.32/Mtok. New tiered pricing took effect 16:00 UTC 2026-08-16, replacing the flat $0.14/$0.0028/$0.28 rates in force before then."},"capabilities":{"tools":true,"json_mode":true,"structured_output":true,"streaming":true,"prompt_caching":true,"prefill":true,"system_prompt":true,"reasoning":true,"reasoning_modes":["off","low","high","max"],"reasoning_default":"high"},"performance":{"intelligence_index":70,"benchmarks":{"mmlu_pro":75,"humaneval":86,"terminal_bench_2_1":82.7,"nl2repo":54.2,"cybergym":76.7,"deepswe":54.4,"toolathlon_verified":70.3,"agent_last_exam":25.2,"automation_bench_public":25.1,"dsbench_fullstack":68.7,"dsbench_hard":59.6,"hle_no_tools":37.8,"hle_with_tools":51.5}},"api":{"endpoint":"https://api.deepseek.com/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"DEEPSEEK_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"deepseek-v4-flash"},"anthropic":{"package":"@anthropic-ai/sdk","model_id":"deepseek-v4-flash"}},"supported_params":["max_tokens","temperature","top_p","stop","tools","tool_choice","response_format","stream","reasoning","reasoning_effort"],"notes":"OpenAI-compatible at https://api.deepseek.com; Anthropic-compatible endpoint at https://api.deepseek.com/anthropic. Also natively supports the OpenAI Responses API format (base_url https://api.deepseek.com, adapted for Codex) as of the 2026-08-13 update; reasoning.effort accepts none/low/high/max on the Responses API (none disables thinking). temperature/top_p are accepted but have no effect in thinking mode."},"aggregator_ids":{"openrouter":"deepseek/deepseek-v4-flash"},"manual_tags":["cheapest"],"sources":{"spec":"https://api-docs.deepseek.com/quick_start/pricing","release_notes":"https://api-docs.deepseek.com/news/news260813"},"last_verified":"2026-08-17"},{"id":"deepseek-v4-pro","provider":"deepseek","family":"deepseek-v4","display_name":"DeepSeek V4 Pro","description":"Pro V4 model with strong reasoning. 1M context, 384k max output. Full reasoning model with thinking and non-thinking modes. Reached GA on 2026-08-13 as the DeepSeek-V4-Pro-0813 build (previously flagged \"will follow soon\" as of 2026-07-31), with major agent-capability gains over V4-Pro-Preview (e.g. Terminal Bench 2.1 72.1->87.9, DeepSWE 12.8->62.7, per the official changelog). Now natively supports the OpenAI Responses API format (adapted for Codex) — this went live with the 2026-08-13 GA release, resolving the pricing page's earlier \"early August 2026\" target (deepseek-v4-flash already had it; deepseek-v4-pro previously did not). Thinking mode now offers three effort levels (low/high/max, default high) alongside the on/off toggle, identical to deepseek-v4-flash. Peak/off-peak pricing (see pricing.notes) took effect 16:00 UTC 2026-08-16, delivering the \"significant price increase\" DeepSeek had been flagging without an effective date since early August.","type":"reasoning","input_modalities":["text"],"output_modalities":["text"],"status":"ga","limits":{"context_window":1000000,"max_output":384000,"max_reasoning_tokens":32000},"pricing":{"currency":"USD","input_per_mtok":0.66,"cached_input_per_mtok":0.022,"output_per_mtok":1.98,"notes":"Off-peak (default/shown) rates apply all hours except 01:00-04:00 and 06:00-10:00 UTC (17 of 24h). During those peak hours (7 of 24h), rates are exactly double: input (cache miss) $1.32/Mtok, input (cache hit) $0.044/Mtok, output $3.96/Mtok. New tiered pricing took effect 16:00 UTC 2026-08-16, replacing the flat $0.435/$0.003625/$0.87 rates in force before then."},"capabilities":{"tools":true,"json_mode":true,"structured_output":true,"streaming":true,"prompt_caching":true,"prefill":true,"system_prompt":true,"reasoning":true,"reasoning_modes":["off","low","high","max"],"reasoning_default":"high"},"performance":{"intelligence_index":78,"benchmarks":{"hle_no_tools":42.7,"hle_with_tools":60,"terminal_bench_2_1":87.9,"nl2repo":61.5,"cybergym":83.3,"deepswe":62.7,"toolathlon_verified":74.1,"agent_last_exam":25.7,"automation_bench_public":31.8,"dsbench_fullstack":71.1,"dsbench_hard":67.2}},"api":{"endpoint":"https://api.deepseek.com/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"DEEPSEEK_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"deepseek-v4-pro"},"anthropic":{"package":"@anthropic-ai/sdk","model_id":"deepseek-v4-pro"}},"supported_params":["max_tokens","temperature","top_p","stop","tools","tool_choice","response_format","stream","reasoning","reasoning_effort"],"notes":"OpenAI-compatible at https://api.deepseek.com; Anthropic-compatible endpoint at https://api.deepseek.com/anthropic. As of the 2026-08-13 GA release, also natively supports the OpenAI Responses API format (base_url https://api.deepseek.com, adapted for Codex) — previously unsupported. reasoning.effort accepts none/low/high/max on the Responses API (none disables thinking). temperature/top_p are accepted but have no effect in thinking mode."},"aggregator_ids":{"openrouter":"deepseek/deepseek-v4-pro"},"manual_tags":["best_value"],"sources":{"spec":"https://api-docs.deepseek.com/quick_start/pricing","release_notes":"https://api-docs.deepseek.com/news/news260813"},"last_verified":"2026-08-17"},{"id":"gemini-3.5-flash","provider":"google","family":"gemini-3.5","display_name":"Gemini 3.5 Flash","description":"Google's most intelligent widely-available model for sustained frontier performance on agentic and coding tasks. 1M context, multimodal (text/image/audio/video), thinking support. Stable release.","type":"chat","input_modalities":["text","image","audio","video"],"output_modalities":["text"],"status":"ga","limits":{"context_window":1048576,"max_output":65536,"max_video_seconds":7200},"pricing":{"currency":"USD","input_per_mtok":1.5,"cached_input_per_mtok":0.15,"output_per_mtok":9,"batch_input_per_mtok":0.75,"batch_output_per_mtok":4.5,"notes":"Priority tier: $2.70 input / $16.20 output per MTok. Flex/Batch at 50% of standard."},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"system_prompt":true,"reasoning":true,"reasoning_modes":["off","low","medium","high"],"vision":true,"audio_input":true,"video_input":true,"document_input":true,"web_search":true,"code_execution":true},"performance":{"intelligence_index":86},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-3.5-flash:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-3.5-flash"},"vercel-ai":{"package":"@ai-sdk/google","model_id":"gemini-3.5-flash","factory":"google('gemini-3.5-flash')"}},"supported_params":["max_output_tokens","temperature","top_p","top_k","stop_sequences","tools","response_mime_type","response_schema","thinking_config"]},"aggregator_ids":{"openrouter":"google/gemini-3.5-flash","gcp-vertex":"gemini-3.5-flash"},"manual_tags":["smartest","best_for_coding"],"sources":{"spec":"https://ai.google.dev/gemini-api/docs/models","pricing":"https://ai.google.dev/gemini-api/docs/pricing","release_notes":"https://ai.google.dev/gemini-api/docs/interactions/whats-new-gemini-3.5"},"last_verified":"2026-08-10"},{"id":"gemini-3.6-flash","provider":"google","family":"gemini-3.6","display_name":"Gemini 3.6 Flash","description":"Workhorse Gemini model, released July 21, 2026 alongside gemini-3.5-flash-lite. Positioned by Google as the recommended replacement for gemini-2.5-flash and gemini-2.0-flash. Reduces output token usage ~17% vs 3.5 Flash at a lower price, with built-in client-side computer-use tool. 1M context, multimodal (text/image/audio/video/PDF) input, thinking support. Superseded as the newest Flash model by gemini-3.7-flash (Aug 13, 2026), but remains GA with no shutdown date announced.","type":"chat","input_modalities":["text","image","audio","video"],"output_modalities":["text"],"status":"ga","released":"2026-07-21","limits":{"context_window":1048576,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":0.75,"cached_input_per_mtok":0.075,"output_per_mtok":3.75,"batch_input_per_mtok":0.375,"batch_output_per_mtok":1.875,"notes":"Corrected 2026-08-17: live pricing page (verified via two independent fetches) shows promotional launch pricing in effect through Dec 31, 2026 -- $0.75 input / $3.75 output / $0.075 cached (batch: $0.375/$1.875) -- which the registry had missed; it previously recorded only the post-promo standard rate ($1.50/$7.50, batch $0.75/$3.75) as if it were current. Standard rate of $1.50 input / $7.50 output / $0.15 cached (batch $0.75/$3.75/$0.075) resumes Jan 1, 2027. Priority tier: $1.35 input / $6.75 output through 12/31/26, then $2.70/$13.50 from 1/1/27. Context cache storage: $0.50/MTok/hr through 12/31/26, then $1.00/MTok/hr. Sampling params temperature/top_p/top_k are deprecated for this model; prefilling model turns (ending a request on a model turn) returns HTTP 400."},"capabilities":{"tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"system_prompt":true,"reasoning":true,"vision":true,"audio_input":true,"video_input":true,"document_input":true,"computer_use":true,"web_search":true,"code_execution":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-3.6-flash:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-3.6-flash"}},"notes":"temperature, top_p, and top_k sampling parameters are deprecated starting with this model. Prefilling is not supported."},"sources":{"spec":"https://ai.google.dev/gemini-api/docs/models/gemini-3.6-flash","pricing":"https://ai.google.dev/gemini-api/docs/pricing","release_notes":"https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/"},"last_verified":"2026-08-17"},{"id":"gemini-3.7-flash","provider":"google","family":"gemini-3.7","display_name":"Gemini 3.7 Flash","description":"Google's most intelligent workhorse Flash model, released August 13-14, 2026 -- just three weeks after gemini-3.6-flash -- via an in-place algorithmic/post-training update rather than a from-scratch retrain. Targets complex coding, web development, and agentic/multi-step tool-use workflows; Google reports strong gains over 3.6 Flash on coding benchmarks (DeepSWE v1.1 49.0%->65.3%, FrontierCode 1.1 Main 34.4%->43.6%). 1M context, multimodal (text/image/audio/video/PDF) input, thinking support (low/medium/high; minimal not supported), built-in computer-use tool (preview). Does not support audio/image generation or the Live API. Launched at promotional (roughly half-price) rates through end of 2026.","type":"chat","input_modalities":["text","image","audio","video"],"output_modalities":["text"],"status":"ga","released":"2026-08-13","limits":{"context_window":1048576,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":0.75,"cached_input_per_mtok":0.075,"output_per_mtok":3.75,"batch_input_per_mtok":0.375,"batch_output_per_mtok":1.875,"notes":"Promotional launch pricing through Dec 31, 2026: $0.75 input / $3.75 output / $0.075 cached (batch: $0.375/$1.875/$0.0375). Standard rate resumes Jan 1, 2027 at $1.50 input / $7.50 output / $0.15 cached (batch $0.75/$3.75/$0.075) -- prices are scheduled to double. Priority tier: $1.35 input / $6.75 output through 12/31/26, then $2.70/$13.50 from 1/1/27. Context cache storage: $0.50/MTok/hr through 12/31/26, then $1.00/MTok/hr. Free tier available (rate-limited)."},"capabilities":{"tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"system_prompt":true,"reasoning":true,"reasoning_modes":["low","medium","high"],"vision":true,"audio_input":true,"video_input":true,"document_input":true,"computer_use":true,"web_search":true,"code_execution":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-3.7-flash"}},"notes":"Supports caching, code execution, computer use (preview), file search, function calling, structured outputs, thinking, Google Maps/Search grounding, URL context, and Batch/Flex/Priority inference. Does not support audio generation, image generation, or Live API access."},"sources":{"spec":"https://ai.google.dev/gemini-api/docs/models/gemini-3.7-flash","pricing":"https://ai.google.dev/gemini-api/docs/pricing","release_notes":"https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/"},"last_verified":"2026-08-17"},{"id":"gemini-3.5-flash-lite","provider":"google","family":"gemini-3.5","display_name":"Gemini 3.5 Flash-Lite","description":"Fastest, most cost-effective 3.5-class model, released July 21, 2026 alongside gemini-3.6-flash. Targets high-throughput, low-latency, high-volume workloads with configurable thinking levels; distinct from and not a direct replacement for gemini-3.1-flash-lite, which remains Google's official migration target for gemini-2.5-flash-lite. 1M context, multimodal (text/image/audio/video/PDF) input.","type":"chat","input_modalities":["text","image","audio","video"],"output_modalities":["text"],"status":"ga","released":"2026-07-21","limits":{"context_window":1048576,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":0.3,"output_per_mtok":2.5,"batch_input_per_mtok":0.15,"batch_output_per_mtok":1.25},"capabilities":{"tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"system_prompt":true,"reasoning":true,"vision":true,"audio_input":true,"video_input":true,"document_input":true,"computer_use":true,"web_search":true,"code_execution":true},"performance":{"speed_tps":350},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-3.5-flash-lite:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-3.5-flash-lite"}}},"sources":{"spec":"https://ai.google.dev/gemini-api/docs/models/gemini-3.5-flash-lite","pricing":"https://ai.google.dev/gemini-api/docs/pricing","release_notes":"https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/"},"last_verified":"2026-08-10"},{"id":"gemini-3.5-live-translate-preview","provider":"google","family":"gemini-3.5","display_name":"Gemini Live 3.5 Translate (Preview)","description":"Audio-to-audio real-time translation model based on Gemini 3 Pro. Released June 9, 2026.","type":"audio_chat","input_modalities":["audio"],"output_modalities":["audio"],"status":"preview","released":"2026-06-09","limits":{"context_window":131072,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":3.5,"output_per_mtok":21,"notes":"Audio tokens at ~25 tok/sec (≈ $0.0368/min effective at output rate)."},"capabilities":{"streaming":true,"audio_input":true,"audio_output":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-3.5-live-translate-preview:streamGenerateContent","protocol":"gemini","openai_compatible":false,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"}},"sources":{"spec":"https://ai.google.dev/gemini-api/docs/models/gemini-3.5-live-translate-preview","pricing":"https://ai.google.dev/gemini-api/docs/pricing","release_notes":"https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-live-3-5-translate/"},"last_verified":"2026-08-10"},{"id":"gemini-3.1-flash-live-preview","provider":"google","family":"gemini-3.1","display_name":"Gemini 3.1 Flash Live (Preview)","description":"Live API model for low-latency, real-time voice/video dialogue. Announced March 26, 2026 as Google's highest-quality audio-to-audio (A2A) Live model, powering upgrades to Gemini Live and Search Live. Bidirectional streaming over WebSockets. Async function calling, proactive audio, and affective dialogue are not yet supported.","type":"audio_chat","input_modalities":["text","image","audio","video"],"output_modalities":["text","audio"],"status":"preview","released":"2026-03-26","limits":{"context_window":131072,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":0.75,"output_per_mtok":4.5,"notes":"Audio input: $3.00/MTok (~$0.005/min). Image/video input: $1.00/MTok (~$0.002/min). Audio output: $12.00/MTok (~$0.018/min)."},"capabilities":{"tools":true,"streaming":true,"reasoning":true,"vision":true,"audio_input":true,"video_input":true,"audio_output":true,"web_search":true},"api":{"endpoint":"wss://generativelanguage.googleapis.com/v1beta/live","protocol":"gemini","openai_compatible":false,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-3.1-flash-live-preview"}},"notes":"Function calling is synchronous only (async function calling not yet supported). Caching, code execution, file search, image generation, Maps grounding, structured outputs, URL context, and Batch API are not supported."},"sources":{"spec":"https://ai.google.dev/gemini-api/docs/models/gemini-3.1-flash-live-preview","pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gemini-3.1-flash-tts-preview","provider":"google","family":"gemini-3.1","display_name":"Gemini 3.1 Flash TTS (Preview)","description":"Native text-to-speech model launched April 15, 2026. Steerable via natural-language style/pace/accent/tone instructions and audio tags, native multi-speaker dialogue (up to 2 speakers), 70+ languages with automatic detection. Streaming is supported (unlike the older gemini-2.5 TTS preview models).","type":"tts","input_modalities":["text"],"output_modalities":["audio"],"status":"preview","released":"2026-04-15","limits":{"context_window":32768,"supported_voices":["Zephyr","Puck","Charon","Kore","Fenrir","Leda","Orus","Aoede","Callirrhoe","Autonoe","Enceladus","Iapetus","Umbriel","Algieba","Despina","Erinome","Algenib","Rasalgethi","Laomedeia","Achernar","Alnilam","Schedar","Gacrux","Pulcherrima","Achird","Zubenelgenubi","Vindemiatrix","Sadachbia","Sadaltager","Sulafat"]},"pricing":{"currency":"USD","input_per_mtok":1,"output_per_mtok":20,"batch_input_per_mtok":0.5,"batch_output_per_mtok":10,"notes":"Priced per million tokens, not per character: audio output is billed as tokens like other Gemini models, unlike some other providers' per-character TTS pricing."},"capabilities":{"streaming":true,"speed_control":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-3.1-flash-tts-preview:generateContent","protocol":"gemini","openai_compatible":false,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-3.1-flash-tts-preview"}}},"sources":{"spec":"https://ai.google.dev/gemini-api/docs/speech-generation","pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gemini-3.1-pro-preview","provider":"google","family":"gemini-3.1","display_name":"Gemini 3.1 Pro","description":"Google's most advanced reasoning and coding model, released February 19, 2026. 1M context, multimodal (text/image/audio/video), thinking config. Successor to Gemini 3 Pro.","type":"chat","input_modalities":["text","image","audio","video"],"output_modalities":["text"],"status":"preview","released":"2026-02-19","limits":{"context_window":1048576,"max_output":65536,"max_video_seconds":7200},"pricing":{"currency":"USD","input_per_mtok":2,"cached_input_per_mtok":0.2,"output_per_mtok":12,"batch_input_per_mtok":1,"batch_output_per_mtok":6,"notes":"Pricing tier for prompts ≤200K. >200K: $4 input, $0.40 cached, $18 output."},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"system_prompt":true,"reasoning":true,"reasoning_modes":["off","low","medium","high"],"vision":true,"audio_input":true,"video_input":true,"document_input":true,"web_search":true,"code_execution":true},"performance":{"intelligence_index":84},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-3.1-pro-preview:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-3.1-pro-preview"},"vercel-ai":{"package":"@ai-sdk/google","model_id":"gemini-3.1-pro-preview","factory":"google('gemini-3.1-pro-preview')"}},"supported_params":["max_output_tokens","temperature","top_p","top_k","stop_sequences","tools","response_mime_type","response_schema","thinking_config"],"notes":"OpenAI-compatible endpoint at https://generativelanguage.googleapis.com/v1beta/openai/. As of April 1, 2026, Gemini Pro models are paid-only (no free tier)."},"aggregator_ids":{"openrouter":"google/gemini-3.1-pro-preview","gcp-vertex":"gemini-3.1-pro"},"manual_tags":["smartest","best_for_coding"],"sources":{"spec":"https://docs.cloud.google.com/vertex-ai/generative-ai/docs/models/gemini/3-1-pro","pricing":"https://ai.google.dev/gemini-api/docs/pricing","release_notes":"https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-pro/"},"last_verified":"2026-08-10"},{"id":"gemini-3-flash-preview","provider":"google","family":"gemini-3","display_name":"Gemini 3 Flash","description":"Fast tier in Gemini 3 family. Audio/video/image input, structured outputs, prompt caching.","type":"chat","input_modalities":["text","image","audio","video"],"output_modalities":["text"],"status":"preview","limits":{"context_window":1048576,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":0.5,"cached_input_per_mtok":0.05,"output_per_mtok":3,"batch_input_per_mtok":0.25,"batch_output_per_mtok":1.5,"notes":"Audio input: $1/MTok. Cached audio: $0.10/MTok."},"capabilities":{"tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"reasoning":true,"vision":true,"audio_input":true,"video_input":true},"performance":{"speed_tps":250,"intelligence_index":70},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-3-flash-preview:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-3-flash-preview"}}},"aggregator_ids":{"openrouter":"google/gemini-3-flash-preview","gcp-vertex":"gemini-3-flash"},"sources":{"pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gemini-3.1-flash-lite","provider":"google","family":"gemini-3.1","display_name":"Gemini 3.1 Flash-Lite","description":"Cheapest Gemini 3.1 model. Free tier available with reduced daily quotas. Google's official deprecations table (checked 2026-08-03) now lists a concrete shutdown date (2027-05-07) with gemini-3.5-flash-lite as the named successor — status kept as GA since no explicit deprecation banner was found on the model card itself, but this is the official migration target and should be watched for a formal status change.","type":"chat","input_modalities":["text","image","audio","video"],"output_modalities":["text"],"status":"ga","released":"2026-05-07","sunset_on":"2027-05-07","replacement_id":"gemini-3.5-flash-lite","limits":{"context_window":1048576,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":0.25,"cached_input_per_mtok":0.025,"output_per_mtok":1.5,"batch_input_per_mtok":0.125,"batch_output_per_mtok":0.75,"notes":"Audio input: $0.50/MTok. Cached audio: $0.05/MTok. Non-global routing adds 10% premium."},"capabilities":{"tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"vision":true,"audio_input":true,"document_input":true},"performance":{"speed_tps":300,"intelligence_index":60},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-3.1-flash-lite:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-3.1-flash-lite"}}},"sources":{"pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-17"},{"id":"gemini-3-pro-image","provider":"google","family":"gemini-3","display_name":"Gemini 3 Pro Image (Nano Banana Pro)","description":"GA image generation and editing model on Gemini 3 Pro backbone. Multi-turn editing, Search grounding, infographics, 4K resolution. Replaces gemini-3-pro-image-preview.","type":"image_generation","input_modalities":["text","image"],"output_modalities":["image","text"],"status":"ga","limits":{"context_window":65536,"max_output":32768,"supported_resolutions":["1024x1024","2048x2048","4096x4096"]},"pricing":{"currency":"USD","input_per_mtok":2,"output_per_mtok":12,"batch_input_per_mtok":1,"batch_output_per_mtok":6,"image_tiers":[{"label":"1K/2K image","per_image":0.134},{"label":"4K image","per_image":0.24}],"notes":"Image output charged at $120/MTok in addition to text I/O (flat per-image rate applies across Standard and Priority tiers). Batch: $1.00/$6.00 text I/O; per-image batch rate is 50% off ($0.067 for 1K/2K, $0.12 for 4K). Priority: $3.60/$21.60 text I/O."},"capabilities":{"tools":true,"vision":true,"image_output":true,"web_search":true,"image_to_image":true,"inpainting":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-3-pro-image:generateContent","protocol":"gemini","openai_compatible":false,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-3-pro-image"}}},"aggregator_ids":{"openrouter":"google/gemini-3-pro-image"},"sources":{"pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gemini-3.1-flash-image","provider":"google","family":"gemini-3.1","display_name":"Gemini 3.1 Flash Image","description":"GA image generation and editing on Gemini 3.1 Flash backbone. Fast and cost-efficient. Replaces imagen-4.0-fast-generate-001.","type":"image_generation","input_modalities":["text","image"],"output_modalities":["image","text"],"status":"ga","limits":{"context_window":65536,"max_output":32768},"pricing":{"currency":"USD","input_per_mtok":0.5,"output_per_mtok":3,"batch_input_per_mtok":0.25,"batch_output_per_mtok":1.5,"image_tiers":[{"label":"0.5K image","per_image":0.045},{"label":"1K image","per_image":0.067},{"label":"2K image","per_image":0.101},{"label":"4K image","per_image":0.151}],"notes":"Corrected 2026-07-27: previous single $0.039/image figure was stale/wrong; official pricing page lists resolution-based tiers (Standard: $0.045 @0.5K, $0.067 @1K, $0.101 @2K, $0.151 @4K). Image output charged at $60/MTok in addition to text I/O. Batch: $0.25/$1.50 text I/O; per-image batch is 50% off ($0.022/$0.034/$0.050/$0.076 for 0.5K/1K/2K/4K)."},"capabilities":{"vision":true,"image_output":true,"image_to_image":true,"inpainting":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-3.1-flash-image:generateContent","protocol":"gemini","openai_compatible":false,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-3.1-flash-image"}}},"aggregator_ids":{"openrouter":"google/gemini-3.1-flash-image"},"sources":{"pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gemini-3.1-flash-lite-image","provider":"google","family":"gemini-3.1","display_name":"Gemini 3.1 Flash-Lite Image (Nano Banana 2 Lite)","description":"GA lightweight image generation and editing on the Gemini 3.1 Flash-Lite backbone. Released June 30, 2026 as the cheapest tier of the Nano Banana 2 image family.","type":"image_generation","input_modalities":["text","image","video"],"output_modalities":["image","text"],"status":"ga","released":"2026-06-30","pricing":{"currency":"USD","input_per_mtok":0.25,"output_per_mtok":1.5,"batch_input_per_mtok":0.125,"batch_output_per_mtok":0.75,"notes":"Image output charged at $30/MTok (~$0.0336/1K-resolution image), $15/MTok on Batch."},"capabilities":{"vision":true,"video_input":true,"image_output":true,"image_to_image":true,"inpainting":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-3.1-flash-lite-image:generateContent","protocol":"gemini","openai_compatible":false,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-3.1-flash-lite-image"}}},"aggregator_ids":{"openrouter":"google/gemini-3.1-flash-lite-image"},"manual_tags":["cheapest_image_generation"],"sources":{"spec":"https://ai.google.dev/gemini-api/docs/image-generation","pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gemini-omni-flash-preview","provider":"google","family":"gemini-omni","display_name":"Gemini Omni Flash (Preview)","description":"Public preview released June 30, 2026: a high-speed multimodal model for text/image-to-video generation (3-10s clips, 720p) with conversational editing via the Interactions API.","type":"video_generation","input_modalities":["text","image"],"output_modalities":["video"],"status":"preview","released":"2026-06-30","limits":{"max_video_seconds":10,"max_video_resolution":"720p"},"pricing":{"currency":"USD","input_per_mtok":1.5,"output_per_mtok":17.5,"notes":"Input tokens (text/image/video/audio) billed at a flat $1.50/MTok. Output: $9.00/MTok for text, $17.50/MTok for video -- video output is billed at 5,792 tokens/sec of 720p (~$0.101/sec effective)."},"capabilities":{"image_to_image":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-omni-flash-preview:generateVideo","protocol":"gemini","openai_compatible":false,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"}},"sources":{"spec":"https://ai.google.dev/gemini-api/docs/changelog","pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gemini-2.5-pro","provider":"google","family":"gemini-2.5","display_name":"Gemini 2.5 Pro","description":"Previous-generation GA flagship. 1M context, multimodal, thinking. Corrected 2026-08-10: this model had been marked deprecated (sunset Oct 16, 2026) since June 15, but a fresh structural check of Google's own Gemini Developer API deprecations table (ai.google.dev/gemini-api/docs/deprecations, last updated 2026-08-03) shows the bare gemini-2.5-pro row now reads \"No shutdown date announced\" with an empty replacement column, and the pricing page carries no deprecation warning banner for it either (unlike gemini-2.0-flash, Imagen 4, or Veo 2/3, which still do). Both checks independently agree, so status reverted to GA. Note: the separate Vertex AI / Gemini Enterprise Agent Platform retirement table still lists an October 20, 2026 retirement date with Gemini 3.5 Flash as replacement — this registry entry tracks the Gemini Developer API (generativelanguage.googleapis.com), which is the discrepancy; flagged as a watch item.","type":"chat","input_modalities":["text","image","audio","video"],"output_modalities":["text"],"status":"ga","released":"2025-06-17","limits":{"context_window":1000000,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":1.25,"cached_input_per_mtok":0.13,"output_per_mtok":10,"batch_input_per_mtok":0.625,"batch_output_per_mtok":5,"notes":">200K context: $2.50/$0.25 cached/$15 output."},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"system_prompt":true,"reasoning":true,"vision":true,"audio_input":true,"video_input":true,"document_input":true,"web_search":true,"code_execution":true},"performance":{"intelligence_index":75,"benchmarks":{"mmlu_pro":78,"gpqa":72}},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-2.5-pro:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-2.5-pro"}}},"aggregator_ids":{"openrouter":"google/gemini-2.5-pro","gcp-vertex":"gemini-2.5-pro"},"sources":{"pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-17"},{"id":"gemini-2.5-computer-use-preview-10-2025","provider":"google","family":"gemini-2.5","display_name":"Gemini 2.5 Computer Use Preview","description":"Computer-use specialized variant of Gemini 2.5 Pro, optimized for building browser control agents that automate tasks. Corrected 2026-08-10: the registry had tracked this under a stale/non-callable id (gemini-2.5-pro-computer-use, never re-verified since 2026-06-09). Confirmed via a structural fetch of the official pricing page that the real, currently-callable id is gemini-2.5-computer-use-preview-10-2025; the old id string doesn't resolve. This model does not appear on Google's deprecations table (no shutdown date announced), but Google's own computer-use docs now describe it as a \"Legacy model\" and steer new integrations toward gemini-3.6-flash's built-in computer_use tool instead.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"preview","limits":{"context_window":1000000,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":1.25,"output_per_mtok":10,"notes":"Pricing tier for prompts ≤200K. >200K: $2.50 input / $15.00 output per MTok."},"capabilities":{"tools":true,"streaming":true,"reasoning":true,"vision":true,"computer_use":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-2.5-computer-use-preview-10-2025:generateContent","protocol":"gemini","openai_compatible":false,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-2.5-computer-use-preview-10-2025"}}},"sources":{"pricing":"https://ai.google.dev/gemini-api/docs/pricing","docs":"https://ai.google.dev/gemini-api/docs/computer-use"},"last_verified":"2026-08-10"},{"id":"gemini-2.5-flash","provider":"google","family":"gemini-2.5","display_name":"Gemini 2.5 Flash","description":"Previous-generation fast multimodal model. 1M context, native audio in/out, thinking, code execution. Corrected 2026-08-10: reverted from deprecated (sunset Oct 16, 2026) back to GA — same finding as gemini-2.5-pro. Google's Gemini Developer API deprecations table (last updated 2026-08-03) now shows \"No shutdown date announced\" for the bare gemini-2.5-flash row with no replacement listed, and the pricing page has no deprecation warning banner for it (unlike gemini-2.0-flash/Imagen 4/Veo 2/3, which still carry one). The Vertex AI / Gemini Enterprise Agent Platform retirement table separately still lists October 20, 2026 with Gemini 3.5 Flash-Lite/3.1 Flash-Lite as replacement — noted as a cross-platform discrepancy, not applied here since this entry tracks the Developer API.","type":"chat","input_modalities":["text","image","audio","video"],"output_modalities":["text"],"status":"ga","released":"2025-04-17","limits":{"context_window":1000000,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":0.3,"cached_input_per_mtok":0.03,"output_per_mtok":2.5,"batch_input_per_mtok":0.15,"batch_output_per_mtok":1.25,"notes":"Audio input: $1/MTok. Cached audio: $0.10/MTok."},"capabilities":{"tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"reasoning":true,"vision":true,"audio_input":true,"video_input":true,"web_search":true,"code_execution":true},"performance":{"speed_tps":250,"ttft_ms":350,"intelligence_index":65,"benchmarks":{"mmlu_pro":70}},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-2.5-flash:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-2.5-flash"}}},"aggregator_ids":{"openrouter":"google/gemini-2.5-flash","gcp-vertex":"gemini-2.5-flash"},"sources":{"pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-17"},{"id":"gemini-2.5-flash-lite","provider":"google","family":"gemini-2.5","display_name":"Gemini 2.5 Flash-Lite","description":"Previous-generation cheapest Gemini 2.5 model. 1M context, multimodal input. Free tier available. Corrected 2026-08-10: reverted from deprecated (sunset Oct 16, 2026) back to GA — same finding as gemini-2.5-pro/gemini-2.5-flash. Google's Gemini Developer API deprecations table (last updated 2026-08-03) now shows \"No shutdown date announced\" for this bare id with no replacement listed, and the pricing page carries no deprecation warning banner for it. The Vertex AI / Gemini Enterprise Agent Platform retirement table separately still lists October 20, 2026 (replacement Gemini 3.1 Flash-Lite or Gemma 4) — noted as a cross-platform discrepancy, not applied here since this entry tracks the Developer API.","type":"chat","input_modalities":["text","image","audio"],"output_modalities":["text"],"status":"ga","limits":{"context_window":1000000,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":0.1,"cached_input_per_mtok":0.01,"output_per_mtok":0.4,"batch_input_per_mtok":0.05,"batch_output_per_mtok":0.2,"notes":"Audio input: $0.30/MTok. Cached audio: $0.03/MTok."},"capabilities":{"tools":true,"json_mode":true,"streaming":true,"batching":true,"prompt_caching":true,"vision":true,"audio_input":true},"performance":{"speed_tps":350,"intelligence_index":55},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-2.5-flash-lite:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-2.5-flash-lite"}}},"aggregator_ids":{"openrouter":"google/gemini-2.5-flash-lite","gcp-vertex":"gemini-2.5-flash-lite"},"sources":{"pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-17"},{"id":"gemini-2.5-flash-native-audio-preview-12-2025","provider":"google","family":"gemini-2.5","display_name":"Gemini 2.5 Flash Live Preview","description":"Live API for low-latency voice/video conversations. Bidirectional streaming over WebSockets. Corrected 2026-08-10: the registry had tracked this under a non-existent id (gemini-2.5-flash-live, never re-verified since 2026-06-09) whose pricing figures actually matched this model exactly. The real id, confirmed via a structural fetch of the official pricing page and cross-checked against Google's deprecations table (\"No shutdown date announced\"), is gemini-2.5-flash-native-audio-preview-12-2025, released December 12, 2025. Note: two other, similarly-named ids exist and are already retired — gemini-live-2.5-flash-preview (shutdown Dec 9, 2025) and gemini-2.0-flash-live-001 (shutdown Dec 9, 2025) — both replaced by gemini-3.1-flash-live-preview, not this model.","type":"audio_chat","input_modalities":["text","audio","video","image"],"output_modalities":["text","audio"],"status":"preview","released":"2025-12-12","limits":{"context_window":1000000,"max_output":8192},"pricing":{"currency":"USD","input_per_mtok":0.5,"output_per_mtok":2,"notes":"Audio input: $3/MTok. Audio output: $12/MTok. Video/image input: $3/MTok."},"capabilities":{"tools":true,"streaming":true,"vision":true,"audio_input":true,"video_input":true,"audio_output":true},"api":{"endpoint":"wss://generativelanguage.googleapis.com/v1beta/live","protocol":"gemini","openai_compatible":false,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-2.5-flash-native-audio-preview-12-2025"}}},"sources":{"spec":"https://ai.google.dev/gemini-api/docs/models/gemini-2.5-flash-native-audio-preview-12-2025","pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gemini-embedding-2","provider":"google","family":"gemini-embedding","display_name":"Gemini Embedding 2","description":"Google's latest multimodal embedding model. Supports text, image, audio, and video inputs for semantic search and retrieval. Successor to Gemini Embedding 001.","type":"embedding","input_modalities":["text","image","audio","video"],"output_modalities":["embedding"],"status":"ga","released":"2026-04-22","pricing":{"currency":"USD","input_per_mtok":0.2,"notes":"Text: $0.20/M tokens. Image: $0.45/M ($0.00012/image). Audio: $6.50/M ($0.00016/sec). Video: $12.00/M ($0.00079/frame). Batch rates: 50% off."},"capabilities":{"batching":true,"vision":true,"audio_input":true,"video_input":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-embedding-2:embedContent","protocol":"gemini","openai_compatible":false,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-embedding-2"}}},"manual_tags":["smartest_embedding"],"sources":{"pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"lyria-3-clip-preview","provider":"google","family":"lyria","display_name":"Lyria 3 Clip (Preview)","description":"Google DeepMind music generation model. Short clip generation (≤30 seconds). Released March 25, 2026.","type":"audio_chat","input_modalities":["text"],"output_modalities":["audio"],"status":"preview","released":"2026-03-25","pricing":{"currency":"USD","notes":"$0.04/song."},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/lyria-3-clip-preview:predict","protocol":"gemini","openai_compatible":false,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"}},"sources":{"spec":"https://deepmind.google/models/lyria/","pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"lyria-3-pro-preview","provider":"google","family":"lyria","display_name":"Lyria 3 Pro (Preview)","description":"Google DeepMind music generation model. Full song generation (up to 3 minutes). Released March 25, 2026.","type":"audio_chat","input_modalities":["text"],"output_modalities":["audio"],"status":"preview","released":"2026-03-25","pricing":{"currency":"USD","notes":"$0.08/song."},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/lyria-3-pro-preview:predict","protocol":"gemini","openai_compatible":false,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"}},"sources":{"spec":"https://deepmind.google/models/lyria/","pricing":"https://ai.google.dev/gemini-api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"veo-3.1-generate-preview","provider":"google","family":"veo","display_name":"Veo 3.1","description":"Latest Veo video generation model. Native audio. Fast and Standard tiers. Still carries a preview id/status in Google's own docs despite being the current recommended Veo model.","type":"video_generation","input_modalities":["text","image"],"output_modalities":["video"],"status":"preview","limits":{"max_video_seconds":8,"max_video_resolution":"1080p"},"pricing":{"currency":"USD","video_per_second":0.4,"notes":"Veo 3.1 Standard: $0.40/sec at 720p/1080p, $0.60/sec at 4k (audio included). Veo 3.1 Fast (veo-3.1-fast-generate-preview): $0.10/sec at 720p, $0.12/sec at 1080p, $0.30/sec at 4k. A Lite tier (veo-3.1-lite-generate-preview): $0.05/sec at 720p, $0.08/sec at 1080p (no 4k) — not yet separately tracked here."},"capabilities":{"audio_output":true,"image_to_image":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/veo-3.1-generate-preview:generateVideo","protocol":"gemini","openai_compatible":false,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"}},"aggregator_ids":{"openrouter":"google/veo-3.1"},"sources":{"spec":"https://ai.google.dev/gemini-api/docs/veo"},"last_verified":"2026-08-10"},{"id":"gemma-4-26b-a4b-it","provider":"google","family":"gemma","display_name":"Gemma 4 26B A4B (Instruction-Tuned)","description":"Open-weights Gemma 4 Mixture-of-Experts model served via the Gemini API. 25.2B total parameters, 3.8B active per token (8 active / 128 total experts, plus 1 shared expert). Corrected 2026-08-10: id renamed from the non-callable \"gemma-4-26b-it\" (tracked since the June 9 initial pass, never re-verified) to the real, currently-listed id gemma-4-26b-a4b-it, confirmed via a structural fetch of Google's official Gemma-on-Gemini-API docs (every code sample on that page uses this exact id). Context window and modalities also corrected: official model card lists 256K (262,144) context and text+image input (not text-only, 128K as previously recorded); audio input is only supported on the smaller E2B/E4B/12B Gemma 4 variants, not this one. Pricing corrected: the Gemini API pricing page currently lists Gemma 4 as free of charge with no paid tier available (previous $0.15/$0.60 figures were unconfirmed/unsourced).","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-07-30","limits":{"context_window":262144},"pricing":{"currency":"USD","input_per_mtok":0,"output_per_mtok":0,"notes":"Free of charge via the Gemini API (Google AI Studio); no paid tier currently available (confirmed on the official pricing page)."},"capabilities":{"tools":true,"streaming":true,"prompt_caching":true,"system_prompt":true,"reasoning":true,"vision":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemma-4-26b-a4b-it:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemma-4-26b-a4b-it"}}},"sources":{"spec":"https://ai.google.dev/gemma/docs/core/model_card_4","pricing":"https://ai.google.dev/gemini-api/docs/pricing","docs":"https://ai.google.dev/gemma/docs/core/gemma_on_gemini_api"},"last_verified":"2026-08-10"},{"id":"gemma-4-31b-it","provider":"google","family":"gemma","display_name":"Gemma 4 31B (Instruction-Tuned)","description":"Open-weights Gemma 4 dense model served via the Gemini API. 30.7B total parameters (dense, not MoE), released alongside gemma-4-26b-a4b-it. Was entirely missing from the registry — added 2026-08-10 after confirming both ids via a structural fetch of Google's official Gemma-on-Gemini-API docs and model card. 140+ pre-trained languages, 35+ with native support.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-07-30","limits":{"context_window":262144},"pricing":{"currency":"USD","input_per_mtok":0,"output_per_mtok":0,"notes":"Free of charge via the Gemini API (Google AI Studio); no paid tier currently available (confirmed on the official pricing page)."},"capabilities":{"tools":true,"streaming":true,"prompt_caching":true,"system_prompt":true,"reasoning":true,"vision":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemma-4-31b-it:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemma-4-31b-it"}}},"sources":{"spec":"https://ai.google.dev/gemma/docs/core/model_card_4","pricing":"https://ai.google.dev/gemini-api/docs/pricing","docs":"https://ai.google.dev/gemma/docs/core/gemma_on_gemini_api"},"last_verified":"2026-08-10"},{"id":"gemini-robotics-er-2-preview","provider":"google","family":"gemini-robotics","display_name":"Gemini Robotics-ER 2 (Preview)","description":"Embodied-reasoning model for robotics (spatial understanding, affordance/grasp prediction, trajectory planning) built on a Gemini 3.5 Flash backbone. Launched 2026-07-30. Replaces gemini-robotics-er-1.6-preview, which is scheduled to shut down 2026-08-31.","type":"chat","input_modalities":["text","image","video","audio"],"output_modalities":["text"],"status":"preview","released":"2026-07-30","limits":{"context_window":131072,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":2,"output_per_mtok":10,"batch_input_per_mtok":1,"batch_output_per_mtok":5},"capabilities":{"tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"reasoning":true,"vision":true,"audio_input":true,"video_input":true,"computer_use":true,"web_search":true,"code_execution":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-preview:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-robotics-er-2-preview"}}},"sources":{"spec":"https://ai.google.dev/gemini-api/docs/models/gemini-robotics-er-2-preview","pricing":"https://ai.google.dev/gemini-api/docs/pricing","release_notes":"https://ai.google.dev/gemini-api/docs/changelog","docs":"https://deepmind.google/models/model-cards/gemini-robotics-er-2/"},"last_verified":"2026-08-10"},{"id":"gemini-robotics-er-2-streaming-preview","provider":"google","family":"gemini-robotics","display_name":"Gemini Robotics-ER 2 Streaming (Preview)","description":"Live/streaming variant of gemini-robotics-er-2-preview for real-time robotics control loops. Launched 2026-07-30. Live API models don't support batching, prompt caching, code execution, computer use, or structured output — only the base capabilities carry over from the primary variant. Exact websocket endpoint form not explicitly confirmed on the model page; inferred by analogy with other Gemini Live API models in this registry (e.g. gemini-3.1-flash-live-preview) — re-verify before relying on it for a live integration.","type":"audio_chat","input_modalities":["text","image","video","audio"],"output_modalities":["text"],"status":"preview","released":"2026-07-30","limits":{"context_window":131072,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":2,"output_per_mtok":10},"capabilities":{"tools":true,"streaming":true,"reasoning":true,"vision":true,"audio_input":true,"video_input":true},"api":{"endpoint":"https://generativelanguage.googleapis.com/v1beta/models/gemini-robotics-er-2-streaming-preview:generateContent","protocol":"gemini","openai_compatible":true,"auth":{"type":"bearer","env_var":"GOOGLE_AI_API_KEY"},"sdks":{"google":{"package":"@google/genai","model_id":"gemini-robotics-er-2-streaming-preview"}}},"sources":{"spec":"https://ai.google.dev/gemini-api/docs/models/gemini-robotics-er-2-preview","pricing":"https://ai.google.dev/gemini-api/docs/pricing","docs":"https://deepmind.google/models/model-cards/gemini-robotics-er-2/"},"last_verified":"2026-08-10"},{"id":"openai/gpt-oss-120b","provider":"groq","family":"gpt-oss","display_name":"GPT-OSS 120B (Groq)","description":"OpenAI's open-weights 120B parameter MoE model served on Groq with low-effort and high-effort reasoning modes.","type":"chat","input_modalities":["text"],"output_modalities":["text"],"status":"ga","limits":{"context_window":131072,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":0.15,"cached_input_per_mtok":0.075,"output_per_mtok":0.6},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"prompt_caching":true,"system_prompt":true,"reasoning":true,"reasoning_modes":["low","medium","high"]},"performance":{"speed_tps":500,"intelligence_index":65},"api":{"endpoint":"https://api.groq.com/openai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"GROQ_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"openai/gpt-oss-120b"},"groq":{"package":"groq-sdk","model_id":"openai/gpt-oss-120b"}}},"aggregator_ids":{"openrouter":"openai/gpt-oss-120b"},"manual_tags":["best_value"],"sources":{"spec":"https://console.groq.com/docs/model/openai/gpt-oss-120b","pricing":"https://groq.com/pricing"},"last_verified":"2026-08-17"},{"id":"openai/gpt-oss-20b","provider":"groq","family":"gpt-oss","display_name":"GPT-OSS 20B (Groq)","description":"OpenAI's open-weights 20B parameter model. Very fast inference with reasoning modes.","type":"chat","input_modalities":["text"],"output_modalities":["text"],"status":"ga","limits":{"context_window":131072,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":0.075,"cached_input_per_mtok":0.0375,"output_per_mtok":0.3},"capabilities":{"tools":true,"json_mode":true,"structured_output":true,"streaming":true,"prompt_caching":true,"reasoning":true,"reasoning_modes":["low","medium","high"]},"performance":{"speed_tps":1000,"intelligence_index":50},"api":{"endpoint":"https://api.groq.com/openai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"GROQ_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"openai/gpt-oss-20b"}}},"aggregator_ids":{"openrouter":"openai/gpt-oss-20b"},"manual_tags":["fastest"],"sources":{"spec":"https://console.groq.com/docs/model/openai/gpt-oss-20b","pricing":"https://groq.com/pricing"},"last_verified":"2026-08-17"},{"id":"openai/gpt-oss-safeguard-20b","provider":"groq","family":"gpt-oss","display_name":"GPT-OSS Safeguard 20B (Groq)","description":"Safety-tuned variant of GPT-OSS 20B. Used for content moderation and policy classification.","type":"chat","input_modalities":["text"],"output_modalities":["text"],"status":"preview","limits":{"context_window":131072,"max_output":65536},"pricing":{"currency":"USD","input_per_mtok":0.075,"cached_input_per_mtok":0.0375,"output_per_mtok":0.3},"capabilities":{"tools":true,"json_mode":true,"streaming":true,"reasoning":true,"reasoning_modes":["low","medium","high"]},"performance":{"speed_tps":1000},"api":{"endpoint":"https://api.groq.com/openai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"GROQ_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"openai/gpt-oss-safeguard-20b"}}},"sources":{"spec":"https://console.groq.com/docs/model/openai/gpt-oss-safeguard-20b","pricing":"https://groq.com/pricing"},"last_verified":"2026-08-17"},{"id":"qwen/qwen3.6-27b","provider":"groq","family":"qwen-3.6","display_name":"Qwen 3.6 27B (Groq)","description":"Qwen 3.6 27B served on Groq (Preview Models / Evaluation Only tier per Groq's own docs, despite being the designated replacement for two now-retired GA models). Native vision, reasoning modes, ~500 T/s.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"preview","limits":{"context_window":131072,"max_output":16384,"max_image_size_mb":20},"pricing":{"currency":"USD","input_per_mtok":0.6,"output_per_mtok":3},"capabilities":{"tools":true,"json_mode":true,"streaming":true,"reasoning":true,"vision":true},"performance":{"speed_tps":500,"intelligence_index":65},"api":{"endpoint":"https://api.groq.com/openai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"GROQ_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"qwen/qwen3.6-27b"}}},"aggregator_ids":{"openrouter":"qwen/qwen-3.6-27b"},"sources":{"spec":"https://console.groq.com/docs/model/qwen/qwen3.6-27b","pricing":"https://groq.com/pricing"},"last_verified":"2026-08-17"},{"id":"groq/compound","provider":"groq","family":"groq-compound","display_name":"Groq Compound","description":"Agentic system with integrated web search and code execution tools. Built on Groq's fast inference stack. GA since September 4, 2025 (moved from beta to general availability) — corrected 2026-07-06, previously mislabeled preview.","type":"chat","input_modalities":["text"],"output_modalities":["text"],"status":"ga","limits":{"context_window":131072,"max_output":8192},"pricing":{"currency":"USD","input_per_mtok":0.59,"output_per_mtok":0.79,"notes":"Base rate shown is Llama 3.3 70B pricing (kept for continuity; llama-3.3-70b-versatile's sunset date passed 2026-08-16 but it has not actually been removed from Groq's live catalog as of 2026-08-17 — see that model's entry). UPDATE 2026-08-17: console.groq.com's systems/compound page's \"Underlying Model Pricing\" table changed since last pass — it no longer lists Llama 3.3 70B at all. It now shows GPT-OSS-120B ($0.15 in / $0.60 out per MTok, confirmed) and \"Llama 4 Scout\" (price shown literally as \"Pending\" for both input and output, unconfirmed/unusable — note Llama 4 Scout itself is a retired standalone model on this registry). Final cost depends on which underlying model/tool handles the query. Confirmed Built-in Tool Pricing (raw HTML, 2026-08-17): Basic Web Search $5/1000 requests, Advanced Web Search $8/1000 requests, Visit Website $1/1000 requests, Code Execution $0.18/hr, Wolfram Alpha billed directly by Wolfram (not by Groq). The \"browser automation $0.08/hr\" line item could not be confirmed on this page, the systems/compound-mini page, or the dedicated tool-use/built-in-tools/browser-automation page (checked directly, no pricing figures appear anywhere on that page) — dropped from these notes as unconfirmable after two consecutive passes."},"capabilities":{"tools":true,"json_mode":true,"streaming":true,"web_search":true,"code_execution":true},"performance":{"speed_tps":450},"api":{"endpoint":"https://api.groq.com/openai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"GROQ_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"groq/compound"}}},"sources":{"spec":"https://console.groq.com/docs/compound/systems/compound","pricing":"https://groq.com/pricing"},"last_verified":"2026-08-17"},{"id":"groq/compound-mini","provider":"groq","family":"groq-compound","display_name":"Groq Compound Mini","description":"Smaller, faster Groq Compound variant with built-in web search and code execution. GA since September 4, 2025 — corrected 2026-07-06, previously mislabeled preview.","type":"chat","input_modalities":["text"],"output_modalities":["text"],"status":"ga","limits":{"context_window":131072,"max_output":8192},"pricing":{"currency":"USD","input_per_mtok":0.075,"output_per_mtok":0.3,"notes":"Base rate shown is GPT-OSS-20B pricing. UPDATE 2026-08-17: re-checked specifically because llama-3.3-70b-versatile's published sunset date (2026-08-16) just passed — the tables did NOT simplify. console.groq.com's systems/compound-mini page still shows the same two-tier \"Underlying Model Pricing\" breakdown as before (GPT-OSS-120B $0.15 in/$0.60 out, Llama 3.3 70B $0.59 in/$0.79 out per MTok), unchanged from the prior pass, and still doesn't reference GPT-OSS-20B at all despite Compound Mini's own top-level rate matching that model. Notably this now DIFFERS from the full systems/compound page, whose equivalent table swapped Llama 3.3 70B out for \"Llama 4 Scout\" (price \"Pending\") this same pass — see groq/compound's pricing.notes. Still unclear whether either table is an intentional shared-pool description or a doc-rendering artifact; flagged as an ongoing watch item, base rate left unchanged pending clarification. Confirmed Built-in Tool Pricing unchanged: Basic/Advanced Web Search $5/$8 per 1000 requests, Visit Website $1/1000, Code Execution $0.18/hr, Wolfram Alpha billed directly by Wolfram. No \"browser automation\" pricing line item found on this page either."},"capabilities":{"tools":true,"streaming":true,"web_search":true,"code_execution":true},"performance":{"speed_tps":450},"api":{"endpoint":"https://api.groq.com/openai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"GROQ_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"groq/compound-mini"}}},"sources":{"spec":"https://console.groq.com/docs/compound/systems/compound-mini","pricing":"https://groq.com/pricing"},"last_verified":"2026-08-17"},{"id":"whisper-large-v3-turbo","provider":"groq","family":"whisper","display_name":"Whisper Large v3 Turbo (Groq)","description":"Fastest Whisper variant on Groq — 216x realtime (corrected 2026-07-27, previously listed as 228x). $0.04/hour transcribed.","type":"stt","input_modalities":["audio"],"output_modalities":["text"],"status":"ga","limits":{"max_audio_size_mb":100,"supported_audio_formats":["flac","mp3","mp4","mpeg","mpga","m4a","ogg","wav","webm"]},"pricing":{"currency":"USD","audio_input_per_minute":0.000667,"notes":"Billed per audio hour: $0.04/hour."},"capabilities":{"word_timestamps":true},"performance":{"speed_tps":0},"api":{"endpoint":"https://api.groq.com/openai/v1/audio/transcriptions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"GROQ_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"whisper-large-v3-turbo"}}},"manual_tags":["cheapest_stt"],"sources":{"spec":"https://console.groq.com/docs/speech-to-text","pricing":"https://groq.com/pricing"},"last_verified":"2026-08-17"},{"id":"whisper-large-v3","provider":"groq","family":"whisper","display_name":"Whisper Large v3 (Groq)","description":"Standard Whisper Large v3 on Groq — 189x realtime (corrected 2026-07-27, previously listed as 217x). $0.111/hour transcribed.","type":"stt","input_modalities":["audio"],"output_modalities":["text"],"status":"ga","limits":{"max_audio_size_mb":100,"supported_audio_formats":["flac","mp3","mp4","mpeg","mpga","m4a","ogg","wav","webm"]},"pricing":{"currency":"USD","audio_input_per_minute":0.00185,"notes":"Billed per audio hour: $0.111/hour."},"capabilities":{"word_timestamps":true},"api":{"endpoint":"https://api.groq.com/openai/v1/audio/transcriptions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"GROQ_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"whisper-large-v3"}}},"sources":{"spec":"https://console.groq.com/docs/speech-to-text","pricing":"https://groq.com/pricing"},"last_verified":"2026-08-17"},{"id":"canopylabs/orpheus-v1-english","provider":"groq","family":"orpheus","display_name":"Orpheus v1 English (Groq)","description":"Canopy Labs Orpheus TTS, English. Replaced PlayAI TTS on Groq following the Jan 30, 2026 platform-wide migration.","type":"tts","input_modalities":["text"],"output_modalities":["audio"],"status":"preview","limits":{"supported_audio_formats":["wav","mp3"],"max_input_chars":200},"pricing":{"currency":"USD","per_million_characters":22},"capabilities":{"streaming":true,"speed_control":true},"api":{"endpoint":"https://api.groq.com/openai/v1/audio/speech","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"GROQ_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"canopylabs/orpheus-v1-english"}}},"sources":{"spec":"https://console.groq.com/docs/text-to-speech/orpheus","pricing":"https://groq.com/pricing"},"last_verified":"2026-08-17"},{"id":"canopylabs/orpheus-arabic-saudi","provider":"groq","family":"orpheus","display_name":"Orpheus Arabic Saudi (Groq)","description":"Canopy Labs Orpheus TTS, Arabic (Saudi). Replaced PlayAI TTS Arabic Saudi on Groq following the Jan 30, 2026 platform-wide migration.","type":"tts","input_modalities":["text"],"output_modalities":["audio"],"status":"preview","limits":{"supported_languages":["ar-SA"],"max_input_chars":200},"pricing":{"currency":"USD","per_million_characters":40},"capabilities":{"streaming":true},"api":{"endpoint":"https://api.groq.com/openai/v1/audio/speech","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"GROQ_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"canopylabs/orpheus-arabic-saudi"}}},"sources":{"spec":"https://console.groq.com/docs/text-to-speech/orpheus","pricing":"https://groq.com/pricing"},"last_verified":"2026-08-17"},{"id":"meta-llama/llama-prompt-guard-2-22m","provider":"groq","family":"llama-prompt-guard","display_name":"Llama Prompt Guard 2 (22M)","description":"Specialized classifier model to detect and prevent prompt injection/jailbreak attacks. Listed under Preview Models with confirmed pricing on the canonical console.groq.com/docs/models table, reconfirmed 2026-08-17 (groq.com/pricing itself remains unreachable — still 308-redirects to the homepage as of 2026-08-17 — so it could not be cross-checked there).","type":"moderation","input_modalities":["text"],"output_modalities":["text"],"status":"preview","limits":{"context_window":512,"max_output":512},"pricing":{"currency":"USD","input_per_mtok":0.03,"output_per_mtok":0.03},"api":{"endpoint":"https://api.groq.com/openai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"GROQ_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"meta-llama/llama-prompt-guard-2-22m"}}},"sources":{"spec":"https://console.groq.com/docs/model/meta-llama/llama-prompt-guard-2-22m","pricing":"https://console.groq.com/docs/models"},"last_verified":"2026-08-17"},{"id":"meta-llama/llama-prompt-guard-2-86m","provider":"groq","family":"llama-prompt-guard","display_name":"Llama Prompt Guard 2 (86M)","description":"Specialized classifier model to detect and prevent prompt injection/jailbreak attacks, larger/more accurate variant. Listed under Preview Models with confirmed pricing on the canonical console.groq.com/docs/models table, reconfirmed 2026-08-17 (groq.com/pricing itself remains unreachable — still 308-redirects to the homepage as of 2026-08-17 — so it could not be cross-checked there).","type":"moderation","input_modalities":["text"],"output_modalities":["text"],"status":"preview","limits":{"context_window":512,"max_output":512},"pricing":{"currency":"USD","input_per_mtok":0.04,"output_per_mtok":0.04},"api":{"endpoint":"https://api.groq.com/openai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"GROQ_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"meta-llama/llama-prompt-guard-2-86m"}}},"sources":{"spec":"https://console.groq.com/docs/model/meta-llama/llama-prompt-guard-2-86m","pricing":"https://console.groq.com/docs/models"},"last_verified":"2026-08-17"},{"id":"mistral-medium-3-5","provider":"mistral","family":"mistral-medium","display_name":"Mistral Medium 3.5","description":"Frontier-class 128B dense multimodal model optimized for agentic and coding use cases. Released April 28, 2026. Corrected 2026-07-27: canonical API id is 'mistral-medium-3-5' (aliases 'mistral-medium-3', 'mistral-medium-latest'), not 'mistral-medium-2604' — the docs.mistral.ai model card and changelog never use a dated '-2604' suffix for this release.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-04-28","limits":{"context_window":262144,"max_output":16384},"pricing":{"currency":"USD","input_per_mtok":1.5,"output_per_mtok":7.5,"batch_input_per_mtok":0.75,"batch_output_per_mtok":3.75},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"system_prompt":true,"reasoning":true,"vision":true,"document_input":true},"performance":{"intelligence_index":70,"benchmarks":{"mmlu_pro":75,"humaneval":88}},"api":{"endpoint":"https://api.mistral.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"mistral-medium-3-5"},"vercel-ai":{"package":"@ai-sdk/mistral","model_id":"mistral-medium-3-5","factory":"mistral('mistral-medium-3-5')"}}},"aggregator_ids":{"openrouter":"mistralai/mistral-medium-3-5"},"manual_tags":["best_value"],"sources":{"spec":"https://docs.mistral.ai/models/model-cards/mistral-medium-3-5-26-04","pricing":"https://mistral.ai/pricing"},"last_verified":"2026-08-10"},{"id":"mistral-large-2512","provider":"mistral","family":"mistral-large","display_name":"Mistral Large 3","description":"Open-weight, state-of-the-art general-purpose multimodal model. Released December 2025.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2025-12-02","limits":{"context_window":262144,"max_output":32768},"pricing":{"currency":"USD","input_per_mtok":0.5,"output_per_mtok":1.5,"batch_input_per_mtok":0.25,"batch_output_per_mtok":0.75},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"system_prompt":true,"vision":true,"document_input":true},"performance":{"intelligence_index":68,"benchmarks":{"mmlu_pro":73}},"api":{"endpoint":"https://api.mistral.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"mistral-large-latest"}}},"aggregator_ids":{"openrouter":"mistralai/mistral-large-3"},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/mistral-large-3-25-12","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-10"},{"id":"mistral-small-2603","provider":"mistral","family":"mistral-small","display_name":"Mistral Small 4","description":"Hybrid model for instruct, reasoning and coding. Open-weights, released March 2026.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-03-16","limits":{"context_window":262144,"max_output":8192},"pricing":{"currency":"USD","input_per_mtok":0.15,"output_per_mtok":0.6,"batch_input_per_mtok":0.075,"batch_output_per_mtok":0.3,"notes":"Corrected 2026-07-06 from $0.10/$0.30 to the current official rate of $0.15/$0.60."},"capabilities":{"tools":true,"json_mode":true,"streaming":true,"batching":true,"reasoning":true,"vision":true},"performance":{"intelligence_index":60},"api":{"endpoint":"https://api.mistral.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"mistral-small-latest"}}},"aggregator_ids":{"openrouter":"mistralai/mistral-small-4"},"manual_tags":["cheapest"],"sources":{"spec":"https://docs.mistral.ai/models/model-cards/mistral-small-4-0-26-03","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-10"},{"id":"zai-glm-5-2","provider":"mistral","family":"zai-glm","display_name":"Z.ai GLM 5.2","description":"Third-party open-source text model from Z.ai (GLM 5.2), hosted by Mistral on La Plateforme for long-context agentic coding and coding workflows; served without Mistral modifications. New addition to the catalog, released 2026-08-06 per the official model card and pricing page ('New' badge on mistral.ai/pricing/api as of 2026-08-17). Available through Mistral's global endpoint and EU regional endpoint; not yet available through the US regional endpoint specifically (the global endpoint still serves worldwide, including US callers). Added 2026-08-17 during this pass — was not present as of the 2026-08-10 refresh. Canonical API id 'zai-glm-5-2' confirmed via the model card's primary 'Click to copy' badge (docs.mistral.ai/models/zai-glm-5-2).","type":"chat","input_modalities":["text"],"output_modalities":["text"],"status":"preview","released":"2026-08-06","limits":{"context_window":1000000,"max_output":131072},"pricing":{"currency":"USD","input_per_mtok":1.4,"cached_input_per_mtok":0.14,"output_per_mtok":4.4},"capabilities":{"tools":true,"structured_output":true,"streaming":true,"batching":true},"api":{"endpoint":"https://api.mistral.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"zai-glm-5-2"}},"notes":"Third-party model (Z.ai) served on Mistral's own api.mistral.ai infrastructure without modification. No 'latest' alias observed on the model card."},"sources":{"spec":"https://docs.mistral.ai/models/zai-glm-5-2","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-17"},{"id":"codestral-2508","provider":"mistral","family":"codestral","display_name":"Codestral","description":"Code completion / fill-in-the-middle model. 128K context. Strong on HumanEval. Corrected 2026-07-27: context window is 128K (131072), not 256K.","type":"code","input_modalities":["text"],"output_modalities":["text"],"status":"ga","released":"2025-07-30","limits":{"context_window":131072,"max_output":8192},"pricing":{"currency":"USD","input_per_mtok":0.3,"output_per_mtok":0.9,"batch_input_per_mtok":0.15,"batch_output_per_mtok":0.45},"capabilities":{"tools":true,"json_mode":true,"streaming":true,"batching":true},"performance":{"intelligence_index":65,"benchmarks":{"humaneval":86}},"api":{"endpoint":"https://api.mistral.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"codestral-latest"}}},"aggregator_ids":{"openrouter":"mistralai/codestral-2508"},"manual_tags":["best_for_coding"],"sources":{"spec":"https://docs.mistral.ai/models/model-cards/codestral-25-08","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-10"},{"id":"ministral-14b-2512","provider":"mistral","family":"ministral","display_name":"Ministral 3 14B","description":"Compact 14B Ministral with vision. Open-weight edge model. Corrected 2026-07-27: canonical API id is 'ministral-14b-2512' (no '3' segment), per the official model card.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2025-12-02","limits":{"context_window":262144,"max_output":8192},"pricing":{"currency":"USD","input_per_mtok":0.2,"output_per_mtok":0.2},"capabilities":{"tools":true,"json_mode":true,"streaming":true,"vision":true},"performance":{"intelligence_index":50},"api":{"endpoint":"https://api.mistral.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"ministral-14b-latest"}}},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/ministral-3-14b-25-12","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-10"},{"id":"ministral-8b-2512","provider":"mistral","family":"ministral","display_name":"Ministral 3 8B","description":"Compact 8B Ministral with vision. Cheaper than 14B. Corrected 2026-07-27: canonical API id is 'ministral-8b-2512' (no '3' segment), per the official model card.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2025-12-02","limits":{"context_window":262144,"max_output":8192},"pricing":{"currency":"USD","input_per_mtok":0.15,"output_per_mtok":0.15},"capabilities":{"tools":true,"json_mode":true,"streaming":true,"vision":true},"performance":{"intelligence_index":45},"api":{"endpoint":"https://api.mistral.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"ministral-8b-latest"}}},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/ministral-3-8b-25-12","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-10"},{"id":"ministral-3b-2512","provider":"mistral","family":"ministral","display_name":"Ministral 3 3B","description":"Smallest Ministral. Edge / on-device friendly. Corrected 2026-07-27: canonical API id is 'ministral-3b-2512' (single '3b' segment), and context window is 256K, not 128K, per the official model card.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2025-12-02","limits":{"context_window":262144,"max_output":8192},"pricing":{"currency":"USD","input_per_mtok":0.1,"output_per_mtok":0.1},"capabilities":{"tools":true,"streaming":true,"vision":true},"performance":{"intelligence_index":38},"api":{"endpoint":"https://api.mistral.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"ministral-3b-latest"}}},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/ministral-3-3b-25-12","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-10"},{"id":"voxtral-mini-tts-2603","provider":"mistral","family":"voxtral","display_name":"Voxtral TTS","description":"Text-to-speech with voice cloning. Released March 2026. Corrected 2026-07-27: canonical API id is 'voxtral-mini-tts-2603' (includes 'mini'), not 'voxtral-tts-2603', per the official model card.","type":"tts","input_modalities":["text"],"output_modalities":["audio"],"status":"ga","released":"2026-03-23","limits":{"supported_audio_formats":["wav","mp3","ogg"],"max_input_chars":8000},"pricing":{"currency":"USD","per_million_characters":16,"notes":"Quoted as $0.016 / 1,000 characters."},"capabilities":{"streaming":true,"voice_cloning":true,"speed_control":true},"api":{"endpoint":"https://api.mistral.ai/v1/audio/speech","protocol":"openai_compat","openai_compatible":false,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"voxtral-mini-tts-latest"}}},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/voxtral-tts-26-03","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-10"},{"id":"voxtral-mini-2602","provider":"mistral","family":"voxtral","display_name":"Voxtral Mini Transcribe 2","description":"Multilingual speech-to-text transcription. Cost-efficient. Corrected 2026-07-27: canonical API id is 'voxtral-mini-2602', not 'voxtral-mini-transcribe-2602', per the official model card.","type":"stt","input_modalities":["audio"],"output_modalities":["text"],"status":"ga","released":"2026-02-04","limits":{"max_audio_size_mb":50,"supported_audio_formats":["mp3","wav","flac","m4a","ogg"],"supported_languages":["multilingual"]},"pricing":{"currency":"USD","audio_input_per_minute":0.003},"capabilities":{"streaming":true,"word_timestamps":true,"speaker_diarization":true},"api":{"endpoint":"https://api.mistral.ai/v1/audio/transcriptions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"voxtral-mini-2602"}}},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/voxtral-mini-transcribe-26-02","pricing":"https://mistral.ai/pricing/api","release_notes":"https://mistral.ai/news/voxtral-transcribe-2/"},"last_verified":"2026-08-10"},{"id":"voxtral-mini-transcribe-realtime-2602","provider":"mistral","family":"voxtral","display_name":"Voxtral Mini Transcribe Realtime 2","description":"Multilingual speech-to-text transcription optimized for live, low-latency streaming (vs. the batch-oriented Voxtral Mini Transcribe 2). Was missing from the registry — added 2026-07-20 during a routine audit.","type":"stt","input_modalities":["audio"],"output_modalities":["text"],"status":"ga","released":"2026-02-04","limits":{"max_audio_size_mb":50,"supported_audio_formats":["mp3","wav","flac","m4a","ogg"],"supported_languages":["multilingual"]},"pricing":{"currency":"USD","audio_input_per_minute":0.006},"capabilities":{"streaming":true,"word_timestamps":true},"api":{"endpoint":"https://api.mistral.ai/v1/audio/transcriptions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"voxtral-mini-transcribe-realtime-2602"}}},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/voxtral-mini-transcribe-realtime-26-02","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-10"},{"id":"voxtral-small-2507","provider":"mistral","family":"voxtral","display_name":"Voxtral Small","description":"Audio-aware multimodal LLM. Accepts audio + text input.","type":"audio_chat","input_modalities":["text","audio"],"output_modalities":["text"],"status":"ga","released":"2025-07-15","limits":{"context_window":32000,"max_output":8192},"pricing":{"currency":"USD","input_per_mtok":0.1,"output_per_mtok":0.3,"audio_input_per_minute":0.004},"capabilities":{"tools":true,"streaming":true,"audio_input":true},"api":{"endpoint":"https://api.mistral.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"voxtral-small-2507"}}},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/voxtral-small-25-07","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-10"},{"id":"mistral-embed-2312","provider":"mistral","family":"mistral-embed","display_name":"Mistral Embed","description":"Original Mistral embedding model. 1024 dimensions. Corrected 2026-08-10: canonical API id is 'mistral-embed-2312' per the model card's primary 'Click to copy' badge (docs.mistral.ai/models/model-cards/mistral-embed-23-12); 'mistral-embed' is listed as a secondary alias on the same page, same pattern as every other dated-vs-'latest' pair in this file. Previously this registry used the bare alias as the canonical id.","type":"embedding","input_modalities":["text"],"output_modalities":["embedding"],"status":"ga","released":"2023-12-11","limits":{"max_input_tokens":8192,"max_dimensions":1024},"pricing":{"currency":"USD","input_per_mtok":0.1,"batch_input_per_mtok":0.05},"capabilities":{"batching":true},"performance":{"benchmarks":{"mteb":62.5}},"api":{"endpoint":"https://api.mistral.ai/v1/embeddings","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"mistral-embed-2312"}}},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/mistral-embed-23-12","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-10"},{"id":"codestral-embed-2505","provider":"mistral","family":"codestral-embed","display_name":"Codestral Embed","description":"Code semantic embeddings. Optimized for code search and retrieval.","type":"embedding","input_modalities":["text","code"],"output_modalities":["embedding"],"status":"ga","released":"2025-05-28","limits":{"max_input_tokens":8192,"max_dimensions":1536},"pricing":{"currency":"USD","input_per_mtok":0.15,"batch_input_per_mtok":0.075},"capabilities":{"batching":true},"api":{"endpoint":"https://api.mistral.ai/v1/embeddings","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"codestral-embed-2505"}}},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/codestral-embed-25-05","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-10"},{"id":"mistral-ocr-4-0","provider":"mistral","family":"mistral-ocr","display_name":"Mistral OCR 4","description":"Document AI service: OCR 4 with enhanced layout extraction, structured outputs, and improved accuracy. Released June 23, 2026. Replaces mistral-ocr-2512. Canonical API id is 'mistral-ocr-4-0' (corrected 2026-07-27, not 'mistral-ocr-4-2606'). Updated 2026-08-17: Mistral released OCR 4.1 (mistral-ocr-4-1, tracked separately in this registry) on 2026-07-16 and reassigned the 'mistral-ocr-4' and 'mistral-ocr-latest' aliases to point to it — this model's own model-card page no longer lists those as aliases of mistral-ocr-4-0. Still 'GA' status (not deprecated) per docs.mistral.ai/models/overview as of this pass, so kept as a distinct still-supported entry, but the SDK model_id below was changed from the now-reassigned 'mistral-ocr-latest' to the explicit dated id to avoid silently resolving to the wrong model.","type":"vision","input_modalities":["image"],"output_modalities":["text"],"status":"ga","released":"2026-06-23","pricing":{"currency":"USD","notes":"$4 per 1,000 pages (standard OCR). $5 per 1,000 annotated pages (Document AI/structured extraction), confirmed 2026-07-27 via the official model card. Batch discount (50% off, per Mistral's general batch policy) previously noted as ~$2/1,000 pages but not independently reconfirmed this pass."},"capabilities":{"structured_output":true,"batching":true,"vision":true,"document_input":true},"api":{"endpoint":"https://api.mistral.ai/v1/ocr","protocol":"openai_compat","openai_compatible":false,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"mistral-ocr-4-0"}}},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/ocr-4-0","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-17"},{"id":"mistral-ocr-4-1","provider":"mistral","family":"mistral-ocr","display_name":"Mistral OCR 4.1","description":"Document AI service: OCR 4.1, the newest and current 'mistral-ocr-latest' / 'mistral-ocr-4' model — adds additional confidence-score granularity options to the OCR API on top of OCR 4.0's layout extraction and structured outputs. Released 2026-07-16 per docs.mistral.ai/resources/changelogs. Added to this registry 2026-08-17 (new since the 2026-08-10 pass). Canonical API id 'mistral-ocr-4-1' confirmed via the model card's primary 'Click to copy' badge; aliases 'mistral-ocr-4' and 'mistral-ocr-latest' confirmed via the same page's alias list. Status badge on the model card reads 'Public Preview' (not yet GA) as of 2026-08-17.","type":"vision","input_modalities":["image"],"output_modalities":["text"],"status":"preview","released":"2026-07-16","pricing":{"currency":"USD","notes":"$4 per 1,000 pages (standard OCR). $5 per 1,000 annotated pages (Document AI/structured extraction). Same rate as OCR 4.0, confirmed via both the model card and mistral.ai/pricing/api on 2026-08-17."},"capabilities":{"structured_output":true,"batching":true,"vision":true,"document_input":true},"api":{"endpoint":"https://api.mistral.ai/v1/ocr","protocol":"openai_compat","openai_compatible":false,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"mistral-ocr-latest"}}},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/ocr-4-1","pricing":"https://mistral.ai/pricing/api","release_notes":"https://docs.mistral.ai/resources/changelogs"},"last_verified":"2026-08-17"},{"id":"mistral-ocr-2512","provider":"mistral","family":"mistral-ocr","display_name":"Mistral OCR 3","description":"Document AI service: OCR, layout extraction, structured outputs. OCR 4 is the newer recommended model, but as of 2026-07-06 Mistral's official governance page lists OCR 3 as Active with no retirement date — it remains fully supported for existing integrations. (Corrected 2026-07-06: previously marked deprecated without an official sunset date; that was an error.)","type":"vision","input_modalities":["image"],"output_modalities":["text"],"status":"ga","released":"2025-12-18","pricing":{"currency":"USD","notes":"Corrected 2026-07-27: official model card shows $2 per 1,000 pages (standard OCR) and $3 per 1,000 annotated pages (Document AI/structured extraction), not the previously listed $1 per 1,000 pages."},"capabilities":{"structured_output":true,"vision":true,"document_input":true},"api":{"endpoint":"https://api.mistral.ai/v1/ocr","protocol":"openai_compat","openai_compatible":false,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"mistral-ocr-2512"}}},"sources":{"spec":"https://legal.mistral.ai/ai-governance/models/mistral-ocr-3","pricing":"https://docs.mistral.ai/models/model-cards/ocr-3-25-12"},"last_verified":"2026-08-10"},{"id":"labs-leanstral-1-5","provider":"mistral","family":"leanstral","display_name":"Leanstral 1.5","description":"Labs (experimental) model for Lean 4 formal theorem proving. 119B total / 6.5B active parameters (MoE), Apache 2.0 weights. Released June 30, 2026, superseding the earlier Leanstral (labs-leanstral-2603). Free during the Labs preview. Corrected 2026-08-10: canonical API id is 'labs-leanstral-1-5' (with the 'labs-' prefix), per the model card's primary 'Click to copy' badge (docs.mistral.ai/models/model-cards/leanstral-1-5) — the prior registry entry dropped the 'labs-' prefix ('leanstral-1.5'), incorrectly implying the prefix had been dropped for this release; it has not. Re-verified 2026-08-17: model card badge still 'labs-leanstral-1-5', status 'Public Preview', pricing still free — unchanged. Noting a pricing-page-only inconsistency (not actioned): the 'Leanstral' card on mistral.ai/pricing/api links to the leanstral-1-5 model-card page but its copy-to-clipboard id still reads the older 'labs-leanstral-2603' — appears to be a stale label on that specific pricing widget, since the model card itself (the more authoritative source per this registry's convention) consistently shows 'labs-leanstral-1-5'.","type":"reasoning","input_modalities":["text"],"output_modalities":["text"],"status":"preview","released":"2026-06-30","limits":{"context_window":256000},"pricing":{"currency":"USD","input_per_mtok":0,"output_per_mtok":0,"notes":"Free during the Labs experimental preview."},"capabilities":{"reasoning":true,"code_execution":true},"api":{"endpoint":"https://api.mistral.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"labs-leanstral-1-5"}}},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/leanstral-1-5","release_notes":"https://mistral.ai/news/leanstral-1-5/"},"last_verified":"2026-08-17"},{"id":"mistral-moderation-2603","provider":"mistral","family":"mistral-moderation","display_name":"Mistral Moderation 2","description":"Content moderation classifier with jailbreak detection.","type":"moderation","input_modalities":["text"],"output_modalities":["text"],"status":"ga","released":"2026-03-01","limits":{"context_window":131072},"pricing":{"currency":"USD","input_per_mtok":0,"notes":"Updated 2026-08-10: previously listed at $0.1/M input tokens with a known conflict against the model card's '$0' widget (flagged unresolved on 2026-07-27 and 2026-08-03). This pass, both mistral.ai/pricing/api (which now explicitly reads 'A classifier service for text content moderation. Free') and the model-card page agree it is free — resolving the prior conflict as a genuine pricing change rather than a page glitch. Set to $0 accordingly."},"api":{"endpoint":"https://api.mistral.ai/v1/moderations","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"MISTRAL_API_KEY"},"sdks":{"mistralai":{"package":"@mistralai/mistralai","model_id":"mistral-moderation-latest"}}},"sources":{"spec":"https://docs.mistral.ai/models/model-cards/mistral-moderation-26-03","pricing":"https://mistral.ai/pricing/api"},"last_verified":"2026-08-10"},{"id":"gpt-5.6-sol","provider":"openai","family":"gpt-5.6","display_name":"GPT-5.6 Sol","description":"OpenAI's \"durable capability tier\" family (flagship tier), GA July 9, 2026. 1.05M context, 128k max output, reasoning effort levels (none/low/medium/high/xhigh/max). Knowledge cutoff Feb 16, 2026.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-07-09","limits":{"context_window":1050000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":5,"cached_input_per_mtok":0.5,"output_per_mtok":30,"batch_input_per_mtok":2.5,"batch_output_per_mtok":15,"notes":"Knowledge cutoff Feb 16, 2026. Batch cached input: $0.25/MTok. Fast mode (2x price, up to 2.5x speed, added 2026-07-30, replaces old \"Priority Processing\" tier): $10.00/MTok input, $1.00/MTok cached input, $60.00/MTok output. Fast mode extended 2026-08-05 to long-context prompts exceeding 272K tokens (previously Fast mode was limited to shorter contexts); pricing/speed multipliers unchanged. Ultrafast mode announced 2026-08-13 (Cerebras-hardware-backed, up to 14x faster than Standard / ~750 output tokens/sec, same underlying model/intelligence/context): limited preview for select API customers only, no published token pricing as of 2026-08-17 — not reflected in the pricing fields above pending an official price."},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"system_prompt":true,"log_probs":true,"seed":true,"reasoning":true,"reasoning_modes":["none","low","medium","high","xhigh","max"],"reasoning_default":"medium","vision":true,"computer_use":true,"web_search":true,"code_execution":true},"api":{"endpoint":"https://api.openai.com/v1/responses","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-5.6-sol"},"vercel-ai":{"package":"@ai-sdk/openai","model_id":"gpt-5.6-sol","factory":"openai('gpt-5.6-sol')"}},"supported_params":["max_output_tokens","temperature","top_p","tools","tool_choice","response_format","stream","logprobs","reasoning_effort"]},"sources":{"spec":"https://developers.openai.com/api/docs/models/gpt-5.6-sol","pricing":"https://developers.openai.com/api/docs/pricing","release_notes":"https://developers.openai.com/api/docs/changelog"},"last_verified":"2026-08-17"},{"id":"gpt-5.6-terra","provider":"openai","family":"gpt-5.6","display_name":"GPT-5.6 Terra","description":"OpenAI's \"durable capability tier\" family (mid tier), GA July 9, 2026. 1.05M context, 128k max output, reasoning effort levels (none/low/medium/high/xhigh/max). Knowledge cutoff Feb 16, 2026.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-07-09","limits":{"context_window":1050000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":2,"cached_input_per_mtok":0.2,"output_per_mtok":12,"batch_input_per_mtok":1,"batch_output_per_mtok":6,"notes":"Knowledge cutoff Feb 16, 2026. Standard-tier price cut 20% effective 2026-07-30 (was $2.50/$0.25/$15.00 input/cached/output). Batch cached input: $0.10/MTok. Fast mode (2x price, up to 2.5x speed, added 2026-07-30): $4.00/MTok input, $0.40/MTok cached input, $24.00/MTok output. Fast mode extended 2026-08-05 to long-context prompts exceeding 272K tokens (previously Fast mode was limited to shorter contexts); pricing/speed multipliers unchanged."},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"system_prompt":true,"log_probs":true,"seed":true,"reasoning":true,"reasoning_modes":["none","low","medium","high","xhigh","max"],"reasoning_default":"medium","vision":true,"computer_use":true,"web_search":true,"code_execution":true},"api":{"endpoint":"https://api.openai.com/v1/responses","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-5.6-terra"},"vercel-ai":{"package":"@ai-sdk/openai","model_id":"gpt-5.6-terra","factory":"openai('gpt-5.6-terra')"}},"supported_params":["max_output_tokens","temperature","top_p","tools","tool_choice","response_format","stream","logprobs","reasoning_effort"]},"sources":{"spec":"https://developers.openai.com/api/docs/models/gpt-5.6-terra","pricing":"https://developers.openai.com/api/docs/pricing","release_notes":"https://developers.openai.com/api/docs/changelog"},"last_verified":"2026-08-10"},{"id":"gpt-5.6-luna","provider":"openai","family":"gpt-5.6","display_name":"GPT-5.6 Luna","description":"OpenAI's \"durable capability tier\" family (fastest/cheapest tier), GA July 9, 2026. 1.05M context, 128k max output, reasoning effort levels (none/low/medium/high/xhigh/max). Knowledge cutoff Feb 16, 2026.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-07-09","limits":{"context_window":1050000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":0.2,"cached_input_per_mtok":0.02,"output_per_mtok":1.2,"batch_input_per_mtok":0.1,"batch_output_per_mtok":0.6,"notes":"Knowledge cutoff Feb 16, 2026. Standard-tier price cut 80% effective 2026-07-30 (was $1.00/$0.10/$6.00 input/cached/output). Batch cached input: $0.01/MTok. Fast mode (2x price, up to 2.5x speed, added 2026-07-30): $0.40/MTok input, $0.04/MTok cached input, $2.40/MTok output. Fast mode extended 2026-08-05 to long-context prompts exceeding 272K tokens (previously Fast mode was limited to shorter contexts); pricing/speed multipliers unchanged."},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"system_prompt":true,"log_probs":true,"seed":true,"reasoning":true,"reasoning_modes":["none","low","medium","high","xhigh","max"],"reasoning_default":"medium","vision":true,"computer_use":true,"web_search":true,"code_execution":true},"api":{"endpoint":"https://api.openai.com/v1/responses","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-5.6-luna"},"vercel-ai":{"package":"@ai-sdk/openai","model_id":"gpt-5.6-luna","factory":"openai('gpt-5.6-luna')"}},"supported_params":["max_output_tokens","temperature","top_p","tools","tool_choice","response_format","stream","logprobs","reasoning_effort"]},"sources":{"spec":"https://developers.openai.com/api/docs/models/gpt-5.6-luna","pricing":"https://developers.openai.com/api/docs/pricing","release_notes":"https://developers.openai.com/api/docs/changelog"},"last_verified":"2026-08-10"},{"id":"gpt-5.5","provider":"openai","family":"gpt-5.5","display_name":"GPT-5.5","description":"OpenAI's frontier model, released April 24, 2026. 1.05M context, 128k max output, reasoning effort levels (none/low/medium/high/xhigh). Strongest model for coding and professional work. Current snapshot: gpt-5.5-2026-04-23.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-04-24","limits":{"context_window":1050000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":5,"cached_input_per_mtok":0.5,"output_per_mtok":30,"batch_input_per_mtok":2.5,"batch_output_per_mtok":15,"notes":"Knowledge cutoff Dec 1, 2025. Regional data residency adds 10% surcharge."},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"system_prompt":true,"log_probs":true,"seed":true,"reasoning":true,"reasoning_modes":["none","low","medium","high","xhigh"],"reasoning_default":"medium","vision":true,"computer_use":true,"web_search":true,"code_execution":true},"performance":{"intelligence_index":88},"api":{"endpoint":"https://api.openai.com/v1/responses","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-5.5"},"vercel-ai":{"package":"@ai-sdk/openai","model_id":"gpt-5.5","factory":"openai('gpt-5.5')"}},"supported_params":["max_output_tokens","temperature","top_p","tools","tool_choice","response_format","stream","logprobs","reasoning_effort"]},"aggregator_ids":{"openrouter":"openai/gpt-5.5","azure":"gpt-5.5"},"manual_tags":["smartest","best_for_coding"],"sources":{"spec":"https://developers.openai.com/api/docs/models/gpt-5.5","pricing":"https://developers.openai.com/api/docs/pricing","release_notes":"https://openai.com/index/introducing-gpt-5-5/"},"last_verified":"2026-08-10"},{"id":"gpt-5.5-pro","provider":"openai","family":"gpt-5.5","display_name":"GPT-5.5 Pro","description":"Highest-quality variant of GPT-5.5 for the most complex reasoning tasks. Premium pricing with no caching discount.","type":"reasoning","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-04-24","limits":{"context_window":400000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":30,"output_per_mtok":180,"batch_input_per_mtok":15,"batch_output_per_mtok":90},"capabilities":{"tools":true,"parallel_tools":true,"structured_output":true,"streaming":true,"batching":true,"system_prompt":true,"reasoning":true,"reasoning_modes":["low","medium","high","xhigh"],"vision":true},"performance":{"intelligence_index":90},"api":{"endpoint":"https://api.openai.com/v1/responses","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-5.5-pro"}}},"aggregator_ids":{"openrouter":"openai/gpt-5.5-pro"},"manual_tags":["smartest"],"sources":{"pricing":"https://developers.openai.com/api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gpt-5.4","provider":"openai","family":"gpt-5.4","display_name":"GPT-5.4","description":"Frontier model from before GPT-5.5. 1M context, 128k output. Knowledge cutoff Aug 31, 2025. Lower-cost frontier option versus gpt-5.5.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","limits":{"context_window":1000000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":2.5,"cached_input_per_mtok":0.25,"output_per_mtok":15,"batch_input_per_mtok":1.25,"batch_output_per_mtok":7.5},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"system_prompt":true,"log_probs":true,"seed":true,"reasoning":true,"reasoning_modes":["none","low","medium","high"],"vision":true,"web_search":true,"code_execution":true},"performance":{"intelligence_index":80},"api":{"endpoint":"https://api.openai.com/v1/responses","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-5.4"}}},"aggregator_ids":{"openrouter":"openai/gpt-5.4"},"sources":{"pricing":"https://developers.openai.com/api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gpt-5.4-mini","provider":"openai","family":"gpt-5.4","display_name":"GPT-5.4 Mini","description":"Smaller, faster variant of GPT-5.4. Designed for routed production traffic with strong cost-performance.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","limits":{"context_window":400000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":0.75,"cached_input_per_mtok":0.075,"output_per_mtok":4.5,"batch_input_per_mtok":0.375,"batch_output_per_mtok":2.25},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"reasoning":true,"reasoning_modes":["none","low","medium","high"],"vision":true},"performance":{"speed_tps":130,"intelligence_index":70},"api":{"endpoint":"https://api.openai.com/v1/responses","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-5.4-mini"}}},"aggregator_ids":{"openrouter":"openai/gpt-5.4-mini"},"sources":{"pricing":"https://developers.openai.com/api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gpt-5.4-nano","provider":"openai","family":"gpt-5.4","display_name":"GPT-5.4 Nano","description":"Smallest, cheapest GPT-5.4 variant. Optimized for high-throughput, latency-sensitive workloads.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","limits":{"context_window":400000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":0.2,"cached_input_per_mtok":0.02,"output_per_mtok":1.25,"batch_input_per_mtok":0.1,"batch_output_per_mtok":0.625},"capabilities":{"tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"vision":true},"performance":{"speed_tps":200,"intelligence_index":55},"api":{"endpoint":"https://api.openai.com/v1/responses","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-5.4-nano"}}},"aggregator_ids":{"openrouter":"openai/gpt-5.4-nano"},"manual_tags":["cheapest"],"sources":{"pricing":"https://developers.openai.com/api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gpt-5.4-pro","provider":"openai","family":"gpt-5.4","display_name":"GPT-5.4 Pro","description":"Pro-tier reasoning variant of GPT-5.4 with extended thinking. Premium pricing.","type":"reasoning","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","limits":{"context_window":400000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":30,"output_per_mtok":180,"batch_input_per_mtok":15,"batch_output_per_mtok":90},"capabilities":{"tools":true,"structured_output":true,"streaming":true,"batching":true,"system_prompt":true,"reasoning":true,"reasoning_modes":["low","medium","high","xhigh"],"vision":true},"performance":{"intelligence_index":85},"api":{"endpoint":"https://api.openai.com/v1/responses","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-5.4-pro"}}},"aggregator_ids":{"openrouter":"openai/gpt-5.4-pro"},"sources":{"pricing":"https://developers.openai.com/api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gpt-5.3-codex","provider":"openai","family":"gpt-5-codex","display_name":"GPT-5.3 Codex","description":"Coding-specialized variant. Replaces gpt-5-codex (deprecating Jul 23, 2026).","type":"code","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","limits":{"context_window":400000,"max_output":128000},"pricing":{"currency":"USD","input_per_mtok":1.75,"cached_input_per_mtok":0.175,"output_per_mtok":14,"batch_input_per_mtok":0.875,"batch_output_per_mtok":7,"notes":"Fast mode (confirmed on the official pricing page 2026-08-17): $3.50/MTok input, $0.35/MTok cached input, $28.00/MTok output."},"capabilities":{"tools":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"system_prompt":true,"reasoning":true,"code_execution":true},"performance":{"intelligence_index":80},"api":{"endpoint":"https://api.openai.com/v1/responses","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-5.3-codex"}}},"manual_tags":["best_for_coding"],"sources":{"pricing":"https://developers.openai.com/api/docs/pricing"},"last_verified":"2026-08-17"},{"id":"gpt-realtime-2.1","provider":"openai","family":"gpt-realtime","display_name":"GPT Realtime 2.1","description":"Incremental update to GPT Realtime 2 (released July 6, 2026): improved alphanumeric recognition, silence/noise handling, and interruption behavior.","type":"audio_chat","input_modalities":["text","audio","image"],"output_modalities":["text","audio"],"status":"ga","released":"2026-07-06","limits":{"context_window":128000,"max_output":32000},"pricing":{"currency":"USD","input_per_mtok":4,"cached_input_per_mtok":0.4,"output_per_mtok":24,"notes":"Audio: $32.0/MTok input ($0.4 cached), $64.0/MTok output. Image input: $5.0/MTok ($0.5 cached)."},"capabilities":{"tools":true,"streaming":true,"reasoning":true,"reasoning_modes":["minimal","low","medium","high","xhigh"],"reasoning_default":"low","vision":true,"audio_input":true,"audio_output":true},"api":{"endpoint":"https://api.openai.com/v1/realtime","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-realtime-2.1"}}},"sources":{"spec":"https://developers.openai.com/api/docs/models/gpt-realtime-2.1","pricing":"https://developers.openai.com/api/docs/pricing","release_notes":"https://developers.openai.com/api/docs/changelog"},"last_verified":"2026-08-10"},{"id":"gpt-realtime-2.1-mini","provider":"openai","family":"gpt-realtime","display_name":"GPT Realtime 2.1 Mini","description":"Distilled/faster variant of GPT Realtime 2.1, released July 6, 2026.","type":"audio_chat","input_modalities":["text","audio","image"],"output_modalities":["text","audio"],"status":"ga","released":"2026-07-06","limits":{"context_window":128000,"max_output":32000},"pricing":{"currency":"USD","input_per_mtok":0.6,"cached_input_per_mtok":0.06,"output_per_mtok":2.4,"notes":"Audio: $10.0/MTok input ($0.3 cached), $20.0/MTok output. Image input: $0.8/MTok ($0.08 cached)."},"capabilities":{"tools":true,"streaming":true,"reasoning":true,"reasoning_modes":["minimal","low","medium","high","xhigh"],"reasoning_default":"low","vision":true,"audio_input":true,"audio_output":true},"api":{"endpoint":"https://api.openai.com/v1/realtime","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-realtime-2.1-mini"}}},"sources":{"spec":"https://developers.openai.com/api/docs/models/gpt-realtime-2.1-mini","pricing":"https://developers.openai.com/api/docs/pricing","release_notes":"https://developers.openai.com/api/docs/changelog"},"last_verified":"2026-08-10"},{"id":"gpt-realtime-2","provider":"openai","family":"gpt-realtime","display_name":"GPT Realtime 2","description":"Real-time speech-in/speech-out model with reasoning. 128k context (up from 32k in 1.5). Reasoning effort levels: minimal, low, medium, high, xhigh.","type":"audio_chat","input_modalities":["text","audio","image"],"output_modalities":["text","audio"],"status":"ga","released":"2026-04-08","limits":{"context_window":128000,"max_output":32000},"pricing":{"currency":"USD","input_per_mtok":4,"cached_input_per_mtok":0.4,"output_per_mtok":24,"notes":"Audio: $32/MTok input ($0.40 cached), $64/MTok output. Text input: $4/MTok ($0.40 cached), output: $24/MTok."},"capabilities":{"tools":true,"streaming":true,"reasoning":true,"reasoning_modes":["minimal","low","medium","high","xhigh"],"reasoning_default":"low","vision":true,"audio_input":true,"audio_output":true},"api":{"endpoint":"https://api.openai.com/v1/realtime","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-realtime-2"}}},"sources":{"spec":"https://developers.openai.com/api/docs/models/gpt-realtime-2","pricing":"https://developers.openai.com/api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gpt-realtime-1.5","provider":"openai","family":"gpt-realtime","display_name":"GPT Realtime 1.5","description":"Earlier-generation realtime speech model (32k context, predates the 128k-context gpt-realtime-2/2.1 line) with no reasoning support. Still GA and individually documented; it is the official recommended replacement for the retired gpt-4o-realtime-preview snapshot family (May 7, 2026 shutdown). Resolves a standing registry watch item — confirmed via the official pricing page and its own /docs/models page as a real, currently-listed, non-deprecated id, distinct from the also-real but deprecated bare `gpt-realtime`.","type":"audio_chat","input_modalities":["text","audio","image"],"output_modalities":["text","audio"],"status":"ga","limits":{"context_window":32000,"max_output":4096},"pricing":{"currency":"USD","input_per_mtok":4,"cached_input_per_mtok":0.4,"output_per_mtok":16,"notes":"Audio: $32.00/MTok input ($0.40 cached), $64.00/MTok output. Image input: $5.00/MTok ($0.50 cached). Knowledge cutoff Sep 30, 2024. Current pricing is identical to the deprecated bare `gpt-realtime`, but this model has a newer knowledge cutoff and remains GA (not deprecated)."},"capabilities":{"tools":true,"streaming":true,"vision":true,"audio_input":true,"audio_output":true},"api":{"endpoint":"https://api.openai.com/v1/realtime","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-realtime-1.5"}}},"sources":{"spec":"https://developers.openai.com/api/docs/models/gpt-realtime-1.5","pricing":"https://developers.openai.com/api/docs/pricing","release_notes":"https://developers.openai.com/api/docs/deprecations"},"last_verified":"2026-08-17"},{"id":"gpt-realtime-translate","provider":"openai","family":"gpt-realtime","display_name":"GPT Realtime Translate","description":"Speech-to-speech translation model. Per-minute pricing.","type":"audio_chat","input_modalities":["audio"],"output_modalities":["audio"],"status":"ga","pricing":{"currency":"USD","audio_input_per_minute":0.034},"capabilities":{"streaming":true,"audio_input":true,"audio_output":true},"api":{"endpoint":"https://api.openai.com/v1/realtime","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-realtime-translate"}}},"sources":{"pricing":"https://developers.openai.com/api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"gpt-realtime-whisper","provider":"openai","family":"gpt-realtime","display_name":"GPT Realtime Whisper","description":"Streaming speech-to-text model for applications that need low-latency transcript deltas from live audio. Was missing from the registry — added 2026-07-20 during a routine audit. Announced alongside gpt-realtime-2 and gpt-realtime-translate in OpenAI's \"Advancing voice intelligence\" post. Relationship to gpt-live-transcribe clarified 2026-08-17: OpenAI's official migration cookbook (developers.openai.com/cookbook, \"Migrate from Whisper to GPT-Transcribe and GPT-Live-Transcribe\") frames gpt-live-transcribe as the newer recommended default for realtime/streaming transcription, but does not formally deprecate this model — no deprecations-table entry exists for it, so status remains ga. Both stay independently documented and identically priced ($0.017/min); closing the standing watch item on this basis, no status change made.","type":"stt","input_modalities":["audio"],"output_modalities":["text"],"status":"ga","limits":{"context_window":16000,"max_output":2000},"pricing":{"currency":"USD","audio_input_per_minute":0.017},"capabilities":{"streaming":true},"api":{"endpoint":"https://api.openai.com/v1/realtime","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-realtime-whisper"}}},"sources":{"spec":"https://developers.openai.com/api/docs/models/gpt-realtime-whisper","pricing":"https://developers.openai.com/api/docs/pricing","release_notes":"https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/","docs":"https://developers.openai.com/cookbook/examples/migrating_from_whisper_to_gpt_transcribe"},"last_verified":"2026-08-17"},{"id":"gpt-audio-1.5","provider":"openai","family":"gpt-audio","display_name":"GPT Audio 1.5","description":"Current GA flagship of OpenAI's Chat-Completions-based audio-in/audio-out family — a separate API surface from the Realtime-API gpt-realtime line (same tagline pattern: \"the best voice model for audio in, audio out\", but \"with Chat Completions\"). Recommended replacement for gpt-audio, gpt-audio-mini, gpt-4o-audio, gpt-4o-mini-audio, and the legacy gpt-4o-audio-preview/gpt-4o-mini-audio-preview snapshots. This entire gpt-audio family was previously untracked in the registry — added this pass after being found on the official deprecations table alongside the gpt-realtime family gap.","type":"audio_chat","input_modalities":["text","audio"],"output_modalities":["text","audio"],"status":"ga","limits":{"context_window":128000,"max_output":16384},"pricing":{"currency":"USD","input_per_mtok":2.5,"output_per_mtok":10,"notes":"Audio: $32.00/MTok input, $64.00/MTok output (no cached-input discount on this family — cached-input columns are '-' on the official pricing page). Knowledge cutoff Sep 30, 2024. Uses the Chat Completions API endpoint, not the Realtime API."},"capabilities":{"tools":true,"streaming":true,"audio_input":true,"audio_output":true},"api":{"endpoint":"https://api.openai.com/v1/chat/completions","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-audio-1.5"}}},"sources":{"spec":"https://developers.openai.com/api/docs/models/gpt-audio-1.5","pricing":"https://developers.openai.com/api/docs/pricing","release_notes":"https://developers.openai.com/api/docs/deprecations"},"last_verified":"2026-08-17"},{"id":"gpt-transcribe","provider":"openai","family":"gpt-transcribe","display_name":"GPT Transcribe","description":"High-accuracy speech-to-text model for file uploads and Realtime transcription sessions. Supports free-form context and keyword hints for multi-language transcription. Launched 2026-07-28.","type":"stt","input_modalities":["audio"],"output_modalities":["text"],"status":"ga","released":"2026-07-28","pricing":{"currency":"USD","audio_input_per_minute":0.0045},"capabilities":{"streaming":true},"api":{"endpoint":"https://api.openai.com/v1/audio/transcriptions","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-transcribe"}}},"sources":{"spec":"https://developers.openai.com/api/docs/models/gpt-transcribe","pricing":"https://developers.openai.com/api/docs/pricing","release_notes":"https://developers.openai.com/api/docs/changelog"},"last_verified":"2026-08-10"},{"id":"gpt-live-transcribe","provider":"openai","family":"gpt-transcribe","display_name":"GPT Live Transcribe","description":"Low-latency speech-to-text model for realtime transcription sessions only (not available on the batch transcription endpoint). Tunable latency, supports keyword hints. Launched 2026-07-28 alongside gpt-transcribe. Relationship to gpt-realtime-whisper clarified 2026-08-17: OpenAI's official migration cookbook positions gpt-live-transcribe as the newer recommended default for realtime/streaming transcription (the streaming counterpart to gpt-transcribe replacing whisper-1 for file transcription), but gpt-realtime-whisper is not formally deprecated (absent from the deprecations table) and both remain identically priced ($0.017/min) and independently GA. Closing the standing 'relationship unclear' watch item; no status change made to either model.","type":"stt","input_modalities":["audio"],"output_modalities":["text"],"status":"ga","released":"2026-07-28","pricing":{"currency":"USD","audio_input_per_minute":0.017},"capabilities":{"streaming":true},"api":{"endpoint":"https://api.openai.com/v1/realtime","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-live-transcribe"}}},"sources":{"spec":"https://developers.openai.com/api/docs/models/gpt-live-transcribe","pricing":"https://developers.openai.com/api/docs/pricing","release_notes":"https://developers.openai.com/api/docs/changelog","docs":"https://developers.openai.com/cookbook/examples/migrating_from_whisper_to_gpt_transcribe"},"last_verified":"2026-08-17"},{"id":"gpt-image-2","provider":"openai","family":"gpt-image","display_name":"GPT Image 2","description":"Latest OpenAI image generation model. Supports inpainting, image-to-image, and instruction-following at the prompt level.","type":"image_generation","input_modalities":["text","image"],"output_modalities":["image"],"status":"ga","limits":{"supported_resolutions":["1024x1024","1024x1536","1536x1024","2048x2048"]},"pricing":{"currency":"USD","input_per_mtok":5,"batch_input_per_mtok":2.5,"notes":"Text input: $5/MTok ($2.50 batch). Image input: $8/MTok ($2 cached; $4/$1 cached batch). Image output: $30/MTok ($15 batch). Per-image effective: ~$0.011-$0.211 depending on quality and resolution."},"capabilities":{"negative_prompt":false,"image_to_image":true,"inpainting":true},"api":{"endpoint":"https://api.openai.com/v1/images/generations","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-image-2"}}},"sources":{"pricing":"https://developers.openai.com/api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"text-embedding-3-large","provider":"openai","family":"embedding-3","display_name":"Text Embedding 3 Large","description":"High-quality embeddings, up to 3072 dimensions, supports Matryoshka truncation.","type":"embedding","input_modalities":["text"],"output_modalities":["embedding"],"status":"ga","released":"2024-01-25","limits":{"max_input_tokens":8191,"max_dimensions":3072,"matryoshka_dimensions":[256,1024,3072]},"pricing":{"currency":"USD","input_per_mtok":0.13,"batch_input_per_mtok":0.065},"capabilities":{"batching":true},"performance":{"benchmarks":{"mteb":64.6}},"api":{"endpoint":"https://api.openai.com/v1/embeddings","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"text-embedding-3-large"}}},"aggregator_ids":{"openrouter":"openai/text-embedding-3-large"},"manual_tags":["smartest_embedding"],"sources":{"pricing":"https://developers.openai.com/api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"text-embedding-3-small","provider":"openai","family":"embedding-3","display_name":"Text Embedding 3 Small","description":"Cost-efficient embeddings. 1536 dims by default, supports Matryoshka truncation.","type":"embedding","input_modalities":["text"],"output_modalities":["embedding"],"status":"ga","released":"2024-01-25","limits":{"max_input_tokens":8191,"max_dimensions":1536,"matryoshka_dimensions":[512,1536]},"pricing":{"currency":"USD","input_per_mtok":0.02,"batch_input_per_mtok":0.01},"capabilities":{"batching":true},"performance":{"benchmarks":{"mteb":62.3}},"api":{"endpoint":"https://api.openai.com/v1/embeddings","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"text-embedding-3-small"}}},"aggregator_ids":{"openrouter":"openai/text-embedding-3-small"},"manual_tags":["cheapest_embedding"],"sources":{"pricing":"https://developers.openai.com/api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"text-embedding-ada-002","provider":"openai","family":"embedding-ada","display_name":"Text Embedding Ada 002","description":"Legacy embedding model. Still available; superseded by text-embedding-3 family.","type":"embedding","input_modalities":["text"],"output_modalities":["embedding"],"status":"ga","limits":{"max_input_tokens":8191,"max_dimensions":1536},"pricing":{"currency":"USD","input_per_mtok":0.1,"batch_input_per_mtok":0.05},"capabilities":{"batching":true},"performance":{"benchmarks":{"mteb":60.99}},"api":{"endpoint":"https://api.openai.com/v1/embeddings","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"text-embedding-ada-002"}}},"sources":{"pricing":"https://developers.openai.com/api/docs/pricing"},"last_verified":"2026-08-10"},{"id":"whisper-1","provider":"openai","family":"whisper","display_name":"Whisper","description":"Speech-to-text. Multilingual transcription and translation.","type":"stt","input_modalities":["audio"],"output_modalities":["text"],"status":"ga","limits":{"max_audio_size_mb":25,"supported_audio_formats":["mp3","mp4","mpeg","mpga","m4a","wav","webm"],"supported_languages":["multilingual"]},"pricing":{"currency":"USD","audio_input_per_minute":0.006},"capabilities":{"word_timestamps":true},"api":{"endpoint":"https://api.openai.com/v1/audio/transcriptions","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"whisper-1"}}},"manual_tags":["cheapest_stt"],"last_verified":"2026-08-10"},{"id":"gpt-4o-transcribe","provider":"openai","family":"gpt-4o-audio","display_name":"GPT-4o Transcribe","description":"Higher-quality transcription with GPT-4o backbone.","type":"stt","input_modalities":["audio"],"output_modalities":["text"],"status":"ga","pricing":{"currency":"USD","input_per_mtok":2.5,"output_per_mtok":10,"audio_input_per_minute":0.006},"capabilities":{"streaming":true,"word_timestamps":true},"api":{"endpoint":"https://api.openai.com/v1/audio/transcriptions","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-4o-transcribe"}}},"last_verified":"2026-08-10"},{"id":"gpt-4o-mini-transcribe","provider":"openai","family":"gpt-4o-audio","display_name":"GPT-4o Mini Transcribe","description":"Cheaper transcription using GPT-4o mini.","type":"stt","input_modalities":["audio"],"output_modalities":["text"],"status":"ga","pricing":{"currency":"USD","input_per_mtok":1.25,"output_per_mtok":5,"audio_input_per_minute":0.003},"capabilities":{"streaming":true},"api":{"endpoint":"https://api.openai.com/v1/audio/transcriptions","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-4o-mini-transcribe"}}},"last_verified":"2026-08-10"},{"id":"gpt-4o-mini-tts","provider":"openai","family":"tts","display_name":"GPT-4o Mini TTS","description":"Text-to-speech with GPT-4o-mini backbone. Corrected 2026-07-27: previously marked deprecated with sunset 2026-07-23, but the official deprecations table's shutdown row only names the dated snapshot gpt-4o-mini-tts-2025-03-20 (replaced by gpt-4o-mini-tts-2025-12-15) -- never the bare id. The bare id's own docs page is live with no shutdown banner and now defaults to the 2025-12-15 snapshot as the current, generally-available model. The prior deprecated/sunset data on the bare id appears to have been an entry error conflating it with the retired 2025-03-20 snapshot; flipped back to ga.","type":"tts","input_modalities":["text"],"output_modalities":["audio"],"status":"ga","limits":{"max_input_tokens":2000,"supported_voices":["alloy","ash","ballad","coral","echo","fable","onyx","nova","sage","shimmer","verse"]},"pricing":{"currency":"USD","input_per_mtok":0.6,"output_per_mtok":12,"notes":"Corrected 2026-07-27: model is token-based ($0.60/MTok text input, $12.00/MTok audio output) per its official model page, not per-character as previously recorded here."},"capabilities":{"streaming":true,"speed_control":true},"api":{"endpoint":"https://api.openai.com/v1/audio/speech","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-4o-mini-tts"}}},"sources":{"spec":"https://developers.openai.com/api/docs/deprecations","pricing":"https://developers.openai.com/api/docs/models/gpt-4o-mini-tts"},"last_verified":"2026-08-10"},{"id":"tts-1-hd","provider":"openai","family":"tts-1","display_name":"TTS-1 HD","description":"Legacy high-quality TTS. Available; superseded by gpt-4o TTS family.","type":"tts","input_modalities":["text"],"output_modalities":["audio"],"status":"ga","limits":{"supported_audio_formats":["mp3","opus","aac","flac","wav","pcm"],"supported_voices":["alloy","echo","fable","onyx","nova","shimmer"],"max_input_chars":4096},"pricing":{"currency":"USD","per_million_characters":30},"capabilities":{"streaming":true,"speed_control":true},"api":{"endpoint":"https://api.openai.com/v1/audio/speech","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"tts-1-hd"}}},"last_verified":"2026-08-10"},{"id":"tts-1","provider":"openai","family":"tts-1","display_name":"TTS-1","description":"Legacy TTS. Available; superseded by gpt-4o TTS family.","type":"tts","input_modalities":["text"],"output_modalities":["audio"],"status":"ga","limits":{"supported_audio_formats":["mp3","opus","aac","flac","wav","pcm"],"supported_voices":["alloy","echo","fable","onyx","nova","shimmer"],"max_input_chars":4096},"pricing":{"currency":"USD","per_million_characters":15},"capabilities":{"streaming":true,"speed_control":true},"api":{"endpoint":"https://api.openai.com/v1/audio/speech","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"tts-1"}}},"manual_tags":["cheapest_tts"],"last_verified":"2026-08-10"},{"id":"omni-moderation-latest","provider":"openai","family":"moderation","display_name":"Omni Moderation","description":"Free multimodal moderation for OpenAI API users. Detects harmful content across text and images.","type":"moderation","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","pricing":{"currency":"USD","input_per_mtok":0,"notes":"Free for OpenAI API users."},"capabilities":{"vision":true},"api":{"endpoint":"https://api.openai.com/v1/moderations","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"omni-moderation-latest"}}},"last_verified":"2026-08-10"},{"id":"gpt-4.1","provider":"openai","family":"gpt-4.1","display_name":"GPT-4.1","description":"Cost-effective production model. Still GA; recommended replacement for legacy gpt-4 / gpt-4-turbo (which retire Oct 23, 2026).","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2025-04-14","limits":{"context_window":1000000,"max_output":32768},"pricing":{"currency":"USD","input_per_mtok":2,"cached_input_per_mtok":0.5,"output_per_mtok":8,"batch_input_per_mtok":1,"batch_output_per_mtok":4},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"vision":true},"performance":{"intelligence_index":60},"api":{"endpoint":"https://api.openai.com/v1/chat/completions","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-4.1"}}},"aggregator_ids":{"openrouter":"openai/gpt-4.1"},"last_verified":"2026-08-10"},{"id":"gpt-4.1-mini","provider":"openai","family":"gpt-4.1","display_name":"GPT-4.1 Mini","description":"Smaller GPT-4.1 variant. Recommended replacement for gpt-3.5-turbo and gpt-4o-search-preview.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2025-04-14","limits":{"context_window":1000000,"max_output":32768},"pricing":{"currency":"USD","input_per_mtok":0.4,"cached_input_per_mtok":0.1,"output_per_mtok":1.6,"batch_input_per_mtok":0.2,"batch_output_per_mtok":0.8},"capabilities":{"tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"vision":true},"api":{"endpoint":"https://api.openai.com/v1/chat/completions","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-4.1-mini"}}},"aggregator_ids":{"openrouter":"openai/gpt-4.1-mini"},"last_verified":"2026-08-10"},{"id":"gpt-4o","provider":"openai","family":"gpt-4o","display_name":"GPT-4o","description":"Multimodal model from 2024. Retired from ChatGPT Feb 13, 2026. Still in API but specific snapshots are deprecated.","type":"chat","input_modalities":["text","image","audio"],"output_modalities":["text"],"status":"ga","released":"2024-05-13","limits":{"context_window":128000,"max_output":16384},"pricing":{"currency":"USD","input_per_mtok":2.5,"cached_input_per_mtok":1.25,"output_per_mtok":10,"batch_input_per_mtok":1.25,"batch_output_per_mtok":5},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"vision":true,"audio_input":true},"api":{"endpoint":"https://api.openai.com/v1/chat/completions","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-4o"}}},"aggregator_ids":{"openrouter":"openai/gpt-4o"},"last_verified":"2026-08-10"},{"id":"gpt-4o-mini","provider":"openai","family":"gpt-4o","display_name":"GPT-4o Mini","description":"Smaller, cheaper GPT-4o. Still GA in API.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2024-07-18","limits":{"context_window":128000,"max_output":16384},"pricing":{"currency":"USD","input_per_mtok":0.15,"cached_input_per_mtok":0.075,"output_per_mtok":0.6,"batch_input_per_mtok":0.075,"batch_output_per_mtok":0.3},"capabilities":{"tools":true,"json_mode":true,"structured_output":true,"streaming":true,"batching":true,"prompt_caching":true,"vision":true},"api":{"endpoint":"https://api.openai.com/v1/chat/completions","protocol":"openai","openai_compatible":true,"auth":{"type":"bearer","env_var":"OPENAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"gpt-4o-mini"}}},"aggregator_ids":{"openrouter":"openai/gpt-4o-mini"},"last_verified":"2026-08-10"},{"id":"grok-4.6","provider":"xai","family":"grok-4.6","display_name":"Grok 4.6","description":"xAI's flagship model, GA August 12, 2026 (per docs.x.ai/developers/grok-4-6 and x.ai/news/grok-4-6). Builds on Grok 4.5 with extended agentic RL training for long-running agents and coding; the announcement explicitly does not deprecate or replace Grok 4.5. 500k context, text output has no stated max-token cap. Reasoning effort configurable (low/medium/high/xhigh, default high) — xhigh is new for this release. Also supports X search in addition to web search and code execution. Knowledge cutoff February 1, 2026. Available via the API, Grok Build, Cursor, GitHub Copilot (as of Aug 14), and third-party gateways (OpenRouter, Vercel, Cloudflare). Long-context tier (>200k tokens) uses higher pricing.","type":"reasoning","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-08-12","limits":{"context_window":500000},"pricing":{"currency":"USD","input_per_mtok":2,"cached_input_per_mtok":0.5,"output_per_mtok":6,"notes":"Long-context tier (>200k tokens): $4.00/MTok input, $1.00/MTok cached input, $12.00/MTok output — requests whose prompt reaches the 200k-token threshold are billed at the higher rate for the entire request. Confirmed on docs.x.ai/developers/pricing and cross-checked against docs.x.ai/developers/grok-4-6 and OpenRouter's x-ai/grok-4.6 listing on 2026-08-17 (all three agree)."},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"system_prompt":true,"reasoning":true,"reasoning_modes":["low","medium","high","xhigh"],"reasoning_default":"high","vision":true,"web_search":true,"code_execution":true},"api":{"endpoint":"https://api.x.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"grok-4.6"},"vercel-ai":{"package":"@ai-sdk/xai","model_id":"grok-4.6","factory":"xai('grok-4.6')"}},"supported_params":["max_tokens","temperature","top_p","stop","tools","tool_choice","response_format","stream"]},"aggregator_ids":{"openrouter":"x-ai/grok-4.6"},"sources":{"spec":"https://docs.x.ai/developers/models/grok-4.6","pricing":"https://docs.x.ai/developers/pricing","release_notes":"https://x.ai/news/grok-4-6"},"last_verified":"2026-08-17"},{"id":"grok-4.5","provider":"xai","family":"grok-4.5","display_name":"Grok 4.5","description":"xAI's model, GA July 8, 2026 (aliases: grok-4.5-latest, grok-build-latest). 500k context, configurable reasoning effort (low/medium/high, default high). Long-context tier (>200k tokens) uses higher pricing.","type":"reasoning","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-07-08","limits":{"context_window":500000},"pricing":{"currency":"USD","input_per_mtok":2,"cached_input_per_mtok":0.3,"output_per_mtok":6,"notes":"Long-context tier (>200k tokens): $4.00/MTok input, $0.60/MTok cached input, $12.00/MTok output. As of 2026-08-03, docs.x.ai/developers/release-notes (July 2026) states Grok 4.5 is now available in the API console for EU users, but the model spec page still lists inference regions as us-east-1/us-west-2 only (no EU inference region) — treat as partial/console-level EU availability, not a new EU data region, pending clarification. Pricing re-confirmed exact-match on 2026-08-10 against the live pricing config embedded in docs.x.ai/developers/pricing (promptTextTokenPrice/completionTextTokenPrice/cachedPromptTokenPrice raw values). Re-confirmed unchanged again on 2026-08-17 following Grok 4.6's Aug 12 GA launch — xAI's announcement explicitly frames 4.6 as building on 4.5 rather than replacing it, and Grok 4.5 remains listed and priced identically on the live catalog."},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"system_prompt":true,"reasoning":true,"reasoning_modes":["low","medium","high"],"reasoning_default":"high","vision":true,"web_search":true,"code_execution":true},"api":{"endpoint":"https://api.x.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"grok-4.5"},"vercel-ai":{"package":"@ai-sdk/xai","model_id":"grok-4.5","factory":"xai('grok-4.5')"}},"supported_params":["max_tokens","temperature","top_p","stop","tools","tool_choice","response_format","stream"]},"sources":{"spec":"https://docs.x.ai/developers/models/grok-4.5","pricing":"https://docs.x.ai/developers/pricing","release_notes":"https://docs.x.ai/developers/release-notes"},"last_verified":"2026-08-17"},{"id":"grok-4.20-0309-reasoning","provider":"xai","family":"grok-4.20","display_name":"Grok 4.20 (Reasoning)","description":"Multi-agent reasoning model released March 10, 2026. Built-in 4-agent system (Grok captain, Harper research, Benjamin logic, etc.) for complex tasks. 1M context, text/image input (docs.x.ai does not list video as a supported input modality).","type":"reasoning","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-03-10","limits":{"context_window":1000000,"max_output":32768},"pricing":{"currency":"USD","input_per_mtok":1.25,"cached_input_per_mtok":0.2,"output_per_mtok":2.5,"notes":"Long-context tier (≥200k tokens): $2.50/MTok input, $0.40/MTok cached input, $5.00/MTok output."},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"system_prompt":true,"reasoning":true,"reasoning_modes":["off","on"],"vision":true,"web_search":true,"code_execution":true},"performance":{"intelligence_index":80,"benchmarks":{"mmlu_pro":80,"gpqa":75}},"api":{"endpoint":"https://api.x.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"grok-4.20-0309-reasoning","factory":"openai({ baseURL: 'https://api.x.ai/v1' })"},"vercel-ai":{"package":"@ai-sdk/xai","model_id":"grok-4.20-0309-reasoning","factory":"xai('grok-4.20-0309-reasoning')"}},"supported_params":["max_tokens","temperature","top_p","stop","tools","tool_choice","response_format","stream"]},"aggregator_ids":{"openrouter":"x-ai/grok-4.20"},"manual_tags":["smartest"],"sources":{"spec":"https://docs.x.ai/developers/models/grok-4.20-0309-reasoning","pricing":"https://docs.x.ai/developers/pricing","release_notes":"https://x.ai/news"},"last_verified":"2026-08-17"},{"id":"grok-4.20-0309-non-reasoning","provider":"xai","family":"grok-4.20","display_name":"Grok 4.20 (Non-Reasoning)","description":"Non-reasoning variant of Grok 4.20 for latency-sensitive use cases. 1M context.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-03-10","limits":{"context_window":1000000,"max_output":32768},"pricing":{"currency":"USD","input_per_mtok":1.25,"cached_input_per_mtok":0.2,"output_per_mtok":2.5,"notes":"Long-context tier (≥200k tokens): $2.50/MTok input, $0.40/MTok cached input, $5.00/MTok output."},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"system_prompt":true,"vision":true,"web_search":true},"performance":{"speed_tps":100,"intelligence_index":70},"api":{"endpoint":"https://api.x.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"grok-4.20-0309-non-reasoning"}}},"aggregator_ids":{"openrouter":"x-ai/grok-4.20-non-reasoning"},"sources":{"spec":"https://docs.x.ai/developers/models/grok-4.20-0309-non-reasoning","pricing":"https://docs.x.ai/developers/pricing"},"last_verified":"2026-08-17"},{"id":"grok-4.20-multi-agent-0309","provider":"xai","family":"grok-4.20","display_name":"Grok 4.20 Multi-Agent","description":"Explicit multi-agent variant of Grok 4.20. Coordinates 4 specialized agents in parallel. 1M context.","type":"reasoning","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","released":"2026-03-10","limits":{"context_window":1000000,"max_output":32768},"pricing":{"currency":"USD","input_per_mtok":1.25,"cached_input_per_mtok":0.2,"output_per_mtok":2.5,"notes":"Long-context tier (≥200k tokens): $2.50/MTok input, $0.40/MTok cached input, $5.00/MTok output."},"capabilities":{"tools":true,"parallel_tools":true,"structured_output":true,"streaming":true,"system_prompt":true,"reasoning":true,"vision":true,"web_search":true,"code_execution":true},"performance":{"intelligence_index":82},"api":{"endpoint":"https://api.x.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"grok-4.20-multi-agent-0309"}}},"aggregator_ids":{"openrouter":"x-ai/grok-4.20-multi-agent"},"sources":{"spec":"https://docs.x.ai/developers/models","pricing":"https://docs.x.ai/developers/pricing"},"last_verified":"2026-08-17"},{"id":"grok-build-0.1","provider":"xai","family":"grok-build","display_name":"Grok Build 0.1","description":"xAI's development-focused model. 256k context, optimized for building and iterative coding tasks at lower cost.","type":"chat","input_modalities":["text"],"output_modalities":["text"],"status":"ga","limits":{"context_window":256000,"max_output":16384},"pricing":{"currency":"USD","input_per_mtok":1,"cached_input_per_mtok":0.2,"output_per_mtok":2,"notes":"Long-context tier (≥200k tokens): $2.00/MTok input, $0.40/MTok cached input, $4.00/MTok output."},"capabilities":{"tools":true,"json_mode":true,"structured_output":true,"streaming":true,"system_prompt":true},"api":{"endpoint":"https://api.x.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"grok-build-0.1"}}},"sources":{"spec":"https://docs.x.ai/developers/models/grok-build-0.1","pricing":"https://docs.x.ai/developers/pricing"},"last_verified":"2026-08-17"},{"id":"grok-4.3","provider":"xai","family":"grok-4.3","display_name":"Grok 4.3","description":"Chat and coding model. 1M context. Strong general purpose model from xAI.","type":"chat","input_modalities":["text","image"],"output_modalities":["text"],"status":"ga","limits":{"context_window":1000000,"max_output":16384},"pricing":{"currency":"USD","input_per_mtok":1.25,"cached_input_per_mtok":0.2,"output_per_mtok":2.5,"notes":"Long-context tier (≥200k tokens): $2.50/MTok input, $0.40/MTok cached input, $5.00/MTok output."},"capabilities":{"tools":true,"parallel_tools":true,"json_mode":true,"structured_output":true,"streaming":true,"system_prompt":true,"vision":true,"web_search":true},"performance":{"speed_tps":90,"intelligence_index":72},"api":{"endpoint":"https://api.x.ai/v1/chat/completions","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"grok-4.3"}}},"aggregator_ids":{"openrouter":"x-ai/grok-4.3"},"sources":{"spec":"https://docs.x.ai/developers/models/grok-4.3","pricing":"https://docs.x.ai/developers/pricing"},"last_verified":"2026-08-17"},{"id":"grok-imagine-image-pro","provider":"xai","family":"grok-imagine","display_name":"Grok Imagine Image Pro","description":"Reactivated July 2026 as an alias id for grok-imagine-image-quality (the original standalone \"Pro\" tier model under this id was retired May 15, 2026; xAI has since reused this id as an alias pointing at the quality tier). Reconfirmed 2026-08-17: fetching docs.x.ai/developers/models/grok-imagine-image-pro serves the grok-imagine-image-quality page content directly, and that page's own alias list explicitly names both grok-imagine-image-quality-latest and grok-imagine-image-pro — alias relationship unchanged despite grok-imagine-image-pro no longer appearing as its own row on the pricing page table.","type":"image_generation","input_modalities":["text"],"output_modalities":["image"],"status":"ga","replacement_id":"grok-imagine-image-quality","limits":{"supported_aspect_ratios":["1:1","16:9","9:16","4:3","3:4"]},"pricing":{"currency":"USD","image_tiers":[{"label":"1K","resolution":"1024x1024","per_image":0.05},{"label":"2K","resolution":"2048x2048","per_image":0.07}],"notes":"Input image: $0.01/image. Alias of grok-imagine-image-quality — see that entry for the canonical id. Confirmed via raw pricing config on docs.x.ai/developers/pricing (2026-08-10): 'grok-imagine-image-pro' is listed as an alias of the 'grok-imagine-image-quality' model entry (1K=$0.05, 2K=$0.07, input image=$0.01) — pricing unchanged."},"api":{"endpoint":"https://api.x.ai/v1/images/generations","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"grok-imagine-image-pro"}}},"sources":{"spec":"https://docs.x.ai/developers/models"},"last_verified":"2026-08-17"},{"id":"grok-imagine-image","provider":"xai","family":"grok-imagine","display_name":"Grok Imagine Image","description":"xAI image generation model.","type":"image_generation","input_modalities":["text","image"],"output_modalities":["image"],"status":"ga","limits":{"supported_resolutions":["1024x1024","2048x2048"]},"pricing":{"currency":"USD","image_tiers":[{"label":"1K","resolution":"1024x1024","per_image":0.02},{"label":"2K","resolution":"2048x2048","per_image":0.02}],"notes":"Input image: $0.002/image."},"capabilities":{"image_to_image":true},"api":{"endpoint":"https://api.x.ai/v1/images/generations","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"grok-imagine-image"}}},"sources":{"spec":"https://docs.x.ai/developers/pricing"},"last_verified":"2026-08-17"},{"id":"grok-imagine-image-quality","provider":"xai","family":"grok-imagine","display_name":"Grok Imagine Image Quality","description":"xAI image generation model. Higher-quality tier (aliased as grok-imagine-image-pro and grok-imagine-image-quality-latest per docs.x.ai's own alias list). Note: as of 2026-08-17 docs.x.ai/developers/pricing's table only shows a single flat '$0.05/image' row for this model (no 2K line item), but third-party aggregator listings (e.g. OpenRouter's separate grok-imagine-image-pro entry) still describe it as \"priced from $0.05\" with a $0.07 tier for the pro/2K variant, consistent with the 1K/2K split kept below — treated as the pricing page's summarized table omitting a tier rather than a real cut, pending a clearer source.","type":"image_generation","input_modalities":["text","image"],"output_modalities":["image"],"status":"ga","limits":{"supported_resolutions":["1024x1024","2048x2048"]},"pricing":{"currency":"USD","image_tiers":[{"label":"1K","resolution":"1024x1024","per_image":0.05},{"label":"2K","resolution":"2048x2048","per_image":0.07}],"notes":"Input image: $0.01/image."},"capabilities":{"image_to_image":true},"api":{"endpoint":"https://api.x.ai/v1/images/generations","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"grok-imagine-image-quality"}}},"sources":{"spec":"https://docs.x.ai/developers/pricing"},"last_verified":"2026-08-17"},{"id":"grok-imagine-image-2.0","provider":"xai","family":"grok-imagine","display_name":"Grok Imagine Image 2.0","description":"xAI's newest image generation/editing model, GA August 7, 2026 (per x.ai/news/grok-imagine-image-2 and docs.x.ai/developers/models/grok-imagine-image-2.0) — a pre-existing registry gap discovered this pass, live since launch. xAI's own announcement reports it ranking #2 on the Arena text-to-image and image-edit leaderboards at launch (behind OpenAI's gpt-image-2). Multi-reference editing accepts up to 5 input images in a single generation (magic-wand region editing, segmentation-based selection, background removal). docs.x.ai lists only a single flat per-image rate for this model, unlike grok-imagine-image-quality's documented 1K/2K split — no separate input-image surcharge or resolution tier is documented for this id as of 2026-08-17.","type":"image_generation","input_modalities":["text","image"],"output_modalities":["image"],"status":"ga","released":"2026-08-07","pricing":{"currency":"USD","image_tiers":[{"label":"standard","per_image":0.04}],"notes":"Confirmed on docs.x.ai/developers/models/grok-imagine-image-2.0 and docs.x.ai/developers/pricing (2026-08-17): flat $0.04/image. No resolution tiers or input-image cost documented for this id."},"capabilities":{"image_to_image":true},"api":{"endpoint":"https://api.x.ai/v1/images/generations","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"grok-imagine-image-2.0"}}},"sources":{"spec":"https://docs.x.ai/developers/models/grok-imagine-image-2.0","pricing":"https://docs.x.ai/developers/pricing","release_notes":"https://x.ai/news/grok-imagine-image-2"},"last_verified":"2026-08-17"},{"id":"grok-imagine-video","provider":"xai","family":"grok-imagine","display_name":"Grok Imagine Video","description":"xAI video generation model. 720p output. Released January 28, 2026.","type":"video_generation","input_modalities":["text","image"],"output_modalities":["video"],"status":"ga","released":"2026-01-28","limits":{"max_video_resolution":"720p"},"pricing":{"currency":"USD","video_per_second":0.05,"notes":"$0.050/sec at 480p, $0.070/sec at 720p (max resolution)."},"capabilities":{"image_to_image":true},"api":{"endpoint":"https://api.x.ai/v1/videos/generations","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"grok-imagine-video"}}},"sources":{"spec":"https://docs.x.ai/developers/models"},"last_verified":"2026-08-17"},{"id":"grok-imagine-video-1.5","provider":"xai","family":"grok-imagine","display_name":"Grok Imagine Video 1.5","description":"xAI's enhanced video generation model. Includes native audio. GA June 16, 2026. Updated July 31, 2026 (x.ai/news/grok-imagine-video-1-5-references, same model id — no new id issued): added image and voice references for character/scene consistency, text-to-video generation without a starting image, and native 1080p output (already reflected in max_video_resolution below). Per the announcement, image references/text-to-video/1080p are live via the API; voice references are 'available on request'. No pricing change.","type":"video_generation","input_modalities":["text","image"],"output_modalities":["video"],"status":"ga","released":"2026-06-16","limits":{"max_video_resolution":"1080p"},"pricing":{"currency":"USD","video_per_second":0.08,"notes":"$0.080/sec at 480p, $0.250/sec at 1080p (max resolution, audio included)."},"capabilities":{"audio_output":true,"image_to_image":true},"api":{"endpoint":"https://api.x.ai/v1/videos/generations","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"},"sdks":{"openai":{"package":"openai","model_id":"grok-imagine-video-1.5"}}},"sources":{"spec":"https://docs.x.ai/developers/models"},"last_verified":"2026-08-17"},{"id":"grok-voice-think-fast-2.0","provider":"xai","family":"grok-voice","display_name":"Grok Voice Think Fast 2.0","description":"Realtime speech-to-speech model with tool calling (web search, X search, file search, MCP, custom functions), session resumption, and 5 built-in cloneable voices (Eve, Ara, Rex, Sal, Leo). Auto-detects 20+ languages. Successor to grok-voice-think-fast-1.0. The grok-voice-latest alias was scheduled to repoint from 1.0 to this model on 2026-08-05; as of 2026-08-10 the raw routing config embedded in docs.x.ai/developers/pricing lists 'grok-voice-latest' as an alias of grok-voice-think-fast-2.0 (not 1.0), confirming the switch has taken effect — note the human-readable prose on docs.x.ai/developers/model-capabilities/audio/speech-to-speech still read 'grok-voice-latest currently points to grok-voice-think-fast-1.0' at last fetch, which looks like stale/un-updated copy on that page; the machine-readable pricing config is treated as authoritative here. Release date (2026-07-29) is corroborated by secondary sources (release-notes page placement, press coverage) since the primary x.ai/news announcement page returned HTTP 403 on direct fetch — re-verify against that page if precision matters.","type":"audio_chat","input_modalities":["text","audio"],"output_modalities":["text","audio"],"status":"ga","released":"2026-07-29","pricing":{"currency":"USD","notes":"$0.08/min audio (input/output not separately broken out by xAI), plus $0.004 per text input. Predecessor grok-voice-think-fast-1.0 is $0.05/min audio + $0.004/text input. Cached conversation history expires after 30 min inactivity when using session resumption."},"capabilities":{"tools":true,"streaming":true,"audio_input":true,"audio_output":true,"voice_cloning":true},"api":{"endpoint":"https://api.x.ai/v1/realtime","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"}},"sources":{"spec":"https://docs.x.ai/developers/model-capabilities/audio/speech-to-speech","pricing":"https://docs.x.ai/developers/pricing","release_notes":"https://docs.x.ai/developers/release-notes"},"last_verified":"2026-08-17"},{"id":"grok-voice-think-fast-1.0","provider":"xai","family":"grok-voice","display_name":"Grok Voice Think Fast 1.0","description":"Realtime speech-to-speech model, predecessor to grok-voice-think-fast-2.0. Was missing from the registry entirely until the 2026-08-03 pass despite being an existing shipped model. The grok-voice-latest alias previously pointed here; as of 2026-08-10 the raw routing config on docs.x.ai/developers/pricing shows the 'grok-voice-latest' alias now attached to grok-voice-think-fast-2.0 instead, consistent with the scheduled 2026-08-05 repoint having taken effect. This model (versioned id) remains directly callable and GA; it is simply no longer the 'latest' alias target.","type":"audio_chat","input_modalities":["text","audio"],"output_modalities":["text","audio"],"status":"ga","replacement_id":"grok-voice-think-fast-2.0","pricing":{"currency":"USD","notes":"$0.05/min audio (input/output not separately broken out by xAI), plus $0.004 per text input."},"capabilities":{"tools":true,"streaming":true,"audio_input":true,"audio_output":true},"api":{"endpoint":"https://api.x.ai/v1/realtime","protocol":"openai_compat","openai_compatible":true,"auth":{"type":"bearer","env_var":"XAI_API_KEY"}},"sources":{"spec":"https://docs.x.ai/developers/model-capabilities/audio/speech-to-speech","pricing":"https://docs.x.ai/developers/pricing"},"last_verified":"2026-08-17"},{"id":"grok-tts","provider":"xai","family":"grok-voice","display_name":"Grok TTS","description":"Standalone text-to-speech API, built on the same stack as Grok Voice. Launched April 18, 2026 per xAI/press coverage. 5 built-in voices (Eve default, Ara, Rex, Sal, Leo) plus custom voice cloning, 20 languages (BCP-47), character-level timestamps, inline speech tags (e.g. [laugh], [sigh], <whisper>), 0.7x-1.5x speed control, and configurable output codec/sample rate (default MP3 24kHz/128kbps). Discovered during the 2026-08-10 research pass as a pre-existing registry gap — the model has been live since April 2026, this is not a change from the prior week; flagging in case the omission was intentional.","type":"tts","input_modalities":["text"],"output_modalities":["audio"],"status":"ga","released":"2026-04-18","limits":{"supported_voices":["eve","ara","rex","sal","leo"],"max_input_chars":15000},"pricing":{"currency":"USD","per_million_characters":15,"notes":"Confirmed directly on docs.x.ai/developers/pricing (2026-08-10): 'Text to Speech | $15.00 / 1M chars', cross-checked against the page's embedded pricing config (perCharacter raw value 150000, consistent with the site's 1e10 fixed-point scale used elsewhere on the page). Note: third-party April 2026 launch coverage (e.g. MarkTechPost, KuCoin) cited an introductory ~$4.20/M characters rate — price appears to have risen since launch (or the early figure was promotional); the current live docs.x.ai number is used here."},"capabilities":{"streaming":true,"voice_cloning":true,"speed_control":true,"word_timestamps":true},"api":{"endpoint":"https://api.x.ai/v1/tts","protocol":"rest","openai_compatible":false,"auth":{"type":"bearer","env_var":"XAI_API_KEY"}},"sources":{"spec":"https://docs.x.ai/developers/model-capabilities/audio/text-to-speech","pricing":"https://docs.x.ai/developers/pricing","release_notes":"https://x.ai/news/grok-stt-and-tts-apis"},"last_verified":"2026-08-17"},{"id":"grok-stt","provider":"xai","family":"grok-voice","display_name":"Grok STT","description":"Standalone speech-to-text API, built on the same stack as Grok Voice. Launched April 18, 2026 per xAI/press coverage. 25+ language support, word-level timestamps, speaker diarization, multichannel audio, and inverse text normalization; batch (REST) and realtime streaming modes. Accepts WAV, MP3, OGG, Opus, FLAC, AAC, MP4, M4A, MKV (container) and PCM, mu-law, A-law (raw) formats, up to 500MB per request. Discovered during the 2026-08-10 research pass as a pre-existing registry gap — the model has been live since April 2026, this is not a change from the prior week; flagging in case the omission was intentional.","type":"stt","input_modalities":["audio"],"output_modalities":["text"],"status":"ga","released":"2026-04-18","limits":{"max_audio_size_mb":500,"supported_audio_formats":["wav","mp3","ogg","opus","flac","aac","mp4","m4a","mkv","pcm","mu-law","a-law"]},"pricing":{"currency":"USD","audio_input_per_minute":0.001667,"notes":"Confirmed directly on docs.x.ai/developers/pricing (2026-08-10): '$0.10 / hr (REST), $0.20 / hr (Streaming)'. audio_input_per_minute above reflects the batch/REST rate ($0.10/hr = $0.001667/min); the realtime streaming rate is roughly double, $0.20/hr ($0.003333/min) — schema has no separate streaming-rate field, noted here instead."},"capabilities":{"streaming":true,"audio_input":true,"word_timestamps":true,"speaker_diarization":true},"api":{"endpoint":"https://api.x.ai/v1/stt","protocol":"rest","openai_compatible":false,"auth":{"type":"bearer","env_var":"XAI_API_KEY"}},"sources":{"spec":"https://docs.x.ai/developers/model-capabilities/audio/speech-to-text","pricing":"https://docs.x.ai/developers/pricing","release_notes":"https://x.ai/news/grok-stt-and-tts-apis"},"last_verified":"2026-08-17"}],"total":122,"scope":{}},"meta":{"version":"181@2026-08-17","as_of":"2026-08-17T04:57:01.172Z","request_id":"9b1cb176b9d5752c"},"errors":[]}