- vendor
- Cerebras Systems
- whatItIs
- Wafer-scale CS-3 silicon delivering 1,000-2,100 tok/sec on Llama 3.1 70B; 20-25x faster than GPU competitors.
- hosting
- managed-only
- pricingModel
- freemium + Developer $10/mo + Enterprise custom
- modelProviders
- open-weight (Llama 4, Qwen 3.x, Mistral, DeepSeek, Kimi K2.x)
- stateModel
- stateless
- toolModel
- OpenAI-compatible API
- includesBrowser
- false
- includesMemory
- false
- longRunning
- per-request
- hitlSupport
- false
- observability
- rate limits + priority queue tracking
- maturity
- ga
- launched
- 2023 (inference)
- notes
- $10B OpenAI inference deal announced 2026-Q1. Public rates $0.35-$0.75/1M; available via OpenRouter, AWS Marketplace, Vercel.