A Mixture-of-Experts model that activates only 3.3B of its 30.5B parameters per forward pass. Offers dual thinking modes: a detailed step-by-step reasoning mode for complex problems and a faster non-thinking mode for simpler queries. Despite its small active parameter count, it outperforms QwQ-32B that has 10 times more activated parameters.
Qwen/Qwen3-30B-A3BApr 28, 20252.8s latency