A 24B parameter model optimized for speed and efficiency while rivaling models 3x its size like Llama 3.3 70B. Achieves 81% accuracy on MMLU benchmarks with impressive 150 tokens/second throughput on consumer hardware. Released under Apache 2.0 license, it serves as an excellent base for developing advanced reasoning capabilities.
mistralai/Mistral-Small-24B-Instruct-2501Jan 30, 20253.2s latency