Сравнение языковых моделей
Сравните LLM-модели по открытым бенчмаркам, техническим параметрам и применимости к бизнес-сценариям. Подробную информацию о модели можно увидеть, нажав на её наименование.
Квантование определяет, с какой точностью хранятся веса модели.
Память. Меняет объём под веса: 2 байта на параметр в BF16, 1 в FP8, около 0,6 в INT4. Чем ниже точность, тем меньше карт нужно. На A100 и A6000 FP8 только экономит память, без ускорения.
Качество. FP8 обычно почти без потерь. INT4 заметнее сказывается на малых моделях и сложных задачах, проверяйте на своих данных.
«Любое». Для каждой модели берётся режим с самой дешёвой конфигурацией, а при равной цене самый точный. Выбранный режим подписан в столбце «Память».
Форматы весов. Не каждая модель выложена во всех форматах: DeepSeek V4 есть только в FP8, gpt-oss и Kimi только в четырёх битах. Более грубый формат из более точного получить можно, обратно нельзя. Если весов в выбранном формате нет, в строке так и написано, а «любое» выбирает только из существующих.
Что не меняет. KV-кэш в расчёте всегда считается в FP16, а оценки качества в таблице получены на исходной точности вендора.