Сначала уберём красивую легенду
В январе 2025 года DeepSeek-R1 вызвала две разные реакции: исследователи обсуждали обучение reasoning, а рынок — будто бы «модель уровня лидеров сделали за $5,6 млн». Вторая формулировка удобна, но неверна. Эта сумма происходила из оценки вычислений финального обучения базовой DeepSeek-V3 и не включала предыдущие эксперименты, данные, зарплаты, инфраструктуру и создание R1.
Преуменьшать работу не нужно. Настоящий результат интереснее дешёвого заголовка.
R1-Zero: дать модели задачу и проверяемую награду
DeepSeek-R1-Zero обучали крупномасштабным reinforcement learning без предварительного supervised fine-tuning на готовых цепочках рассуждения. Для математики и кода ответ часто можно проверить автоматически: число совпало, тесты прошли, формат соблюдён. Такая награда позволяла модели находить более длинные стратегии, перепроверять себя и менять подход.
В статье команда описывает появление reasoning-паттернов в ходе RL. Это не значит, что модель научилась мыслить как человек. Это значит, что оптимизация поведения по проверяемому результату дала сильный скачок на соответствующих бенчмарках.
Почему чистого RL оказалось недостаточно
У R1-Zero были проблемы с читаемостью, смешением языков и стабильностью. Финальная R1 использовала многоэтапный процесс: небольшой cold start на качественных примерах, RL, сбор успешных решений, supervised fine-tuning и дополнительное обучение для полезности и безопасности.
Урок прозаичный: впечатляющий исследовательский механизм не отменяет уборку данных, редактуру и контроль поведения. Production-модель — это pipeline, а не один трюк.
Distillation меняет практическую экономику
Команда перенесла паттерны большой R1 в шесть меньших dense-моделей размером от 1,5 до 70 млрд параметров на базе Qwen и Llama. Такие модели проще запускать локально или в частном контуре, хотя качество и требования к железу сильно зависят от размера и задачи.
Для бизнеса это важнее соревнования флагманов. Можно использовать сильную модель как учителя, собрать набор решений для узкого домена и обучить меньшую — при наличии прав на данные и outputs. Затем дешёвая модель обрабатывает основной поток, а сложные случаи уходят наверх.
Reasoning надо включать по необходимости
Длинное рассуждение увеличивает задержку и стоимость. Классифицировать обращение, найти статью по embedding или проверить формат ИНН лучше без него. План миграции, сложное сравнение договоров или диагностика могут выиграть от большего test-time compute.
Хороший AI-router оценивает тип задачи, риск и доступный бюджет. Самая дорогая модель не должна автоматически отвечать на «где мой заказ».
Открытые веса не равны полной прозрачности
Публикация весов и статьи даёт возможность проверять, дообучать и разворачивать модель самостоятельно. Но исходный датасет, все этапы экспериментов и инфраструктура не становятся полностью воспроизводимыми. Также открытость не отменяет цензурные ограничения, bias и риски вредных ответов.
Перед внедрением нужна своя оценка на русском языке, своих документах и своих отказах. Бенчмарк по математике не измеряет корректность юридического ответа клиенту.
Что применить в компании
Соберите набор из 100–300 реальных задач с эталоном. Разделите их на простые, сложные и рискованные. Сравните обычную и reasoning-модель по качеству, цене и задержке. Для проверяемых задач добавьте автоматический verifier. Логику маршрутизации держите отдельно от провайдера.
DeepSeek-R1 изменила разговор не обещанием дешёвой магии. Она показала, что сильное reasoning-поведение можно обучать и переносить более инженерно, чем казалось. Побеждает не тот, кто всегда вызывает самый большой интеллект, а тот, кто точно знает, сколько интеллекта нужно каждой операции.