AI3 минAI-автоматизацияВебIT-аутсорс

DeepSeek-R1: что Китай на самом деле изменил в гонке reasoning-моделей

Не повторяем миф про «всю модель за $5,6 млн». Разбираем проверяемую часть: обучение с подкреплением, проверяемые награды, distillation и дешёвые специализированные модели.

13 июня 2026 г.·Команда Alixio·Strategy · Tech · AI
Все статьи →
AISEO + база знаний
Разбор по делу
AI
Ключевые выводы
Главный вклад R1 — демонстрация того, как reasoning-поведение усиливается через RL с проверяемыми наградами и затем переносится в меньшие модели.
Популярная цифра $5,6 млн относилась к заявленной финальной тренировке DeepSeek-V3, а не ко всей стоимости создания R1 и лаборатории.
Бизнесу важнее не владеть самым большим model checkpoint, а маршрутизировать задачи, измерять качество и использовать меньшую модель там, где она достаточна.

Сначала уберём красивую легенду

В январе 2025 года DeepSeek-R1 вызвала две разные реакции: исследователи обсуждали обучение reasoning, а рынок — будто бы «модель уровня лидеров сделали за $5,6 млн». Вторая формулировка удобна, но неверна. Эта сумма происходила из оценки вычислений финального обучения базовой DeepSeek-V3 и не включала предыдущие эксперименты, данные, зарплаты, инфраструктуру и создание R1.

Преуменьшать работу не нужно. Настоящий результат интереснее дешёвого заголовка.

R1-Zero: дать модели задачу и проверяемую награду

DeepSeek-R1-Zero обучали крупномасштабным reinforcement learning без предварительного supervised fine-tuning на готовых цепочках рассуждения. Для математики и кода ответ часто можно проверить автоматически: число совпало, тесты прошли, формат соблюдён. Такая награда позволяла модели находить более длинные стратегии, перепроверять себя и менять подход.

В статье команда описывает появление reasoning-паттернов в ходе RL. Это не значит, что модель научилась мыслить как человек. Это значит, что оптимизация поведения по проверяемому результату дала сильный скачок на соответствующих бенчмарках.

Почему чистого RL оказалось недостаточно

У R1-Zero были проблемы с читаемостью, смешением языков и стабильностью. Финальная R1 использовала многоэтапный процесс: небольшой cold start на качественных примерах, RL, сбор успешных решений, supervised fine-tuning и дополнительное обучение для полезности и безопасности.

Урок прозаичный: впечатляющий исследовательский механизм не отменяет уборку данных, редактуру и контроль поведения. Production-модель — это pipeline, а не один трюк.

Distillation меняет практическую экономику

Команда перенесла паттерны большой R1 в шесть меньших dense-моделей размером от 1,5 до 70 млрд параметров на базе Qwen и Llama. Такие модели проще запускать локально или в частном контуре, хотя качество и требования к железу сильно зависят от размера и задачи.

Для бизнеса это важнее соревнования флагманов. Можно использовать сильную модель как учителя, собрать набор решений для узкого домена и обучить меньшую — при наличии прав на данные и outputs. Затем дешёвая модель обрабатывает основной поток, а сложные случаи уходят наверх.

Reasoning надо включать по необходимости

Длинное рассуждение увеличивает задержку и стоимость. Классифицировать обращение, найти статью по embedding или проверить формат ИНН лучше без него. План миграции, сложное сравнение договоров или диагностика могут выиграть от большего test-time compute.

Хороший AI-router оценивает тип задачи, риск и доступный бюджет. Самая дорогая модель не должна автоматически отвечать на «где мой заказ».

Открытые веса не равны полной прозрачности

Публикация весов и статьи даёт возможность проверять, дообучать и разворачивать модель самостоятельно. Но исходный датасет, все этапы экспериментов и инфраструктура не становятся полностью воспроизводимыми. Также открытость не отменяет цензурные ограничения, bias и риски вредных ответов.

Перед внедрением нужна своя оценка на русском языке, своих документах и своих отказах. Бенчмарк по математике не измеряет корректность юридического ответа клиенту.

Что применить в компании

Соберите набор из 100–300 реальных задач с эталоном. Разделите их на простые, сложные и рискованные. Сравните обычную и reasoning-модель по качеству, цене и задержке. Для проверяемых задач добавьте автоматический verifier. Логику маршрутизации держите отдельно от провайдера.

DeepSeek-R1 изменила разговор не обещанием дешёвой магии. Она показала, что сильное reasoning-поведение можно обучать и переносить более инженерно, чем казалось. Побеждает не тот, кто всегда вызывает самый большой интеллект, а тот, кто точно знает, сколько интеллекта нужно каждой операции.

Вопросы по теме

DeepSeek-R1 стоила $5,6 млн?
Так говорить некорректно. Широко разошедшаяся цифра относилась к оценке вычислений финального training run базовой V3 и не включала исследования, эксперименты, данные, инфраструктуру и последующую разработку R1.
Что открыла DeepSeek?
Команда опубликовала статью, веса R1/R1-Zero и шесть дистиллированных моделей на базе Qwen и Llama. Условия лицензий и пригодность для конкретного продукта всё равно нужно проверять отдельно.
Нужна ли reasoning-модель для обычного чат-бота?
Часто нет. FAQ, поиск статуса и классификация дешевле и быстрее решаются обычной моделью или кодом. Reasoning полезен для сложного планирования, анализа и задач с проверяемым ответом.
§ 08Оценить проект
Расскажите, что строите

Яшка — AI-консультант Alixio. Он назовёт вилку цены и срока сразу. Подойдёт — команда вернётся с уточнениями и планом запуска в тот же день.

NDA до деталей·Порог проектов от 150 000 ₽·Работаем удалённо по России