На основе https://arxiv.org/abs/2501.12948
25 января 2025 года
Исследователи представили свои модели первого поколения, DeepSeek-R1-Zero и DeepSeek-R1. DeepSeek-R1-Zero, модель, обученная с использованием крупномасштабного обучения с подкреплением (RL) без предварительного этапа контролируемого дообучения (SFT), демонстрирует выдающиеся способности к рассуждению. Благодаря обучению с подкреплением, DeepSeek-R1-Zero естественным образом развивает множество мощных и интересных поведенческих моделей рассуждения. Однако она сталкивается с такими проблемами, как плохая читаемость и смешение языков. Для решения этих проблем и дальнейшего улучшения производительности рассуждений исследователи представили DeepSeek-R1, которая включает многоэтапное обучение и данные холодного старта перед RL. DeepSeek-R1 достигает производительности, сравнимой с OpenAI-o1-1217, на задачах рассуждения. В поддержку исследовательского сообщества, DeepSeek-R1-Zero, DeepSeek-R1 и шесть плотных моделей (1.5B, 7B, 8B, 14B, 32B, 70B), дистиллированных из DeepSeek-R1 на основе Qwen и Llama, были открыты для публичного доступа.

Рис.1. Benchmark performance of DeepSeek-R1
В последние годы большие языковые модели (LLMs) быстро развиваются и совершенствуются (OpenAI, 2024a; Anthropic, 2024; Google, 2024), постепенно сокращая разрыв на пути к созданию искусственного общего интеллекта (AGI).
Недавно пост-обучение стало важным компонентом полного цикла обучения. Оно показало свою эффективность в повышении точности выполнения задач, связанных с рассуждением, согласовании с социальными ценностями и адаптации к предпочтениям пользователей, при этом требуя относительно небольших вычислительных ресурсов по сравнению с предварительным обучением. В контексте способностей к рассуждению, модели серии o1 от OpenAI (OpenAI, 2024b) первыми представили масштабирование на этапе вывода за счёт увеличения длины процесса цепочки рассуждений. Этот подход достиг значительных улучшений в различных задачах, связанных с рассуждением, таких как математика, программирование и научные рассуждения. Однако проблема эффективного масштабирования на этапе тестирования остаётся открытым вопросом для исследовательского сообщества. Несколько предыдущих работ исследовали различные подходы, включая модели вознаграждения на основе процессов (Uesato et al., 2022; Lightman et al., 2023; Wang et al., 2023), обучение с подкреплением (Kumar et al., 2024) и алгоритмы поиска, такие как Monte Carlo Tree Search и Beam Search (Feng et al., 2024; Xin et al., 2024; Trinh et al., 2024). Однако ни один из этих методов не достиг общей производительности рассуждений, сравнимой с моделями серии o1 от OpenAI.
В данной работе исследователи делают первый шаг к улучшению способностей языковых моделей к рассуждению с использованием чистого обучения с подкреплением (RL). Их цель заключается в исследовании потенциала LLMs развивать способности к рассуждению без каких-либо контролируемых данных, сосредоточившись на их самоэволюции через процесс чистого RL. В частности, они используют DeepSeek-V3-Base в качестве базовой модели и применяют GRPO (Shao et al., 2024) в качестве фреймворка RL для улучшения производительности модели в рассуждениях. В ходе обучения DeepSeek-R1-Zero естественным образом развивает множество мощных и интересных поведенческих моделей рассуждения. После тысяч шагов RL DeepSeek-R1-Zero демонстрирует превосходную производительность на тестах по рассуждению. Например, показатель pass@1 на AIME 2024 увеличивается с 15.6% до 71.0%, а при использовании голосования по большинству он улучшается до 86.7%, сравниваясь с производительностью OpenAI-o1-0912.
Однако DeepSeek-R1-Zero сталкивается с проблемами, такими как плохая читаемость и смешение языков. Для решения этих проблем и дальнейшего улучшения производительности рассуждений исследователи представили DeepSeek-R1, которая включает небольшое количество данных холодного старта и многоэтапный процесс обучения. В частности, они начинают со сбора тысяч данных холодного старта для дообучения базовой модели DeepSeek-V3. После этого они проводят RL, ориентированное на рассуждения, аналогично DeepSeek-R1-Zero. Приближаясь к сходимости в процессе RL, они создают новые данные SFT через отбор отказов на контрольной точке RL, комбинируя с контролируемыми данными из DeepSeek-V3 в таких областях, как написание текстов, фактические вопросы и ответы, и самопознание, а затем переобучают базовую модель DeepSeek-V3. После дообучения с новыми данными контрольная точка проходит дополнительный процесс RL, учитывая подсказки из всех сценариев. После этих шагов они получили контрольную точку, известную как DeepSeek-R1, которая достигает производительности на уровне OpenAI-o1-1217.
Исследователи также изучили дистилляцию из DeepSeek-R1 в более мелкие плотные модели. Используя Qwen2.5-32B (Qwen, 2024b) в качестве базовой модели, прямая дистилляция из DeepSeek-R1 превосходит применение RL на ней. Это демонстрирует, что модели рассуждений, обнаруженные более крупными базовыми моделями, имеют решающее значение для улучшения способностей к рассуждению. Они открыли исходный код дистиллированных серий Qwen и Llama (Dubey et al., 2024). Примечательно, что их дистиллированная модель 14B значительно превосходит лучшую на сегодняшний день открытую модель QwQ-32B-Preview (Qwen, 2024a), а дистиллированные модели 32B и 70B устанавливают новый рекорд на тестах по рассуждению среди плотных моделей.
Исследователи применили обучение с подкреплением (RL) непосредственно к базовой модели, не полагаясь на контролируемое дообучение (SFT) в качестве предварительного этапа. Такой подход позволяет модели исследовать цепочку рассуждений (CoT) для решения сложных задач, что привело к созданию DeepSeek-R1-Zero. DeepSeek-R1-Zero демонстрирует такие способности, как самопроверка, рефлексия и генерация длинных цепочек рассуждений, что является значительным достижением для исследовательского сообщества. Важно отметить, что это первое открытое исследование, подтверждающее, что способности к рассуждению у больших языковых моделей могут быть стимулированы исключительно через RL, без необходимости в SFT. Этот прорыв открывает путь для будущих достижений в данной области.
Исследователи представили свой конвейер для разработки DeepSeek-R1. Конвейер включает два этапа RL, направленных на улучшение паттернов рассуждения и согласование с предпочтениями человека, а также два этапа SFT, которые служат основой для рассуждающих и нерассуждающих способностей модели. Они считают, что этот конвейер принесет пользу индустрии, способствуя созданию более совершенных моделей.
Исследователи продемонстрировали, что паттерны рассуждения больших моделей могут быть дистиллированы в меньшие модели, что приводит к лучшей производительности по сравнению с паттернами рассуждения, обнаруженными через RL на малых моделях. Открытый исходный код DeepSeek-R1, а также его API, будут полезны исследовательскому сообществу для дистилляции более совершенных малых моделей в будущем.
Используя данные о рассуждениях, сгенерированные DeepSeek-R1, исследователи доработали несколько плотных моделей, широко используемых в исследовательском сообществе. Результаты оценки показывают, что дистиллированные меньшие плотные модели демонстрируют исключительно высокую производительность на тестах. DeepSeek-R1-Distill-Qwen-7B достигает 55.5% на AIME 2024, превосходя QwQ-32B-Preview. Кроме того, DeepSeek-R1-Distill-Qwen-32B набирает 72.6% на AIME 2024, 94.3% на MATH-500 и 57.2% на LiveCodeBench. Эти результаты значительно превосходят предыдущие модели с открытым исходным кодом и сопоставимы с o1-mini. Исследователи открыли исходный код дистиллированных контрольных точек 1.5B, 7B, 8B, 14B, 32B и 70B на основе серий Qwen2.5 и Llama3 для сообщества.
Задачи, связанные с рассуждением:
Знания: На тестах, таких как MMLU, MMLU-Pro и GPQA Diamond, DeepSeek-R1 достигает выдающихся результатов, значительно превосходя DeepSeek-V3 с показателями 90.8% на MMLU, 84.0% на MMLU-Pro и 71.5% на GPQA Diamond. Хотя её производительность немного уступает OpenAI-o1-1217 на этих тестах, DeepSeek-R1 превосходит другие модели с закрытым исходным кодом, демонстрируя своё конкурентное преимущество в образовательных задачах. На фактическом тесте SimpleQA, DeepSeek-R1 превосходит DeepSeek-V3, демонстрируя свою способность обрабатывать запросы, основанные на фактах. Аналогичная тенденция наблюдается, когда OpenAI-o1 превосходит 4o на этом тесте.
Прочие задачи: DeepSeek-R1 также преуспевает в широком спектре задач, включая творческое письмо, ответы на общие вопросы, редактирование, суммирование и другие. Модель достигает впечатляющего показателя побед с контролем длины 87.6% на AlpacaEval 2.0 и показателя побед 92.3% на ArenaHard, демонстрируя свою сильную способность интеллектуально обрабатывать запросы, не связанные с экзаменами. Кроме того, DeepSeek-R1 демонстрирует выдающуюся производительность в задачах, требующих понимания длинного контекста, значительно превосходя DeepSeek-V3 на тестах с длинным контекстом.
Предыдущие работы в значительной степени полагались на большие объемы контролируемых данных для улучшения производительности моделей. В данном исследовании ученые демонстрируют, что способности к рассуждению могут быть значительно улучшены с помощью крупномасштабного обучения с подкреплением (RL), даже без использования контролируемого дообучения (SFT) в качестве начального этапа. Более того, производительность может быть дополнительно улучшена с включением небольшого количества начальных данных. В следующих разделах представлены: (1) DeepSeek-R1-Zero, которая применяет RL непосредственно к базовой модели без каких-либо данных SFT, и (2) DeepSeek-R1, которая применяет RL, начиная с контрольной точки, доработанной с использованием тысяч длинных примеров цепочки рассуждений (CoT). (3) Дистилляция способностей к рассуждению из DeepSeek-R1 в малые плотные модели.
Обучение с подкреплением продемонстрировало значительную эффективность в задачах рассуждения, что подтверждается предыдущими работами ученых (Wang et al., 2023; Shao et al., 2024). Однако эти работы в значительной степени зависели от контролируемых данных, сбор которых требует много времени. В этом разделе исследователи исследуют потенциал больших языковых моделей (LLMs) развивать способности к рассуждению без каких-либо контролируемых данных, сосредоточившись на их самоэволюции через процесс чистого обучения с подкреплением. Они начинают с краткого обзора своего алгоритма RL, за которым следует представление некоторых захватывающих результатов, и надеются, что это предоставит сообществу ценные идеи.
Для экономии затрат на обучение с подкреплением исследователи используют метод групповой относительной оптимизации политики (GRPO) (Shao et al., 2024), который отказывается от использования модели критика, обычно имеющей тот же размер, что и модель политики, и оценивает базовый уровень на основе групповых оценок. Конкретно, для каждого вопроса \(q\), GRPO выбирает группу ответов \(\{o_1, o_2, \ldots, o_G\}\) из старой политики \(\pi_{\theta_{\text{old}}}\) и затем оптимизирует модель политики \(\pi_{\theta}\), максимизируя следующий целевой функционал:
\[ \mathcal{J}_{\text{GRPO}}(\theta) = \mathbb{E} \left[ q \sim P(Q), \{o_i\}_{i=1}^G \sim \pi_{\theta_{\text{old}}}(O|q) \right] \frac{1}{G} \sum_{i=1}^G \left( \min \left( \frac{\pi_{\theta}(o_i|q)}{\pi_{\theta_{\text{old}}}(o_i|q)} A_i, \text{clip} \left( \frac{\pi_{\theta}(o_i|q)}{\pi_{\theta_{\text{old}}}(o_i|q)}, 1 - \epsilon, 1 + \epsilon \right) A_i \right) - \beta \mathcal{D}_{\text{KL}}(\pi_{\theta} \| \pi_{\text{ref}}) \right),\]
где расстояние Кульбака-Лейблера \(\mathcal{D}_{\text{KL}}\) определяется как:
\[ \mathbb{D}_{\mathrm{KL}}(\pi_\theta \parallel \pi_{\mathrm{ref}}) = \frac{\pi_{\mathrm{ref}}(o_i | q)}{\pi_\theta(o_i | q)} - \log \left( \frac{\pi_{\mathrm{ref}}(o_i | q)}{\pi_\theta(o_i | q)} \right) - 1\]
где \(\epsilon\) и \(\beta\) являются гиперпараметрами, а \(A_i\) — это преимущество, вычисляемое с использованием группы вознаграждений \(\{r_1, r_2, \ldots, r_G\}\), соответствующих ответам в каждой группе:
\[ A_i = \frac{r_i - \text{mean}(\{r_1, r_2, \ldots, r_G\})}{\text{std}(\{r_1, r_2, \ldots, r_G\})}.\]
A conversation between User and Assistant. The user asks a question, and the Assistant solves it.
The assistant first thinks about the reasoning process in the mind and then provides the user
with the answer. The reasoning process and answer are enclosed within <think> </think> and
<answer> </answer> tags, respectively, i.e., <think> reasoning process here </think>
<answer> answer here </answer>. User: #prompt#. Assistant:
Во время обучения #prompt# заменяется на конкретный вопрос, связанный с рассуждением.
Награда выступает источником обучающего сигнала, который определяет направление оптимизации в процессе обучения с подкреплением. Для обучения модели DeepSeek-R1-Zero используется система наград на основе правил, включающая два основных типа:
Награды за точность: Модель точности оценивает корректность ответа. Например, в случае математических задач с детерминированным решением модель должна представить окончательный ответ в заранее заданном формате (например, внутри специального поля), что позволяет автоматически проверять его правильность. Аналогично, для задач LeetCode можно использовать компилятор, который предоставляет обратную связь на основе заранее заданных тестовых случаев.
Награды за формат: Помимо оценки точности, применяется модель наград за формат, которая требует от модели вывода мыслительного процесса между тегами «
В ходе разработки DeepSeek-R1-Zero не используются нейросетевые модели наград, поскольку было замечено, что они могут быть уязвимы к явлению "reward hacking" (поиску способов максимизировать награду нечестным образом) при масштабном обучении с подкреплением. Кроме того, переобучение модели наград требует дополнительных вычислительных ресурсов и усложняет общую систему обучения.
Для обучения модели DeepSeek-R1-Zero исследователи разработали простой шаблон, который направляет базовую модель на выполнение заданных инструкций. Как показано в Таблице 1, этот шаблон предписывает модели сначала представить процесс рассуждений, а затем — окончательный ответ. Ограничения носят исключительно структурный характер: никакие конкретные стратегии решения задач или особенности содержания (например, обязательное использование рефлексивного подхода к решению) не навязываются. Это позволяет сохранить естественную динамику развития модели в процессе обучения с подкреплением и более точно наблюдать за её эволюцией.
| Model | AIME 2024 | MATH-500 | GPQA | LiveCode | CodeForces Diamond Bench (pass@1) | rating |
|---|---|---|---|---|---|---|
| OpenAI-o1-mini | 63.6 | 80.0 | 90.0 | 60.0 | 53.8 | 1820 |
| OpenAI-o1-0912 | 74.4 | 83.3 | 94.8 | 77.3 | 63.4 | 1843 |
| DeepSeek-R1-Zero | 71.0 | 86.7 | 95.9 | 73.3 | 50.0 | 1444 |
Таблица 1. Сравнение моделей DeepSeek-R1-Zero и OpenAI o1 на тестах, связанных с рассуждениями.

Рис.2. Точность AIME DeepSeek-R1-Zero во время обучения. Для каждого вопроса выбирается 16 ответов и вычисляем общую среднюю точность, чтобы обеспечить стабильную оценку.
На рисунке 2 показана динамика изменения результатов модели DeepSeek-R1-Zero на тесте AIME 2024 в процессе обучения с подкреплением. Как видно из графика, по мере продвижения обучения модель демонстрирует устойчивый рост производительности. Особенно заметно увеличение среднего значения метрики pass@1 — она вырастает с начальных 15,6% до впечатляющих 71,0%, что выводит модель на уровень, сравнимый с OpenAI-o1-0912. Это значительное улучшение демонстрирует высокую эффективность используемого алгоритма обучения с подкреплением.
В таблице 1 представлено сравнение характеристик DeepSeek-R1-Zero и модели OpenAI o1-0912 на различных задачах, связанных с логическими рассуждениями. Выяснилось, что обучение с подкреплением позволяет DeepSeek-R1-Zero достичь высокого уровня рассуждающей способности без использования каких-либо данных для тонкой настройки в режиме учителя. Этот результат важен сам по себе, поскольку он показывает, что модель может эффективно учиться и обобщать информацию исключительно за счёт RL. Более того, эффективность модели можно дополнительно повысить с помощью метода большинства голосов (majority voting). Например, при его применении на тесте AIME результаты DeepSeek-R1-Zero возрастают с 71,0% до 86,7%, превосходя таким образом показатель OpenAI-o1-0912. Способность модели достигать таких высоких результатов как без дополнительных методов, так и с их использованием подчёркивает её сильную архитектурную основу и потенциал для дальнейшего развития в области решения задач на рассуждение.

Рис.3. Средняя длина ответа DeepSeek-R1-Zero на обучающем наборе во время процесса RL. DeepSeek-R1-Zero естественным образом учится решать задачи на рассуждение, тратя больше времени на обдумывание.
Процесс самоэволюции модели DeepSeek-R1-Zero демонстрирует, как обучение с подкреплением (RL) может способствовать автономному улучшению способностей к логическим рассуждениям. Исследователи начали RL непосредственно с базовой модели, без предварительной дообучения на размеченных данных, чтобы исключить влияние этого этапа и более точно отслеживать естественное развитие модели. Такой подход позволил получить чёткое представление о том, как модель совершенствуется со временем, особенно в решении сложных логических задач.
Как показано на рисунке 3, время, затрачиваемое моделью на размышления, стабильно увеличивается в ходе обучения. Это улучшение является результатом внутренних изменений в модели, а не внешних корректировок. В процессе эволюции DeepSeek-R1-Zero постепенно развивает способность решать всё более сложные задачи за счёт увеличения вычислительных ресурсов на этапе тестирования (те увеличения длины генерации на инференсе). Объём рассуждений, генерируемых моделью, вырастает от сотен до тысяч токенов, что позволяет ей глубже исследовать и уточнять свои логические цепочки.
Одним из наиболее примечательных явлений, возникших в ходе самоэволюции, стало появление сложных поведенческих паттернов при увеличении вычислительных мощностей на этапе тестирования. Например, модель самостоятельно начинает перепроверять и переоценивать свои предыдущие шаги (рефлексия), а также пробовать различные подходы к решению задач. Эти стратегии не были заложены в модель искусственно — они сформировались спонтанно в результате взаимодействия с окружением обучения с подкреплением. Такая самопроизвольная адаптация значительно усиливает способности модели к логическому мышлению, позволяя ей эффективнее и точнее справляться с трудными задачами.
Одним из особенно интересных явлений, наблюдавшихся в ходе обучения модели DeepSeek-R1-Zero, стало появление так называемого «момента озарения» (Aha Moment). Этот феномен был зафиксирован на этапе промежуточной версии модели и продемонстрирован в таблице 2. В этот момент модель начинает выделять больше времени на решение задачи, пересматривая свой первоначальный подход. Такое поведение не только свидетельствует о росте её способностей к логическим рассуждениям, но и наглядно показывает, как обучение с подкреплением может приводить к неожиданным и сложным результатам.
Question: If a>1, then the sum of the real solutions of a−a+x=x is equal to
Response: <think>
To solve the equation a−a+x=x, let’s start by squaring both ⋯
(a−a+x)2=x2⟹a−a+x=x2.
Rearrange to isolate the inner square root term:
(a−x2)2=a+x⟹a2−2ax2+(x2)2=a+x⟹x4−2ax2−x+(a2−a)=0
…
Wait, wait. Wait. That’s an aha moment I can flag here.
Let’s reevaluate this step-by-step to identify if the correct sum can be ⋯
We started with the equation:
a−a+x=x
First, let’s square both sides:
a−a+x=x2⟹a+x=a−x2
Next, I could square both sides again, treating the equation: ⋯
…
Таблица 2. Aha Moment
Этот момент стал настоящим открытием не только для самой модели, но и для исследователей, следивших за её развитием. Он демонстрирует силу и элегантность метода обучения с подкреплением: вместо того чтобы заранее задавать стратегию решения задач, учёные просто создали правильные условия и стимулы, после чего модель самостоятельно разработала эффективные подходы к решению проблем. «Момент озарения» напоминает о громадном потенциале RL в раскрытии новых уровней интеллекта в искусственных системах и открывает путь к созданию более автономных и адаптивных моделей в будущем.
Недостатки DeepSeek-R1-Zero
Несмотря на то, что DeepSeek-R1-Zero обладает сильными способностями к логическим рассуждениям и формирует неожиданно эффективные и сложные стратегии самостоятельно, у модели имеются некоторые недостатки. Среди них — проблемы с читаемостью вывода и смешение языков в ответах. Для улучшения понятности рассуждений и возможности делиться ими с научным сообществом, исследователи обратились к методу DeepSeek-R1, который использует обучение с подкреплением совместно с данными холодного старта, ориентированными на восприятие человеком.
Вдохновлённые успешными результатами модели DeepSeek-R1-Zero, исследователи задались двумя естественными вопросами:
Для ответа на эти вопросы была разработана четырёхэтапная методика обучения модели DeepSeek-R1. Основные этапы приведены ниже.
В отличие от DeepSeek-R1-Zero, где обучение начинается с нуля, в случае DeepSeek-R1 исследователи решили использовать небольшой набор данных с длинными цепочками рассуждений, чтобы дообучить исходную модель перед началом RL-обучения. Это помогло избежать нестабильности на ранних этапах обучения с подкреплением. Для сбора таких данных было опробовано несколько подходов:
В рамках проекта было собрано несколько тысяч примеров холодного старта, которые использовались для дообучения модели DeepSeek-V3-Base — она стала отправной точкой для дальнейшего RL-обучения. По сравнению с