DeepSeek-R1
DeepSeek-R1是幻方量化旗下AI公司深度求索(DeepSeek)发布的推理模型1。该模型在后训练阶段大规模使用了强化学习技术,在仅有极少标注数据的情况下,极大提升了模型推理能力,其在数学、代码、自然语言推理等任务上性能比肩OpenAI o1正式版2,并采用MIT许可协议,支持免费商用、任意修改和衍生开发等3。
2024年11月20日,DeepSeek-R1-Lite预览版正式上线4。2025年1月20日,深度求索(DeepSeek)正式发布DeepSeek-R1,并同步开源模型权重1。截至1月24日,在国外大模型排名Arena上,DeepSeek-R1基准测试已经升至全类别大模型第三,其中在风格控制类模型(StyleCtrl)分类中与OpenAI o1并列第一,其竞技场得分达到1357分,略超OpenAI o1的1352分5。1月27日,DeepSeek应用登顶苹果中国地区和美国地区应用商店免费APP下载排行榜,在美区下载榜上超越了ChatGPT6。1月31日,英伟达、亚马逊和微软接入DeepSeek-R1模型7。
基本信息
- 外文名
DeepSeek-R1
- 软件类型
推理模型
- 发布时间
2025年1月20日(正式版)
- 发布公司
深度求索(DeepSeek)1
- 型号
DeepSeek-R1-Lite4、DeepSeek-R1-Zero8
发展历程
2024年11月20日,DeepSeek全新研发的推理模型DeepSeek-R1-Lite预览版正式上线,用户可通过官方网页一键开启与模型的超强推理对话体验。截至11月20日,DeepSeek-R1-Lite预览版处于迭代开发阶段,仅支持网页使用,暂不支持API调用4。DeepSeek官方称正式版DeepSeek-R1模型完全开源,并公开技术报告,并部署API服务9。
2025年1月20日,幻方量化旗下AI公司深度求索(DeepSeek)正式发布DeepSeek-R1模型。DeepSeek不仅将R1训练技术全部公开,还蒸馏了6个小模型开源给社区,允许用户借此训练其他模型。API价格方面,每百万输入tokens 1 元(缓存命中)/4元(缓存未命中),每百万输出tokens 16元,较o1正式版低27-55倍2。截至1月,中国AI初创公司深度求索(DeepSeek)一个月内先后发布了DeepSeek-V3和DeepSeek-R1两款大模型,成本价格低廉,性能与OpenAI相当,让硅谷震惊,甚至引发了Meta内部的恐慌,工程师们开始连夜尝试复制DeepSeek的成果10。截至1月24日,在国外大模型排名Arena上,DeepSeek-R1基准测试已经升至全类别大模型第三,其中在风格控制类模型(StyleCtrl)分类中与OpenAI o1并列第一,其竞技场得分达到1357分,略超OpenAI o1的1352分5。1月27日,DeepSeek应用登顶苹果中国地区和美国地区应用商店免费APP下载排行榜,在美区下载榜上超越了ChatGPT6。1月28日,微软董事长兼CEO纳德拉在电话会上强调,DeepSeek-R1模型已可通过微软的AI平台Azure AI Foundry和GitHub获取,并且很快就能在Copilot+电脑上运行11。1月31日,DeepSeek R1 671b版本已作为英伟达NIM(Nvidia Inference Microservices)微服务的预览版在build.nvidia.com平台上发布。这一微服务基于单个英伟达HGX H200系统,能够实现每秒处理多达3872个token的高效性能12。同日,亚马逊云科技宣布,客户已可以在Amazon Bedrock和Amazon SageMaker AI中部署DeepSeek-R1模型。此外,还可以通过Amazon EC2、Amazon SageMaker AI,使用Amazon Trainium和Amazon Inferentia,用更具性价比的方式部署DeepSeek-R1-Distill13。同日,微软接入DeepSeek-R1模型7。2月10日,QQ音乐宣布旗下自研AI助手已完成对DeepSeek-R1完整版大模型部署,这也是DeepSeek首次在音乐平台的应用14。同月,深圳市龙岗区在区政务外网成功部署上线了DeepSeek-R1全尺寸模型(含6710亿参数),龙岗区由此成为全国率先基于昇腾服务器成功部署上线该全尺寸大模型及行业应用的单位,以及广东省首个在政务信创环境下成功部署该模型的单位15。9月,DeepSeek的论文登上《自然》杂志。论文描述了DeepSeek如何增强标准的大型语言模型以应对推理任务,其补充材料首次揭示了训练R1的成本:仅为29.4万美元。这不包括DeepSeek公司在开发R1所基于的基础LLM上花费的约600万美元,但总成本仍然远低于竞争对手模型被认为花费的数千万美元。DeepSeek表示,R1主要使用英伟达的H800芯片进行训练16。
版本介绍
DeepSeek-R1-Lite预览版
DeepSeek-R1-Lite预览版使用强化学习训练,思维链长度可达数万字,在数学、代码及复杂逻辑推理任务上表现出色4,在美国数学竞赛(AMC)中难度等级最高的AIME以及全球顶级编程竞赛(codeforces)等权威评测中,均取得了卓越的成绩,大幅超越了GPT-4o等模型9。
评测结果
竞赛/测试名称 | DeepSeek-R1-Lite-Preview | OpenAI o1-preview | GPT-4o | Claude 3.5 Sonnet | Qwen-2.5-72B-Instruct | DeepSeek V2.5 |
|---|---|---|---|---|---|---|
AIME(pass@1)美国数学竞赛 | 52.5 | 44.6 | 9.3 | 16.0 | 23.3 | 16.7 |
MATH-500(greedy)美国数学竞赛 | 91.6 | 85.5 | 76.6 | 78.3 | 83.1 | 74.7 |
GPQA Diamond(pass@1)理工科博士生测试 | 58.5 | 73.3 | 53.6 | 65.0 | 49.0 | 41.3 |
Codeforces(Rating)世界级编程竞赛 | 1450 | 1428 | 759 | 717 | 732 | 882 |
LiveCodeBench(2024.8-2024.11)世界级编程竞赛 | 51.6 | 53.6 | 33.4 | 36.3 | 31.1 | 29.2 |
深度思考
DeepSeek-R1-Lite预览版的推理过程长,并且包含了大量的反思和验证。下图展示了模型在数学竞赛上的得分与测试所允许思考的长度紧密相关。(红色实线展示了模型所能达到的准确率与所给定的推理长度呈正相关;相比传统的多次采样+投票(Majority Voting),模型思维链长度增加展现出了更高的效率。)
•红色实线展示了模型所能达到的准确率与所给定的推理长度呈正相关;
•相比传统的多次采样+投票(Majority Voting),模型思维链长度增加展现出了更高的效率9。
DeepSeek-R1
DeepSeek R1系列模型使用强化学习训练,推理过程包含大量反思和验证,思维链长度可达数万字,并为用户展现了OpenAI-o1没有公开的完整思考过程9。R1在后训练阶段大规模使用了强化学习技术,在仅有极少标注数据的情况下,极大提升了模型推理能力2。
性能卓越,媲美OpenAI-o1
DeepSeek-R1在各种任务上都展现出了惊人的实力,尤其是在数学、代码和推理任务方面,其表现完全可以与 OpenAI-o1比肩。这意味着开发者和研究人员可以利用DeepSeek-R1进行各种复杂的应用开发和前沿研究17。