
背景
deepSeek在2025年春节期间火爆全球,微信朋友圈,头条,抖音,快手,微博等热门平台,无处不在。
说的再多,聊的再牛逼,也不是一手信息源,作为程序员,还是要自己去仔细认真看看,不能人云亦云。
目标
自己去看deepseek官网,API开放平台,看看github上开源的东西,自己去下载体验,自己去安装体验,自己写一个简单的程序去测试。
从程序员的视角,从应用开发的视角,去思考,去思考应用形态,结合业务场景去设计产品,才是最好的学习方式和实践方式。
实践路径
1 官网资料阅读
打开deepseek官网,有如下的感觉:
第一感觉,图标,图标跟docker很像,蓝色鲸鱼,docker多了几个集装箱;
第二感觉,开源,开源可以快速传播,收获用户,打造口碑,建立影响力,甚至建立行业标准,当年docker也是这么干的;
MIT许可证是最流行和最宽松的开源许可证之一,允许用户几乎无限制地使用、修改和分发软件。对于商业公司而言,MIT 许可证带来了较低的法律风险和灵活性,
允许它们将开源代码集成到自己的产品中并进行商业化。然而,它也可能带来竞争压力,因为其他公司也可以使用相同的开源软件进行创新和改进。
同步开源模型权重:除了发布模型的源代码,还将预训练好的模型权重同步发布,确保别人能够直接使用、修改或再训练该模型。 即开箱即用。
第三感觉,对标OpenAI o1正式版,这个很霸气,在AI领域,OpenAI是领头羊,o1正式版专注在复杂推理任务,尤其是在科学,编程和数学领域;
对标不是超越,很谦逊,国内为数不多的公司敢这么宣称的。
从图片中可以看出: 第一,第四,第六个对比维度, DeepSeek以微弱的优势比OpenAI的o1正式版。
从图片中看出,小模型通过R1蒸馏之后,测试数据在第一到第五个对比维度是优于OpenAI o1-mini
从图片中看出,deepseekv3在数学和英语文本中表现突出;
第四感觉,应用形态都铺开了,提供了网页端,APP端,API开放平台,那就是说可以通过网页端和APP快速体验,其他的公司或者软件产品也可以集成API的方式增加自己的AI能力。
第五感觉,AI相关的技术或者产品传播速度很快,(前提是测试数据靠谱),2025年1月20号就发布了DeepSeek-R1,除夕2025年1月28日基本上就是人尽皆知了。
第六感觉,deepseek的成本要远远低于openai。 四分之一以下的价格。
2 web/app端体验
直接手机手册一个账号。抛几个问题。 对比以下跟openAI的o1做对比。
deepseek的回答更实时,回答更贴合中国实际,推理过程也返回了,即知其然也知其所以然。app端使用体验类似。
下面来一个带附件学习的例子。
java8 in Action,我喂进去,然后提个问题。
对比下来,deepSeek回答得更全面。
资料阅读
1 deepSeek网上的宣传资料阅读
1.提问技巧:
a.我要xx,要给xx用,希望达到什么效果,但是担心什么问题。
b.说人话 。
c.反向提示词,批判性思维,复盘100遍。
d.模仿谁。锐评。
2.deepseek是中国超过美国了吗?
基建是美国起源的,deepseek只是一个大语言模型,应用层面的领先。
3.deepseek跟openai还有哪些不具备的能力。
2 知识蒸馏有哪些应用场景?
为什么通过蒸馏技术训练其他模型很有用?
减少模型复杂度:
原始的 R1 模型可能非常庞大,计算资源消耗大且需要较长的训练时间。通过知识蒸馏,训练出的学生模型会小很多,但仍然能够保持很高的准确度和表现。
提升计算效率:
学生模型由于参数更少、计算量更小,通常能够在硬件资源有限的环境中运行得更快,因此适用于对速度和效率有较高要求的应用场景。
加速模型部署:
通过蒸馏技术,可以快速得到一个较小但性能强大的模型,避免了从头开始训练的时间和计算成本。对于需要快速部署的企业或开发者来说,这是一种高效的解决方案。
迁移学习:
如果原始数据集非常大,且训练 R1 模型需要巨大的计算资源,知识蒸馏可以帮助快速将 R1 模型的知识迁移到其他领域或任务上。开发者可以借此将 R1 模型适配到新的任务或新的数据集。
3 开放思维链输出
“DeepSeek 的对用户开放思维链输出”意味着该系统或平台通过某种方式展示或暴露出模型进行推理、决策的过程,而不仅仅是结果。用户可以看到模型如何一步步处理数据,做出决策或生成答案。这种功能增加了模型的透明度和可解释性,尤其在需要验证和优化决策过程的场景下非常重要。
小结
DeepSeek通过开源火遍全世界,很可能像docker撬动容器化时代一样,撬动AI时代。