← 文章 / AI技术
前沿科技观察录 2小时前 · 2026-10-04 15:16:46 · 10 阅读

AI大模型第一梯队企业——深度求索(DeepSeek)

2025年春节前夕,一款名为DeepSeek的人工智能大模型发布,它以远低于美国同行OpenAI的训练成本,跑出比肩世界顶尖水平的智能表现,改变了全球AI由美国主导的格局。DeepSeek不仅率先打破了美国在高端大模型领域的垄断,还以彻底开源的方式把最前沿的技术无偿分享给世界,推动了中国和全球人工智能开源模型的发展。

公司发展历程

DeepSeek的创始人是梁文锋,1985年出生于广东湛江,2002年以当地优异成绩考入浙江大学信息与电子工程学系,先后取得学士、硕士学位。早在2008年,他便开始带领团队探索机器学习在量化交易中的应用。2015年,梁文锋创立幻方量化,凭借AI驱动的量化策略迅速崛起,2019年管理规模突破百亿元,2021年突破千亿元,跻身国内量化私募的第一阵营。梁文锋很早就意识到算力是人工智能的命脉。2020年,幻方投资上亿元建成搭载上千张GPU的“萤火一号”超级计算机,2021年又投入十亿元建设“萤火二号”。这套超前的算力底座,为日后大模型研发奠定了基础。2023年4月,幻方量化宣布成立大模型公司。同年7月17日,杭州深度求索人工智能基础技术研究有限公司注册成立,梁文锋亲自挂帅,跨界进军通用人工智能。成立之初,他立下“不融资、不上市、不商业化”的三条原则,在资本狂热的赛道闭门研发。2023年11月,DeepSeek率先推出开源代码模型DeepSeek-Coder。2024 年 5 月,DeepSeek-V2模型 发布,随后又推出 Coder-V2 和融合通用与代码能力的 V2.5。2024 年 12 月 26 日,DeepSeek-V3 发布;2025 年 1 月 20 日,推理模型 DeepSeek-R1 发布,一举震动全球。此后公司持续迭代模型,2025 年底推出 V3.2。2026 年 4 月 24 日,支持百万字上下文的 DeepSeek-V4 预览版发布并同步开源,分为 Pro(1.6 万亿参数)和 Flash(2840 亿参数)两个版本。2026 年 7 月 31 日,V4-Flash 正式版 API 上线公测,Agent 能力大幅增强。2026 年 8 月 13 日,V4-Pro 正式版发布,权重以 MIT 协议开源。2026 年 9 月 10 日,DeepSeek-V4.1-Flash 发布,采用全新非对称架构,具备原生多模态视觉理解能力。

公司核心团队组成

DeepSeek 团队格外年轻,也格外 “本土”。梁文锋同时担任创始人、首席执行官并深度参与技术决策,被视为事实上的首席科学家,公司未公开设置传统意义上的 CTO。团队主力是一批来自北京大学、清华大学、浙江大学等顶尖高校的应届毕业生、在读博士生。梁文锋曾坦言,做出 V2模型 的团队里没有一个海归。DeepSeek 组织层级极薄,研究团队大体只有梁文锋和研究员两层,不做前置分工,而是顺着每个人的兴趣 “自然分工”,当某个方向显现潜力时再集中调配资源。2025 年底至 2026 年上半年,王炳宣、罗福莉、郭达雅等一批早期核心研究员先后离职,加入腾讯、小米、字节跳动等公司。2026 年,公司启动首轮外部融资,将所有部门规模扩大至少一倍,崔添翼等资深技术人员加入,并新设代码智能体团队,研发力量持续扩充。正是这种高密度、扁平化又不断更新的研究型组织,支撑着模型的快速迭代。

低成本、高性能、全开源

2024年12月发布的DeepSeek-V3是一款自研混合专家(MoE)模型,总参数6710亿,每个词元仅激活约370亿参数,在14.8万亿个词元上完成预训练,性能对齐海外领军闭源模型。而根据其技术报告,V3训练所用的算力成本仅约557.6万美元,动用约2048张H800芯片、累计278.8万个GPU小时,成本不到美国同类模型的十分之一。2025年1月发布的DeepSeek-R1在后训练阶段大规模使用强化学习技术,在极少人工标注数据的情况下显著提升了推理能力,在数学、代码、自然语言推理等任务上性能比肩OpenAI o1正式版。尤其难得的是,DeepSeek将R1的模型权重与完整技术报告全部公开,以极为宽松的MIT许可证发布,允许全球开发者自由使用、修改、蒸馏乃至商用,并同步开源了由R1蒸馏而来的六个小模型。这意味着,任何企业和个人都可以站在DeepSeek的肩膀上,低成本地拥有世界一流的推理能力。这套“以低成本、达顶尖水平”的打法,迅速在全球引发连锁反应,被海外媒体比作人工智能领域的“斯普特尼克时刻”,OpenAI等巨头也被迫加快迭代、下调价格。DeepSeek用事实证明:通往先进人工智能的道路,并非只有“烧钱堆算力”这一条。2025 年 12 月的 V3.2 把深度思考与 Agent 能力融入通用模型;2026 年 4 月的 V4 将上下文扩展到百万字,Pro 版以 1.6 万亿总参数对标全球顶级闭源模型,在 Agent、世界知识和推理上达到开源领域领先;9 月发布的 V4.1-Flash 采用全新非对称架构,实现原生视觉理解,科学推理等指标进入世界前列。V4 与 V4.1 通过混合专家和新架构,把每个词元实际激活的参数压到总参数的很小比例,其中 Flash 版本在保持强 Agent 能力的同时推理更快、吞吐更大、价格更低,让百万级上下文和多模态能力走向普惠。

公司规模与布局

DeepSeek与同行的智谱和月之暗面一样保持“小而精”的规模。公司总部位于杭州,在北京设研发中心,并在内蒙古乌兰察布布局智算中心。2025年团队约160人,到V4研发前夕,研究与工程团队增长至约270人,公开报道的整体员工约 300 人。正是这支数百人的队伍,完成了许多巨头以数倍人力都未能达成的成就,核心部门在高强度研发期间的离职率一度低至个位数。2026 年 6 月,DeepSeek 完成成立以来首轮(A 轮)外部融资,募资总额约 510 亿元人民币(约 74 亿美元),投后估值突破 500 亿美元,创下中国 AI 行业单轮融资规模之最。其中梁文锋个人出资约 200 亿元为最大出资方,腾讯、宁德时代、国家人工智能产业投资基金等参与,外部资金设五年锁定期且不享有投票权,公司控制权仍由梁文锋掌握。伴随融资落地,公司启动史上最大规模招聘,在约 300 名员工基础上新增约 150 个岗位,所有部门规模至少扩大一倍,并首次成建制补齐产品与职能团队。截至 2026 年 10 月初,已确认的最近一轮(首轮)估值约 500 亿美元,目前公司正在进行第二轮融资,希望把公司估值做到 5000 亿元人民币左右,但这一轮还没有最终完成。在算力布局上,公司从租用转向自建,2026 年 7 月宣布在乌兰察布建设一座供电规模约 1GW(吉瓦)的超大型 AI 数据中心,采取自建与外部租赁并行,计划部分算力于 2027 年底至 2028 年初上线。至此,DeepSeek 形成杭州、北京研发与乌兰察布算力支撑的整体布局,从精锐研究团队成长为组织完整的人工智能公司。

公司文化

DeepSeek工作方式非常人性化:不打卡、不加班、没有KPI,员工通常下午六七点就能下班。创始人梁文锋认为,人每天高质量工作的时间很难超过六到八小时,疲劳时容易做出错误判断,反而会浪费时间。在管理上,DeepSeek更像一个研究实验室,而非传统营利企业。团队以小方向、兴趣为导向,成员可以自由调用计算资源,无需层层审批。公司每周定期讨论研究进度,梁文锋也常和年轻工程师一起直接参与攻关。公司信奉“让新人直接承担最核心、最重要的任务”的准则,许多人入职后迅速成长为行业顶尖人才。公司选人从不看资历,而是看热爱与好奇心,梁文锋说过,公司里很多人对研究的渴望远超对钱的在意。当然,没有KPI不等于没有压力,这里需要能自我驱动、在自由中定义方向的人。

福利与待遇

公司实行 14 薪或 16 薪,即每年发放 14 或 16 个月工资,年终奖与互联网大厂相近,至少相当于两个月工资,绩效与模型迭代、论文成果挂钩。AGI 方向深度学习研究员月薪约 8 万至 11 万元,年薪最高约 154 万元;核心系统研发工程师校招月薪 6 万至 9 万元,最高约 126 万元;大模型全栈工程师月薪 5 万至 8 万元,最高约 112 万元。2026 年新招的 Agent Infra、深度学习研发、服务端开发等岗位,月薪多在 3 万至 9 万元,按 16 薪计算。实习生方面,AGI 方向日薪一般为 500 至 1000 元,外地实习生每月另享约 3000 元房补;网传的日薪 5500 元是面向清华姚班等极少数顶尖学生的特例,并非常规待遇。此外,公司还提供五险一金、带薪年假、定期体检、餐费补贴和弹性工作。需要说明的是,在人才争夺白热化的背景下,DeepSeek 薪酬并非市场最高,它更依靠研究氛围、成长空间和技术理想吸引志同道合者。

招聘专业与学历要求

招聘方向看,DeepSeek每年需求高度聚焦人工智能核心链条。以2026年大规模招聘为例,招聘岗位覆盖全栈开发与算法、AI核心系统研发(超算集群、高性能编译器、分布式存储)、算力运维、深度学习研究、产品、模型数据策略,以及人力、法务、财务、行政等七大类三十余个岗位,分布在杭州、北京和乌兰察布,且所有岗位均接受实习申请。对应到的大学专业主要是计算机科学与技术、软件工程、人工智能、电子信息工程、自动化、数学、数据科学、网络工程与信息安全等,公司尤其青睐具备高性能计算、并行训练、编译器与芯片体系结构背景的人才。职能岗则面向法学、会计、人力资源、行政管理等专业。学历方面,大多数岗位本科即可投递,不唯经验、只看能力。深度学习研究员等前沿岗通常要求在校或应届硕士及以上,并看重顶会论文等成果。公司还开放过“不限专业”的特别岗位,为跨学科爱好者留出通道。核心研究岗的竞争很激烈,应聘者大多来自 C9 联盟高校,包括北京大学、清华大学、复旦大学、上海交通大学、浙江大学、中国科学技术大学等学校。其他岗位也普遍面向 985、211 院校。需要说明的是,这只是招聘中的普遍倾向,并非硬性门槛 —— 真正决定成败的仍是应聘者的热爱、好奇心与解决问题的能力。(如果你喜欢我的作品,请点点关注吧)
原始来源: 前沿科技观察录

评论 (0)