你能想象吗,一家没有产品经理、几乎没有To C应用、团队才一百来人的公司,却让OpenAI的创始成员公开说"这是苦涩的教训"?
这就是DeepSeek,和它的创始人梁文锋。在2025年初那波震动全球AI圈的浪潮里,这家杭州公司的名字反复出现在外媒头条。但梁文锋本人极少露面——他更像一个写代码的极客,而不是 typical 的CEO。这家公司为什么会走一条和所有人都不一样的路?
一、从量化到AGI的跨界
梁文锋1985年出生于广东湛江,17岁考入浙江大学电子信息工程专业,后来在浙大读完硕士。2008年他开始研究量化对冲,2015年创办了幻方量化——后来成为国内量化私募"四巨头"之一。
做量化的人,天生就迷信数据和算力。幻方很早就重仓AI基础设施:2021年前后投入约10亿元搭建超算集群,装载了超过1万张英伟达A100显卡。当时业内开玩笑说,中国握着最多高端GPU的机构不是AI公司,而是这家量化基金。
2023年7月,梁文锋宣布成立深度求索(DeepSeek),主攻通用人工智能。从第一天起,他就定调:研究优先,暂缓直接做C端产品。这在当时"快变现、抢市场"的AI创业潮里,显得格格不入。
二、技术路线上的"反向操作"
DeepSeek最被人记住的,是两次架构层面的"不按常理出牌"。
第一次是MLA(多头潜在注意力机制)和DeepSeekMoE Sparse结构。当多数公司沿用GPT、Llama的成熟架构稳妥迭代时,DeepSeek直接重写了注意力机制,把显存占用压到传统架构的个位数百分比,推理成本随之大幅下降。2024年5月的V2模型,把推理价格打到每百万token仅约1元,一度被称为"大模型界的拼多多",还逼得字节、阿里、百度接连降价。
第二次是纯强化学习训练。2025年1月发布的R1,尤其是R1-Zero,首次大规模验证了"不用复杂奖励模型、只给极简规则"就能让模型自己顿悟推理。美国艾伦人工智能研究所的研究员评价它为纯RL推动大模型的"开山之作"。
V3在2024年12月发布,R1在2025年1月20日推出,性能比肩OpenAI o1。一整套组合拳下来,DeepSeek把"低成本训练出高水平模型"这件事,变成了行业不得不正视的现实。
三、为什么他不急着融资、不急着做应用
梁文锋有一句常被引用的话:真正的挑战从来不是资金,而是高端芯片的出口禁令。这也解释了DeepSeek的克制——既然算力是硬约束,那就把每一张卡的利用率榨到极致,而不是靠堆卡解决。
到2025年,DeepSeek团队仅约139人,却屡屡登上《自然》封面、入选《时代》年度百大。它选择开源、选择不融资,反而换来了全球开发者的免费扩散。对梁文锋来说,AGI更像一场他认为"这代人可能见证"的长跑,而不是一场抢跑。
普通人现在能做什么
第一,如果你写代码或做研究,DeepSeek的开源模型(V3、R1及后续版本)是目前成本最低、可本地部署的旗舰级选择之一。个人电脑配一张消费级显卡,就能跑起来做实验。
第二,如果你关心技术趋势,重点看它的"架构创新"而非"参数规模"。MLA、MoE稀疏化这些思路正在被整个行业借鉴,理解它们,你就理解了下一代模型降本的方向。
第三,如果你做投资或创业,DeepSeek证明了"小团队+硬技术+开源"也能撬动巨头。它提醒你:在AI这条赛道上,钱不是唯一的入场券,路线选择同样能决定胜负。