}

10

2023年,美国全面引领了AI风潮。ChatGPT-4.0、Claude、Gemini等最先进的AI大模型先后发布,AI进化的速度令人惊叹。

在国内,已经很久没有“超级sexy”项目出现的创投圈,都因为ChatGPT的横空出世而为之一震。所有人都知道,新的时代来了,新的机会来了。

王慧文、王小川、李开复等,都宣布进军AI;百度推出了文心一言、阿里推出了通义千问、腾讯推出了混元、讯飞推出了星火、月之暗面推出了Kimi……

但看似热闹喧嚣、风起云涌的背后,对国人而言,还是或多或少怀着一种焦虑或担忧:美国终究还是走在我们前面!如果AI就是未来,那在中美竞争中,我们拥有多大的胜算?甚至,我们是否拥有一争高下的能力?

国内大模型虽然发展很快,但是与ChatGPT-4.0、Claude、Gemini这些相比,还是相差甚远,甚至差距还在不断加大。

所谓“百模大战”中的强者,也只能在中国市场逞逞威风,拿到国际市场上,除了在开源模型评测上偶然有单个指标能登顶,在通用评测中全面落后。即便最先进的中国大模型,也只能勉强接近ChatGPT-3.5的水平,离4.0还差得太远,中美AI的“代差”实实在在地摆在那里。

这也体现在消费市场上。

在2023年,但凡一位用户能够用上ChatGPT,没有人会愿意用国内大模型,因为生成质量差距实在是太大了。

到2024年,随着Kimi升级,字节和腾讯推出了豆包和元宝,国内C端AI有了长足的进步。但OpenAI的多模态(GPT-4o)+深度推理(o1/o3)+世界模拟(Sora)组合拳,以及谷歌、Anthropic、Meta的紧紧跟随,让国内再次陷入“兴奋+绝望”的双重境地,兴奋在于:原来AI还能这样;而绝望在于:我们更追不上了。

这段时间,梁文锋和幻方在干什么呢?

2023年4月,幻方量化公众号发了一篇名为《幻方新征程》的文章,宣布:

幻方将集中资源和力量,全力投身到服务于全人类共同利益的人工智能技术之中,成立新的独立的研究组织,探索AGI的本质。

我们将充分而持续地投入,不做中庸的事,用最长期的眼光去回答最大的问题。

在这篇宣言的开头,还写着法国著名电影人特吕弗的一句话作为引语:

务必要疯狂地怀抱雄心,同时要疯狂地真诚。

整篇文章,没有一句话提到商业,没有一句话涉及利润。相反,它强调的是“服务于全人类共同利益”,“用最长期的眼光去回答最大的问题”。

2023年7月17日,梁文锋正式注册成立“杭州深度求索人工智能基础技术研究有限公司”,并以“深度求索”的英文,作为其正在研发的AI大模型的名字,即DeepSeek。

2023年11月2日,DeepSeek发布了第一个开源代码大模型DeepSeek Coder,免费商用,完全开源。其官方公众号DeepSeek发布了第一篇推文,称该模型“可能是最强的开源代码大模型!”,幻方量化公众号同步转载。

在国际权威数据集HumanEval编程多语言测试上,DeepSeek Coder在各个语言上的表现都领先已有的开源模型——包括此前一直领先的Meta CodeLlama。这在HuggingFace和GitHub等国际主流开发者社区都引起了极大关注,海外技术媒体和AI博主纷纷测评,国内相关的技术社区也跟进报道。

不过,这个模型主要是用于编程,只在技术圈子流行,大众并不知晓。在中国,只有几家财经媒体从猎奇的角度,报道“量化巨头发布大模型”。

但其已经给海内外的开发者留下深刻印象:这个来自中国的大模型完全开源、免费商用,还这么能打!大量开发者放弃原来的付费商用代码大模型,转移到DeepSeek Coder上来,并感叹“真香”。

2023年11月29日,DeepSeek又上线了DeepSeek LLM 67B,这是其公开发布的第一个通用大语言大模型。LLM 67B性能已经接近GPT-4.0,在近20个中英文的公开评测榜中,都领先于当时开源社区标杆Meta的LLaMA2 70B。

但最具冲击力的是,性能逼近顶级闭源大模型的一个产品,居然完全开源,无需申请,免费商用!

把“性能强大”和“开源友好”都做到如此极致的,DeepSeek是全球第一个。

但此时,DeepSeek依然还只是给技术圈和少数行业观察者留下深刻印象,大众层面基本上还不知道中国有这样一款厉害的大模型。

而且,此前的产品,只不过是宣告了它的存在,引来了几缕关注的目光而已,对行业尚未产生实质性的影响。

此时的DeepSeek,还只是一个虽有亮点,但依然可有可无的小角色。

到2024年5月6日,DeepSeek终于开始成为行业的重大角色——这一天,其发布了DeepSeek V2。这是DeepSeek第一款真正引起业界震动,深度影响行业格局的产品。

V2凭借多头潜在注意力(MLA)与混合专家架构(MoE),其性能比肩GPT-4,但API定价只有GPT-4的1%,被普遍认为“便宜得令人发指”。

V2的高性能与低价格引发了行业地震。当月,国内大模型不得不跟着大幅降价。阿里降价97%,智谱降价80%,字节新推出的豆包通用模型定价比行业平均便宜99.3%,腾讯、百度、科大讯飞的主力模型直接宣布免费。

DeepSeek也因此被称为“价格屠夫”和“AI界拼多多”。

在国际上,技术圈对V2好评如潮,褒奖程度对中国大模型而言前所未有。“可能是今年最好的一篇论文”“充满惊人智慧”“DeepSeek雇佣了一批高深莫测的奇才”“中国制造的大模型将和无人机、电动车一样不容忽视”……这些言论可不是普通的论坛网友发帖,而都是来自圈内公认的权威人士和技术大牛。

与此前DeepSeek发布的模型只是在开发者社区引起关注不同,V2直接成为诸多论坛的当周热点,推特上也出现了大量评测和讨论。国内的很多科技媒体也开始报道,在知乎甚至登上了热榜。

总体而言,V2在技术圈成为热门,在B端也拥有了大量用户和良好声誉。借由V2,DeepSeek真正在行业内站稳了脚跟。

如果说此前,很多人心目中,或多或少还会认为DeepSeek只是一家量化投资公司玩票的产品的话,那么,从V2之后,所有人都知道,DeepSeek已经成为一个足以震动整个市场,深度影响行业格局,让所有人无法忽略的,能够在国际市场代表中国大模型技术水平和商业潜力的全球重要AI玩家。

但这,对于DeepSeek,依然只不过是小小的一步而已。

它真正让普通老百姓熟知,是在七个半月之后。

那时,整个世界,都将为之震撼!

11

2025年1月27日,美股迎来了两天周末之后的开盘日。原本的市场标杆英伟达公司,股价从一开盘就狂泄。到收盘时,公司市值已经下跌了16.97%,这是英伟达自2019年以来的单日最大跌幅;其市值蒸发掉5890亿美元,这也是美股历史上单只股票单日市值损失的最高记录,至今仍未打破。

英伟达股票的狂跌,跟其自身经营问题没任何关系,主要是由于来自太平洋彼岸的一个变故:DeepSeek于一周前,发布了DeepSeek R1大模型。

R1在短短几天时间,就引爆了整个美国科技圈。到1月25-26的那个周末,连推特(X)都已经被霸屏,有用户描述“十个帖子九个都在讨论DeepSeek”,这是连ChatGPT-3.5发布时都没享受过的待遇。

不仅如此,1月27日美国股市开盘前,R1就已经登上了Apple Store美国区和中国区的双第一。其后不久,又陆续成为全球140个国家和地区应用下载榜第一。

美欧最重要的财经媒体全都跟进报道。

CNBC首先报道:“一家鲜为人知的中国AI实验室发布了成本更低但性能超越美国最好模型的AI,引发整个硅谷恐慌。”

《华尔街日报》称“中国AI模型震动全球科技市场。”认为其“迫使投资者重新审视支撑数万亿美元AI资本开支的核心前提假设。”

彭博社认为,随着R1的出现,“整套AI投资逻辑都需要重新审视。”

英国《金融时报》认为:“R1代表一个颠覆性拐点。有史以来第一次,一款开源权重模型,以极小的训练成本比肩顶尖闭源推理系统。”

《经济学人》认为:“R1真正的革命在于AI民主化……重塑全球AI创新的地理格局。”

《纽约时报》想得更远、更大,其从地缘政治、AI主权的角度出发,声称“这家中国企业将强推理模型开源,改变力量天平:西方开发者或将越来越多地基于源自中国的模型权重开展开发,重塑人工智能进步的全球格局。”,并认为“这一结果暴露美国半导体出口管制的局限性,同时抛出令人不安的问题:谁将制定未来全球AI创新的规则。”

与媒体更多关注DeepSeek对市场、地缘政治和国家竞争不同,科技界更关于技术本身的实力和颠覆性:

硅谷最有影响的风投大佬马克・安德森说:“DeepSeek-R1是我见过最惊人、最震撼的突破之一。它选择开源权重,是送给全世界一份意义深远的礼物。这属于AI的斯普特尼克时刻。”

“斯普特尼克”是人类发向太空的第一颗人造卫星的名字,由于它是苏联人率先发射的,引起了当时美国人的极度震动。美国人觉得美国在航天领域的优势骤然被苏联抢走了。此后,美国以前所未有的紧迫感和巨大投入拼命追赶,无论如何也要把航天优势抢回来。

后来,人们常用“斯普特尼克时刻”比喻竞争对手突然拿出颠覆性成果,迫使本国重新评估优势、加速投入的拐点事件。安德森对R1用了这个比喻后,“斯普特尼克时刻”也成为美国媒体提到DeepSeek时最常用到的词之一。

马斯克评价说:“在人类历史的大部分时间里,中国都是地球上最强大的国家。因此,你可以期待他们会做出许多伟大的事情,DeepSeek就是其中之一,这是由于中国拥有大量杰出人才的结果,是非常令人印象深刻的。”

微软CEO萨提亚·纳德拉说:“DeepSeek的新模型令人印象深刻,尤其是在如何高效开发开源模型并进行推理计算方面,它的计算效率非常出色。我们应当非常、非常认真地对待来自中国的这些技术进展。”

Meta首席AI科学家、图灵奖得主杨立昆认为,这并非“中国正在AI上超越美国”,而是“开源模型正在超越闭源模型”。

我们无需引用更多,上面的媒体和科技圈大佬的评价,已经完全足以描述DeepSeek R1在美国人心中引起的震动。这也是第一次有中国大模型,对美国媒体、科技圈以及普通民众,造成这么大的心理冲击。

在国内,对DeepSeek的认可来得更早一点。

2025年1月20日,R1发布的同一天,梁文锋受邀参加了总理座谈会,并出现在当晚的《新闻联播》里。

对此,我们无需说太多。凡是对中国有基本了解的人,都知道这意味着什么,也该知道在国家看来,梁文锋以及DeepSeek是怎样的地位。

而这,还是在R1当天刚刚发布,其影响力还没完全显现,媒体也还没大量报道的时候。说明国家比我们更早认识到梁文锋和DeepSeek的重要性。

对国内普通用户而言,从1月20日开始,一是由于总理座谈会和新闻联播的影响,二是由于国外科技圈、媒体圈以及市场的反应被传回国内,三是由于DeepSeek产品本身给用户的巨大惊喜,梁文锋终于开始走入大众视野,引起了现象级的网络狂潮。

在春节期间,DeepSeek在我们能想到的几乎所有信息平台和社交平台全部刷屏,DeepSeek官网的访问量和手机端下载量以亿级攀升,手机APP月活很快达到几千万级别。连梁文锋老家的米历岭村,都成为游客打卡的热门景点。

与当时市场上其他的AI相比,DeepSeek的表现带来了巨大惊喜。甚至可以说,有很多中国用户,直到使用了DeepSeek之后,才第一次真正意义上地体验到了水平与ChatGPT等国际一流大模型接近甚至比肩的AI产品。

在此之前,国内用户只有极少数人有渠道用上ChatGPT等国外产品,绝大多数用户可以使用其他国产AI,但是这些AI反馈的内容,与ChatGPT等相比,还是相差甚远。DeepSeek是很多人第一次感觉到:中国的大模型也不差,堪与国际顶尖大模型一战了。

后来,与ChatGPT-3.5横空出世时一样,人们也把DeepSeek-R1问世的这个时间点,称之为“DeepSeek时刻”。

12

DeepSeek时刻对中国乃至世界的影响力,可能比我们想象的还要深远。

在此之前,美国AI在全球一骑绝尘,中国拼命追赶,虽然也有零星的闪光时刻出现(例如某些大模型的某些测评偶尔冲入前列,或者某家公司的某个产品短暂受到好评),但是作为一个整体,依然难以望美国项背。甚至很多人认为,中国跟美国还存在明显的代差,且这种差距越拉越大。

本质上,国家的发展是由科技革命驱动的。一次技术革命发生了,赶上了的国家就发展起来,没赶上的国家就错过这一波发展机会。

工业革命、电气革命发生时,中国就是因为没能赶上,所以落后了,经历了百年屈辱。后来经过新中国的建设,以及改革开放以来的努力,我们补上了这两课,才发展起来。

到计算机革命、互联网革命,中国虽然有点落后,但毕竟还是慢慢追上了。到移动互联网革命、新能源革命,中国在两个领域逐渐与美国相差不远,甚至在某些地方并驾齐驱。

与此对照的是日本,其曾经因为抓住工业革命和电气革命红利,成为工业化国家。但是在计算机、互联网、移动互联网、新能源这几轮革命中,日本都未能抓住机会,国家经济发展以上世纪九十年代中期为顶峰,此后都是一路停滞甚至下滑。

这一次,最新、最重大的科技革命,是AI。而AI科技革命又与之前的科技革命有本质的不同——AI是可以自我学习、自我发展、自我促进,并且可以深度影响与“智能”有关的一切行业的。

一代AI的技术水平越高,其创造下一代AI的效率就更高,对其他产品和产业的智能化改造也会越深入。几轮下来,马太效应就会发挥到极致,“赢者通吃”会主导整个行业和世界经济格局。

因此,AI的发展,不仅仅是从企业和产业角度,哪家公司能占领多大市场,能分多少利润,能有多高市值的问题,而是涉及到整个国家未来的经济发展、产业布局,乃至高端科技竞争及军事与政治格局的问题。

说得直白一点,AI是关乎国运的重大因素。如果中国在AI竞争中落败,就不仅仅是几家科技公司的财报不如美国公司、中国AI从业者薪资不如美国同行的问题,甚至都不是中国会不会如日本一样陷入“失去的三十年”的问题,而是我们在全球国力竞争中是否会长期被压制、被压榨的问题。

2022年11月-2024年12月,就是以AI为核心影响因素的国运竞争天平剧烈摇摆,逐渐向美国倾斜,中国面临极大险境的时间段。在此期间,中国急需一个真正能打的AI,承担起扭转国运的重担。

遗憾的是,我们等了两年,这个“能打的AI”并未出现。

直到2025年1月,DeepSeek拿出了R1,我们才算真正意义上地拥有了去平衡天平的砝码。虽然说中国大模型并没有马上赶上美国,但是天平的剧烈摇摆稳住了,向美国继续倾斜的趋势被止住了,中国这一端正在慢慢往上回升。

从这个意义上来讲,DeepSeek完全当得起“国运级产品”这个称号,梁文锋完全当得起“转移国运”者的荣誉。

那DeepSeek-R1究竟有什么特殊之处,让美国科技圈和华尔街这么震动,又对未来的影响如此深远呢?

核心关键词是三个:极高性能、极低成本、极度开源。

从性能上来说,R1在数学、代码、自然语言推理等任务上,不仅超过了当时所有的开源模型,甚至已经接近了当时最顶级的闭源模型OpenAI o1,部分指标甚至超过了o1。

这是中国大模型第一次达到这个性能水准。从此以后,“中国大模型性能比不上美国大模型”,就成为一个可被质疑、可被颠覆的问题,而不是被默认的自然存在了。

从成本上来看,R1的使用成本只需要o1的大约3%;而训练成本更是低得惊人,从V3预训练到R1强化学习,只用了577.6万美元,尤其是增量训练成本仅用了29.4万美元。

557.6万和29.4万,成为美国媒体一再强调的两个数字。因为在美国公司,要达到同样的训练效果,成本基本都要几千万甚至几亿美元起。

这个巨大差异使得美国公司不得不紧急研究DeepSeek,看它是怎么做到这么低成本的。但这些美国公司很快会陷入绝望——他们根本就不可能做到这么低成本,因为在这些公司,“每一个生成式AI组织的领导,薪资都比V3整个大模型要高,而我们有好几十个这样的领导”。

更关键的是,R1的低成本改变了美国AI行业长期以来的固定思维——AI的进步必须要依靠堆砌算力才能取得。它形成了一种全新叙事:通过工程和算法创新,即便我使用的算力比你低,也能达到顶尖水平。这正是英伟达股票一天就蒸发掉接近6000亿美金的最主要原因。

而从国家博弈的层面来看,原本美国采用的通过控制算力,禁止高端芯片卖给中国,以阻止中国AI发展的“卡脖子”行为,就出现了致命漏洞——美国原以为卡得死死的,没想到还有这么大的呼吸空间。

为此,美国国会专门召开《深度解析DeepSeek》(DeepSeek: A Deep Dive)的听证会,评估DeepSeek对美国AI产业、芯片管制等的影响;而美国国土安全委员会、美中经济与安全评估委员会等部门召开的关于中国人工智能发展的听证会上,DeepSeek也都是讨论的重中之重。

从开源来看,DeepSeek-R1的开源程度,远远超过了当时所有其他主要大模型。

R1采用极度宽松的MIT许可协议,任何人都可以自由使用该模型(包括用于商业目的)而无需授权,并可以根据自己的需求对模型进行二次开发和微调,甚至可以将修改后的模型重新发布,闭源商业化。

更重要的是,R1不仅公开了模型权重,还公开了详尽的技术论文,提供了完整的推理代码和工具,等于直接将“know how”都全面开源给了全世界。

这篇论文于2025年9月登上全球最顶级学术期刊《自然》(Nature)封面,使R1成为全球首个通过《自然》杂志独立同行评审的主流大语言模型,梁文锋本人也被《自然》杂志评为2025年度十大科学人物之一,称之为“科技颠覆者(Tech-disruptor)”。

对全世界来说,DeepSeek大模型比肩最顶级闭源大模型的性能,极低的训练和使用成本,以及极度的开源,让人类在通往“普惠AI”之路上前进了一大步。

原本闭源API只是极少数公司的奢侈品,中小企业接入API都很贵,更不用说从头训练大模型,但从R1开始,最顶尖的AI技术真正成为人人可用的“公共产品”。

C端用户也是如此,原本需要花费每个月十几美元、几十美元甚至二百美元,才能用上性能顶级的AI,现在完全免费就可以获得质量接近的产品。

这是对美国公司所习惯的商业模式的一个重大冲击。

以往,美国公司习惯于用高成本的投入来创造一个护城河,获得垄断式的市场地位,然后收取高价,来获得高额利润。但DeepSeek以其极低的训练成本和使用成本,给这种模式带来了重大威胁。这就好比,当美国AI公司摆好餐桌,正要享用美味牛排时,DeepSeek闯进来,直接把桌子掀翻了。

数据可以说明一切。

从2025年发布R1后,DeepSeek又不断推出一系列新产品,始终是全球最受欢迎的大模型之一。

从手机端来看,尽管DeepSeek从未刻意追求用户数,但其App的月活数量用户长期保持在中国前三的位置;从网页端来看,DeepSeek更是断崖式地领先,在中国排名第一,访问量比二三四名加起来都高,在全球也进入到前五的位置。

而从全球AI生态的角度来看,根据全球最大AI模型聚合平台OpenRouter数据,DeepSeek模型的API调用量已持续位居全球第一,也带动中国模型的总调用量达到美国的三倍多,连续十六个星期超过美国。

其中,仅DeepSeek旗下的一个模型V4-Flash,一周调用Token量就达到美国所有公司、所有模型加起来的70%(美国全国10.26万亿,V4-Flash单模型为7.22万亿)。

这说明,DeepSeek的模型已成为全球开发者构建应用时,最主要的“默认选项”,它已经成为全球AI基础设施中不可或缺的核心单元——而这,原本是美国AI公司的禁脔,是美国公司高居神位享受全球香火供养的祭坛。

13

“掀桌子”并非梁文锋和DeepSeek的本意,他们只不过是希望普通人能够低成本地用得起更好的AI而已。

二十多年前,为了创业,梁文锋曾用心去学习各种经营管理知识,那时他最崇拜通用电气的CEO杰克·韦尔奇,对韦尔奇说的很多理念,都奉若圣经。

若干年后,随着梁文锋自己的成长,也随着世事的变迁,韦尔奇说的很多东西,梁文锋已未必再认可。但是有一句最重要的话,梁文锋始终认为是对的,那就是韦尔奇说的:一个公司最重要的是它的愿景。

做幻方量化时,梁文锋的愿景是“能与世界级的量化交易泰斗——西蒙斯的文艺复兴公司相媲美。”

这个愿景曾经鼓舞着梁文锋带领幻方量化高歌猛进,造就了中国量化私募的一个传奇。

但是,对于更为成熟的梁文锋来说,单纯从规模、从金钱的角度,早已无法再吸引他。这个愿景对幻方量化而言虽然依然存在,幻方量化也依然在朝着它前进,但对于梁文锋的人生抱负来说,它已经显得太轻、太小、太无趣。

那么,从量化进入AI,从幻方到深度求索,梁文锋新的愿景是什么呢?

我们需要从他最开始进入AI时寻起。

梁文锋后来明确说过:他和几十个同伴,完全不是为了钱而做DeepSeek。成立公司的时候,他们没有一个人想过要去资本市场,要上市——如果他们这么想,就不会来。

不是为了钱,那是为了什么呢?

DeepSeek公司并没有公布过关于愿景的标准版表述,用梁文锋的话说:“愿景不是挂在墙上的标语”,“这个愿景甚至也不是成文的,并不是写出来的,没有写出来过任何东西。”

但是从他多次提到与愿景有关的言语,以及DeepSeek公司正在做的事情和做事的方式来看,梁文锋和DeepSeek的愿景,可以总结为一句话:

以原创、开源为路径,探索智能本质,创造人人用得起的通用人工智能(AGI)。

梁文锋认为,虽然DeepSeek每个人对愿景的理解可能并不一样,但是在一个大的方向上是一致的,那就是:“我们是怀着一个对这个世界非常大的善意来做这个事情,然后我们觉得这是对人类有用的。”

整个DeepSeek公司,正是围绕这一点,而创造出来并运转起来的。所以公司没有组织,不设KPI,也没有考核,每个人自由决定自己每天要做什么,完全由愿景驱动。甚至,作为一家AI公司,DeepSeek内部都不怎么需要加班,这与其他互联网或AI大厂形成了极其强烈的反差。

梁文锋的“对世界非常大的善意”,不是嘴上说说,而是在公司的每一项决策中、个人的每一天工作中践行。

一个例子可以作为证明:当DeepSeek公司推出DDCP模型时,一开始由于担心需求太多撑不住,就把价格定得比较高,但团队成员都因此而闷闷不乐,因为他们都不想定高价。后来条件成熟,担心的问题解决掉了,价格降到了原来四分之一,大家一下子都变得好开心。

作为搞量化金融起家的梁文锋和公司,他们完全有能力把用户的需求弹性(即价格每下降百分之一,销量会上升百分之几;或价格每上升百分之一,销量会下降百分之几)准确测算出来,从而设定一个让公司利润最高的价格。但是,他们从来都没有这样做。

即便梁文锋完全清楚有些产品在某个价格区间里,需求弹性为零,价格上涨一倍,用户也完全不会离开,等于在几乎没有任何风险的前提下,利润可以增加一倍,梁文锋也绝不干这种事。

因为他和团队真实的目的,根本就不是赚更多的钱,而是如何能够把模型做到“非常便宜、效果非常好,能够让大家都能够充分地用”。因此,才会出现产品降价(意味着公司利润减少),公司群里大家都在欢呼、都觉得好开心的场面。

也由于同样的共识,DeepSeek在商业上极度克制,很多明明弯腰就能捡到的钱,他们情愿不要。

例如,2025年春节,DeepSeek的用户突然以亿级规模增加,这种级别的流量,换到任何一家公司,都是求之不得的泼天富贵——很多公司想尽办法就是想要达到这样的效果。但梁文锋的做法完全相反,他并没有去追求如何去留存这些用户,也没有拿这些用户来变现,更没有说借着这股势,去做一个类似抖音、微信这样的超级App……

DeepSeek完全有能力这样做,但是却完全没有这么做。他们在维护C端用户日活方面,只花了极低的成本。其他公司为了抢C端用户都打得头破血流,而DeepSeek却完全不抢。相反,其把DeepSeek模型作为底层技术开放给所有公司(包括竞争对手),任由这些公司把用户分走。例如,腾讯元宝当时就以接入了DeepSeek R1满血版作为最大卖点。阿里钉钉、百度搜索、字节飞书等,也全都接入了DeepSeek模型。

如果单从商业利益角度来看,这种做法很令人困惑:这不是帮助竞争对手吗,甚至说得重一点,这不是“资敌”吗?但这就是梁文锋和DeepSeek的风格。他们愿意极度地开源,极度地包容,希望帮助大家(哪怕是竞争对手)一起更快地提升AI水平,让AI更好地帮助公司发展。因为这样从长远来看,更有利于大家一起通往人人普惠的AGI。

搞笑的是,有些媒体和自媒体用“DeepSeek月活数量下滑”或“DeepSeek用户数仅排名第几”,试图证明“DeepSeek不行了”。这些人根本就不明白,第一,DeepSeek根本就没追求过这个数字;第二,很多用户虽然用了别的APP,但本质上使用的仍是DeepSeek,只不过统计数据上不体现而已(例如,在很长一段时间里,大部分用户使用元宝,默认都是选择调用其内置的DeepSeek,但这个日活或月活数据算元宝的,不算DeepSeek的)。

对梁文锋来说,抢C端用户、做超级APP,虽然也能赚钱,甚至是赚很多钱,但跟他们最终要做的相比,都只不过是芝麻,后面的才是西瓜。何必把眼光放在这点小芝麻上面呢?

梁文锋口中所谓的“后面的西瓜”,就是最终那个AGI。

14

AGI(通用人工智能)虽然属于广义AI(人工智能)的一种形态以及当前AI发展的最终方向,但在任何提到AGI的语境下,AGI和AI是两种完全不同的事物。

根据“深度学习三巨头”之一、图灵奖得主本吉奥等人在《AGI的定义》(A Definition of AGI)这篇论文中的定义:

AGI是一个能够在认知的广度与深度方面,比肩甚至超越受过良好教育的成年人的人工智能。

具体而言,AGI应该具备这样的特征:

具备等同甚至超越人类的、跨领域的学习与推理能力;

能通过少量样本自主学习、举一反三,解决从未见过的新问题;

拥有完整、均衡的综合认知能力,兼具常识判断、长期自主规划与反思纠错能力;

具备持续学习与经验积累的能力,能够将新信息整合进长期记忆。

也就是说,AGI要具有等同甚至超过人的智能和自主学习、自主解决问题的能力。

创造这样的AGI,是人类久远以来的梦想。但从上面的定义和特征描述,大家也能知道,这是一条极其艰难的路。让机器拥有等同乃至超越人类的智能,这近乎于“神”的工作。人类曾经做过各种各样的探索,但是进展始终有限。

只有到了“ChatGPT时刻”之后,随着各种大模型的风起云涌、你追我赶,人工智能在以前所未有的速度爆炸式地进化,人类才真正看到实现AGI的曙光。

目前较为普遍的观点,是认为AGI的实现已经近在咫尺。除了极少数悲观派认为人类离AGI还很遥远,需要十年以上甚至可能永远无法实现以外,大多数业内人士和相关科学家的预计是5-15年,更乐观的甚至认为1-5年内AGI就可以出现——马斯克、阿莫代伊、奥特曼、哈萨比斯、黄仁勋等基本都持乐观派观点。

梁文锋没有给出具体的时间表,但是他明确表示:“从技术路线上来看,其实AGI这条路线图是比较清晰的。”这说明,梁文锋对如何实现AGI,已经胸有成竹。

梁文锋认为,AGI的实现,是有台阶可以走的。每一步台阶,都是在给后一步台阶铺路。人类已经走过了很多台阶,到ChatGPT时刻之后,已走到了语言模型,2025年又走到了思维链(CoT),2026年走到了智能体(Agent),在此之后的下一个台阶,是持续学习。当走上持续学习这个台阶后,人类就会来到奇点。

在梁文锋看来,奇点并不是一个点,不是一个突变,而是一个持续的、渐进的过程。在解决掉“持续学习”这个瓶颈之后,AI就进入到一个通过持续学习自我迭代的加速期,它能够自己开发自己的版本,能够自己再研究,然后再开发更进一步的人工智能模型,最终实现AGI。这个过程就是奇点。

当然,对于实现AGI的路径,不同的公司、不同的人都有不同的看法和做法,但是在梁文锋看来,他所总结的“在此前已经走过的台阶上,先重点解决持续学习问题,经过奇点,最终抵达AGI”,就是最聪明的、最轻松的路线图。因为前面所走的每一步,都在为后面的每一步铺路和提速。当持续学习的问题被解决掉,AI就可以协助甚至主导下一代AI的创造,这会比由人类来创造下一代AI,效率要高出无数倍。

而在这个过程中,用户的聚集和商业的变现,都是水到渠成的事情,它们只不过是通往AGI之路的副产品而已。

这就跟绝大多数其他公司有了本质的区别。大多数公司做AI,是为了用更好的产品吸引C端或B端的客户,实现商业变现,赚更多的钱。而梁文锋(及DeepSeek)纯粹是为了做AGI而做AGI,只不过刚好中间过程能产出一些产品,就顺手把它商业化一下而已。

这种愿景、这种格局、这种克制、这种专注,本质上等于形成了降维打击。那些被资本驱动,以商业变现为首要动力才来做AI的公司,根本就跟DeepSeek不在同一个竞争维度。

但梁文锋走的这条路,也并非一帆风顺。目前最大的问题,也是长远来看最大的问题,是人才的稀缺。

做这个事情不缺钱,不缺资源,就缺真正的人才。

梁文锋从幻方量化成立的第一天,就最重视人才。而到了DeepSeek时代,这种重视程度,又提高了无数倍。

作为一个极度厌恶抛头露面的人,他仅有的两次接受媒体采访,都是为了招人。甚至,从原来不愿意融资到后来决定融资,最核心的考虑,都不是资金和资源,而是为了人。

虽然DeepSeek已经是行业内员工离职率罕见地低的公司,虽然进入DeepSeek的人,总体上更具情怀,但是,当行业所有其他公司都在用巨额薪水和诱人期权抢人的时候,市场上的高手并不会因为梁文锋愿景伟大、DeepSeek实现AGI的前景光明,而都来投奔他。

这一行里真正的人才,每一个人都在被无数大厂疯抢,并不是都要挤着去DeepSeek。甚至,哪怕是已经在DeepSeek工作的人,也有可能会因为种种考虑,而被其他公司挖走。这种事情,已经在DeepSeek发生过多次,每一次发生,都是无可估量的重大损失。

所以,梁文锋认为公司最核心的利益,就是员工的稳定;最大的风险,就是员工的流失。

其实,DeepSeek开出的薪资,已经非常高,保障一个体面的、富足的生活,已经绰绰有余。但市场总会用更高的薪资来挖,不是每一个人都能抵挡得住这样的诱惑。

我认为,在当前由美国开创、由资本主义精神主导的企业运作和市场运作模式下,这是一个近乎无解的问题,总会有很牛的人为了更高的收入选择了其他大厂而不是DeepSeek,也总会有在DeepSeek已经担当重任的人,因为外部诱惑而选择离去。这是很自然的市场规律。

但长远来看,它也并不会影响最终的结果。

因为,总还是有许多真正厉害的人,尤其是最厉害的人,把理想看得比利益更重。

只要梁文锋他们还在坚持“怀着一个对这个世界非常大的善意来做这个事情”,只要他们的目标始终是“创造人人用得起的通用人工智能(AGI)”,只要他们依然会因为帮用户降低了成本(哪怕自己少赚了钱)而在群里欢呼,只要他们真的走在通往AGI的靠谱道路上,我认为,那些真正有能力、有意愿改变世界的人,一定会非常愿意和梁文锋同行。

毕竟,亲手参与创造一个以爱和善意为核心理念的AGI,深入影响世界的方方面面,为人类创造一个更美好的未来,那种巨大的成就感,是多少钱也比不上的。

15

至此,梁文锋的来时路已经基本讲完了。我还想最后再跟大家分享一个不一样的梁文锋。

梁文锋的聪明、极度专注、大格局,这些都已经被讲得很多,但很少有人知道梁文锋的重情重义。

只讲几个细节,大家即可窥斑知豹。

2011年11月,梁文锋去西藏,在阿里无人区失去了他的菲亚特,尽管这辆车只值几万块,但他依然为此惆怅许久,甚至还专门发微博纪念。此时,梁文锋刚毕业一年多,蜗居在成都的出租屋里,探索着人工智能落地的梦想。

2012年10月,老同学、合伙人徐进结婚,梁文锋当伴郎,在新郎新娘的身后,梁文锋憨憨地跟着傻笑。此时,梁文锋回到了杭州,专心搞量化,并赚了很多很多的钱。

2016年11月,浙大信电系0203班组织了毕业十周年聚会,全班39人,只有14人从各地赶回。梁文锋在其中。从玉泉到紫金港,从足球场到宿舍,从看望老班主任到看望楼管大姐,他从头到尾都在。此时,梁文锋已经创办幻方量化,管理着10亿资金(其中自有资金超5亿),是一颗冉冉升起的行业之星。

2025年1月,梁文锋回吴川陪爸妈过春节,并到米历岭村看望爷爷和叔婶,跟童年玩伴一起踢球。此时,他早已是“千亿量化私募”掌门人,参加过总理座谈会、上过新闻联播,他所创造的DeepSeek,已经震惊世界。

这些能说明什么呢?它们说明,这样一个人,自始至终都保持着同样的质朴。不管身份如何变化,财富如何变化,他始终重情重义,从不忘本。

至于梁文锋以公司和个人名义捐出的那些巨额善款,在商业定价、开源、帮助竞争对手提高能力等方面的表现,以及内部讲话中时刻流露出的“最大的善意”和对“全人类共同利益”的关切,就更不用说了。

如果说AGI最终会统治人类、接管世界,我会更愿意看到,是由梁文锋这样的人来创造它。因为相比起来,梁文锋更能让我感受到他完全发自内心的善良、质朴与爱。

而这,正是AGI最需要的特质。

16

公元1091年,梁文锋先祖梁焘,在一份奏折中写道:

臣闻人主之德,莫大于知人;朝廷之政,无先于急贤。德以聪明为高,而政以忠厚为本。

公元1938年,浙大老校长竺可桢,在浙大因抗日战争而西迁至广西宜山时,在开学典礼上讲到:

大学教育的目标,在乎养成公忠坚毅,担当大任,主持风会,转移国运的人才。

回顾梁文锋的来时路,我们可以清晰地看到,“德在知人,政在急贤,聪明为高,忠厚为本”的祖训,“公忠坚毅,担当大任,主持风会,转移国运”的寄望,他都做到了。

但其实,梁文锋不是一个人。他是梁氏后裔的代表,是浙大学子的代表,是深度求索公司的代表,更是这一代中国人的代表。

在中国,还有千千万万的老年、中年、青年、少年——包括正在看文章的你,和正在写文的我——与梁文锋一道,怀着同样的聪明忠厚、公忠坚毅,去担当大任、去主持风会、去转移国运,不仅为中华,而且为世界,创造一个更美好的未来。

这是我们和梁文锋,一起为明日唱响的,伟大颂歌。

---end---

主要参考资料:

【1】《揭秘DeepSeek:一个更极致的中国技术理想主义故事》,于丽丽,暗涌Waves公众号

【2】《疯狂的幻方:一家隐形AI巨头的大模型之路》,于丽丽,暗涌Waves公众号

【3】《A股量化投资新趋势》,梁文锋,2019年金牛奖分论坛演讲

【4】《创造理解市场的模型》,梁文锋,《征服市场的人》序

【5】《梁文锋与投资人谈话实录》(2026),梁文锋

【6】《高考状元:自信的笑容很灿烂》,黎劲风,吴川日报(2002)

【7】《信电校友》,浙江大学信电校友网

【8】《DeepSeek创始人梁文锋是个什么样的人?》,清风学渣,知乎

【9】《宋史·梁焘传》《国朝诸臣奏议》《化州志》(关于梁焘部分)

【10】幻方量化公众号、幻方量化官网、DeepSeek公众号、幻小方知乎号