落后一到两年,但只用二十分之一的算力
投资人追问技术追赶速度与华为950产能,梁文锋提出落后但只用二十分之一算力的追赶叙事。
落后一到两年,但是只用它二十分之一的算力。
谢谢。
所以我们跟美国的差距可能是落后美国 12 个月,落后美国可能 12 到 18 个月,或者说 6 到 12 个月。反正简单说,就是落后美国两年,然后只用美国二十分之一的算力把这个事情做出来。
这个叙事就是落后一到两年,但是只用它二十分之一的算力。那么未来我们要把这个叙事改写,就是我们用它几分之一的算力,但是把这个时间缩得更短,缩到 6 个月、3 个月,我觉得这是一个目标。
以及我们甚至可以在某一些方面超越他们。但是在总体算力还是有数量级差距的情况下,全面超越是不现实的;但是在某一些重点、有取舍的地方,我们有一些地方超越可能是可以的。
明白,谢谢梁总。信心满满,一起努力。时间也留给其他的伙伴,谢谢。
感谢刚才的分享。我这边有两个快速的技术问题。在刚才聊技术路线当中,提到了我们这一阶段要解决的核心问题是持续学习,也是目前国外研究的热点,叫 Recursive Improvement。想请教一下,目前来看,从技术上最大的难点是什么?从您的视角来看,这个什么时候可以解决?这是第一个问题。
第二个问题,同时您刚才提到,先解决持续学习,然后再去做智能。我也想理解一下,您这么提背后的技术根源是什么?是不是意味着解决完持续学习问题以后,DeepSeek 后续也会做通用智能?这两个问题请教一下。
技术问题其实解释起来有点……它的难点在于,我们现在还没有找到非常 work 的方法。全世界都还没有找到好的方法,大家都在摸索。所以现在还在摸索阶段,就是不知道谁能摸到下一个解决这个问题的方法。现在还在探索阶段。我们有很多思路,有很多现在看起来有前途的一些想法,但是都还没有做通。对,这是第一个。
第二个是,现在我们内部比较看重这样一个叙事:训练我们的下一版模型,我们希望它能够帮助我们自己的开发。它能够提升 DeepSeek 的效率,我们的模型最首先是提高 DeepSeek 自己的工作效率,让我们开发下一版模型的时候,它能够提供更多的帮助。
或者说简单一点,我们做的模型,第一目标不是大家用得好用,而是我们自己用得好用。首先是对我们自己有用。对我们自己有用之后,我在开发下一版模型的时候就会更快。
我们内部很多人的想法是这样的:首先要对我们自己有用,首先是给我们自己用。然后这是实现 AGI 最快的方法。当我们自己好用,那意味着可能别人也好用,但是首先得保证我们自己好用。
这个叙事有点奇怪,但是确实很多人就是这么想的。而不是说用户用得好用,我是希望对我们自己帮助更大,这样我们可以实现 AGI,会快很多。所以这个叙事的逻辑是,来帮助我们实现 AGI。但首先是帮助我们实现。我们实现 AGI 需要这个帮助。现在是非常确定,我们确实需要人工智能来帮助我们实现 AGI。虽然说它还不是自主地工作,它还是只是跟人搭配,但是已经很有用了。
第二个问题,就是刚才提到了,先解决持续学习的问题,然后再进入通用智能。这是您对后续的一个预期吗?想理解一下这背后的技术根源是什么?为什么先要解决持续学习,然后再进入通用智能?您对这块后续的理解。
因为解决持续学习这个问题,可以大大加快我们的研发进度。如果我先解决了持续学习这个问题,那么通用智能这个问题就不在话下了。我有了 AI 的辅助,如果 AI 能够持续学习,它的能力应该是非常强的。
现在的 Agent 的能力受限,是因为它不能持续学习,它不能有效地持续学习。如果说能够先把持续学习做完,那 AI 的能力是非常强的,它能够非常大地提升我们自己研究的效率。
持续学习先做出来,通用智能可能就很容易了,用它来做就很容易。所以我说这是一个我们比较希望看到的结果,我们比较省力,我们就轻松。否则现在你要去人工做通用智能,它是一个比较累、比较苦,是一个数据密集、人力密集的事情,性价比也不高。
感谢分享。
小问题,线上的问题你看一下聊天群。觉得 AGI 还需要多久?国内硬件在这个时间能追上吗?在 Zoom 会议的那个聊天窗口里面。
好,这个我看了。华为 950,现在华为是给我们一万六千卡,这应该是可以公开说的。应该是比互联网大厂少一个数量级。华为也只能给我们这么多,因为这个价格也不便宜。
互联网大厂的追求会更大,对互联网大厂来讲,它更需要。对我们来讲,我们可以买一些不合规的卡。所以我们买华为 950 的目的,还是希望帮华为把这个生态做好。
一万六千卡的华为 950,只相当于四千卡的 B 系列。所以说不是一个很大的量,意义不是很大。不够训一个下一代的模型,它只够训我们现在这一代模型,不够训下一代模型。但是可以让华为把这个先做好,就是关于华为 950。
然后,AGI 还需要多久?国内硬件在这个时间能追上吗?我觉得在 AI 这个事业上面,在 AI 这个事情上,应该国内一两年是能够做到跟国外差不多的,或者可能今年就能做到平替国外的模型。在 AI 这个事情上,就现在的一个方式、现在这个范式,不是很难的事情,所以今年应该就能做到的。但它还不是 AGI。