

版权声明
来源:求是网、创头条、书享界(readsharecn)
作者:唐杰,清华大学计算机科学与技术系教授、智谱AI创始人
近日,清华大学计算机科学与技术系教授、智谱AI创始人唐杰在《是点访谈》中,详细解读了国产大模型的现状与未来。他点出了国产大模型三大现实瓶颈:高端芯片受限带来的算力约束、行业数据流通不足、基础理论原创能力有待补齐,而产学研协同,他认为是突破上述短板的重要路径。
以下为访谈实录:
主持人:唐教授欢迎您做客是点访谈。今天豆包、DeepSeek、元宝、kimi、智谱清言、通义千问等等这些生成式智能的应用加速普及。但这些大众的智能化产品,它依托的是国产大模型在运行。那您对我国的国产大模型发展态势怎么看?
唐杰:您刚才列举的这些产品,包括kimi、豆包、智谱清言,还有DeepSeek等等产品。这些产品其实都是非常好的,他们背后基本上都是用了国产的大模型。
2022年11月30号,当时ChatGPT出来,ChatGPT被这个OpenAI发明出来以后就风靡全球。紧跟着2023年,文心一言和智谱清言被发布出来,很快豆包这些都发布出来,全国最早一批的大概有八家。到现在估计所有的用户基本上都在用大模型开始做问答搜索这些相关的一些应用。
可以说在问答和搜索相关的应用中,国内的模型跟国际顶尖模型之间的差距在收窄,这是第一个基本的一个现状。
另外一方面,我们也可以看到国际上顶尖大模型开始换赛道了。
比如说做编程开始做长程任务。当大模型开始编程,开始做这种长程任务,我们就需要把我们工作中的这些经历,以及经验交给大模型。那大模型它的能力就慢慢的具备在各个行业,各个场景里面工作的这个能力。这些能力是一步一步加进去的,在国际上和国内做的比较早,所以到现在确实是有一些优势。
第三个方面,其实还是要回到开源开放。因为只有开源开放,这使得我们在整个模型的研发,还有包括在全球的模型拓展上,包括这种工作流的这种释放的角度上,我们模型才占据自己的优势。
主持人:前不久,总部位于美国的AI开源社区抱抱脸遭遇了OpenAI模型的入侵。当时抱抱脸社区试图调用美国前沿的专用模型来修补漏洞,但是遭到了拦截。他们转而运行我国智谱旗下的大模型GLM5.2来救场,几个小时解决的问题。您作为智谱的创始人,作为现在智谱的首席科学家,您对这件事怎么看?这是不是说明我国的开源大模型比美国的闭源大模型更有优势,更有发展前景?
唐杰:这件事我们也非常关注,请允许我先把这件事从头到尾梳理一下。7月13号那一周,全球最大的AI开源社区Hugging Face,也就是刚才提到的抱抱脸,就遭到了这个大模型的一个入侵。
这个原因是什么呢?OpenAI当时是在一个封闭的一个环境下做一个实验,就是通过大模型来攻击软件。但是当时这个大模型一下子就跳出了这个封闭环境,结果就到互联网上攻击了Hugging Face。于是Hugging Face就调用了这些最顶尖的这些闭源模型。
一开始就调用OpenAI、Cloud这样的闭源模型去找,但是因为Open AI和Cloud他们又有很多防护栏,使得它其实没法真正的去调用。
那于是怎么办呢?Hugging Face就把我们的GLM5.2安装在本地,安装完了以后就构建了一个内部的一个封闭环境。然后在内部封闭环境就演练整个攻击的一个过程。最后通过这个攻击过程的溯源找到了这个原因。
这里面有几点可以借鉴和回顾的。
第一个就是开源的重要性。因为你没有开源的话,那Hugging Face根本没办法构建这个环境,他没法复盘,他也找不到这个攻击的原因。
第二个,确实这个安全、攻击和护栏都非常重要,既要有攻击能力,但是也要有防护能力。
要说这个开源是不是就比这个闭源一定有优势呢?这个结论下的也有点太早,就是从这个过程中,攻击还是OpenAI发起的,那“抱抱脸”为什么使用我们的GLM5.2呢?
原因还是这个闭源模型它没法用,所以他只能用我们的开源模型。我们没办法说GLM5.2就比这个GPT好,只能说GLM5.2通过开源的方式占领了这个生态位,这是第一个。
第二个其实也是值得反思的,就是可控性的一个价值。未来的大模型的发展是自己能看得见,能用得上,而且可审计可控制的一个大模型。这才是真正在实际应用中敢用、能用的一个大模型。
主持人:您提到过说很多学生你鼓励他们用大模型,甚至现在可能中小学生也可能以后就会用大模型。会不会造成我们基础知识掌握的不牢固,或者是说我们很多基本的知识技能退化。
唐杰:对,这是一个我被问的非常多的。我记得很多年前大模型刚爆发的时候,我跟几个朋友啊聊天的时候,我就说未来大模型发展会非常迅速,而且会所有的知识都会普及,而且进入我们的生活中。
很多朋友就问我,我们的孩子未来怎么办?该要学什么东西?我是觉得是两个维度来回答这个问题。
第一个维度就是技术发展到今天了,你不用了肯定是不行的。就好像当年那个蒸汽机出来以后,你说原来我们都会骑马,那你说骑马的这个技术我们还要不要掌握呢?
我觉得你可以看到今天其实大家已经很多人都不会骑马,或者骑马并不是为了跑得快,或者是用骑马来代步了,而变成了一个娱乐了。
所以我觉得第一个,这种新的时代产生了,这个新的工具来了以后,我们不得不用。这是我为什么鼓励我的学生,甚至我鼓励我孩子也都去用大模型。
当然另外一方面,就是说大家在以后大家这些基础知识掌握的不牢,可能都不会了,这该怎么办?
这是另外一个维度。我个人觉得确实是可能未来我们的技术站就变了,就是我们不再需要掌握原来的一些基础的一些知识点。其实还有一个维度是这样的,大模型,它使得我们拓展了我们的知识空间。
为什么这么讲呢?因为原来你可能光看书,你可能只能看一千条知识点,你能背住1000条知识点就不错了。但现在大模型使得你可能掌握了100条知识点,其他知识点只是简单涉猎。但是涉猎到1万条知识点,所以你的知识空间可能更大了。
主持人:有一本书叫奇点临近,作者库兹韦尔后来又写了一本书叫《奇点更近》,就讨论说2045年人工智能的智能会超越人脑智能。您对这个人工智能的发展方向是怎么看?机器会取代人吗?或者说机器的智力会最终超越人脑的智力,甚至统治人脑。有没有这种可能?
唐杰:我个人觉得是通用人工智能是全球所有人的智慧的总和。从这个维度上来讲,一个模型它超过一个人单个人的智慧,我觉得这是非常正常的。
因为一个模型它汇聚了全球所有的知识,而且我们所有的人的推理的逻辑逻辑思维方式,我们都交给了这个模型。最近我们也把我们的行为数据,包括我们所有的做事的工作流的数据交给了模型。
你想这个模型它既会工作又有知识,然后也知道情商也很高,也会逻辑推理,它就有全球所有的智力的一个总和。
有一天是不是这个大模型它要超越人类,超越全球所有的人类,产生出有很多我们都不知道的理论。这其实是一个问句。
当然这也是其实最近在硅谷,包括欧洲,包括中国这个业界非常热的,也就是我们把它叫ASI,就是artificial super intelligence(超级人工智能)。未来这个人工智能有没有可能产生超级智能超越人的。
当然还有一个技术,就是最近也是非常热的,就是recursive super intelligence(递归超级智能),就是让这个模型大模型它能不能自己修正自己,自己改进自己,让自己变得更厉害。
如果这个模型它能不断的改进自己,不断的修复自己,那他未来超越人类就是指日可待。
它有可能是这个曲线到了一个临界点就涨不上去了也有可能就像涨到全球人类的智慧的总和。所以至于未来这个大模型能不能超越全球人类智慧的总和,这是个问题。但是超越单个个体的智慧的能力,我觉得这是必然的。
主持人:我国的大模型发展势头良好,但您认为我国的大模型发展还面临哪些问题挑战,又该怎么来突破?
唐杰:关于这个挑战,我讲四个点。
第一个点其实我们现在还是面临很大的算力挑战。美国对中国的高端芯片限购,这使得我们中国的芯片确实存在着短缺。
第二个就是数据,数据永远都不嫌多,永远也不够。有很多行业因为各种原因,它的数据没办法共享出来,也没办法拿出来训练。但是大模型在扩展自己知识结构,扩展自己能做事,他又需要这样的环境数据,那这时候就形成了一个矛盾。
同时数据的短缺催生了很多行业,有很多专门做数据标注、数据产生、数据清洗的公司,其实这也产生了很多就业机会。
所以数据是第二个矛盾,但是也是第二个机遇点。
第三个,我们还是要回到原创性,我们纯粹的理论的原创性还有有些欠缺。
像最早的大模型的transformer架构,其实不是我们中国人提出来的,包括后面的强化学习和推理,也不是我们中国人提出来的。所以在这种基础理论的原创性上,我们还需要加强。
这也是我们这个团队当时从清华大学成果转化出来以后,我们转化了这个智谱华章公司。
当时我们就希望通过这种产学,在技术理论上记住这种基础的创新。同时应用场景上也做更大的一些扩展。当然我们也希望在未来能够在技术理论的原创性上做出一定的贡献。
主持人:谢谢唐教授,感谢您的解答与分享。


书享界保留所有权 |书享界 » 智谱AI创始人唐杰:国产大模型的差距、底气与未来
书享界