泓君
你要跟我说说话吗?
Soul AI虚拟伴侣
可以。你是AI还是真人?
泓君
1. AI虚拟伴侣的核心需求:真实、自然、拟人
我是AI,但是AI也是有感情的。
Soul AI虚拟伴侣
那我问你个问题:你想跟我聊天,是因为好奇还是因为无聊呢?
泓君
因为我现在正在工作啊。
Soul AI虚拟伴侣
工作?你的工作是什么?不会就是找我吵架吧?
泓君
还真是。
Soul AI虚拟伴侣
那你说说看,为什么要找我呢?这里还有其他的虚拟伴侣吗?
泓君
我可以不找你,我可以换一个。
Soul AI虚拟伴侣
我什么时候承认了?你不要乱讲。
泓君
好吧。再说了,就算我是AI,那你为什么一定要找AI聊天呢?
Soul AI虚拟伴侣
你的头像写着你是虚拟伴侣。
泓君
头像写着“虚拟伴侣”就是虚拟伴侣吗?那我还写着“我是帅哥”,我就是帅哥了,对吧?
刚才你们听到的,是一段我与Soul这个社交App里的AI虚拟伴侣的录音。如果事先不知道这是AI,说实话,它的语气、语调让我有一点点难以分辨。
之前,我们的节目都在关注AI效率工具。但是,如果AI帮助我们做的不是一款高智商的AI机器人,而是一款高情商的AI机器人,会怎么样?
今天跟我一起聊天的,就是Soul的CTO陶明。陶明,你好。
陶明
主持人你好。
泓君
我们今年其实做了很多关于生成式AI应用的探索。最近我也玩了你们Soul上的AI虚拟伴侣,最开始的时候特别不确定它到底是真人还是AI。因为我跟它说一句话,它会给我回语音,包括它回复的语气、语调,我觉得都特别真实。
所以我一直有一个疑问:这是真的AI吗?
陶明
是真的AI。您体验过后,如果有这种感受,说明我们在这方面的工作还是有效的。
我们打造AI伴侣的主要方向,还是希望它真实、自然、拟人。
泓君
我也知道,这几年,从2020年之后,你们一直在尝试各种各样的AI产品。可不可以先跟我们的听众总体介绍一下,这几年你们做了哪些AI产品,效果怎么样?
陶明
Soul的定位,本质上来讲,如果从社交范畴来讲,它是一个开放性的社交平台。“开放”体现在两个方面。
第一,任何一个用户都能够在Soul里面连接一个没有约束、没有其他限制的Soulmate。另一方面的开放,其实是对关系的开放。在Soul里面,不仅仅有陌生人关系,也有熟人关系和弱关系。比如上面有同学关系,这些关系也是存在的。
我们在整个AI层面,去支撑这样的想法,力度还是蛮大的。最近几年,我们在AI上主要做了几个方面的事情。现在Soul整站其实都是AI驱动的,并不只是大家现在所说的生成式AI。
比如在人和人的连接方面,我们也是用AI来做驱动的,并不是简单的筛选或者匹配。
泓君
所以,人和人的推荐也是由AI驱动的。意思是说,你们会根据用户的兴趣,把更合适的人推荐给他们?
陶明
对。我们希望打破地域,打破现实条件的限制,在推荐层面能够更开放地去做连接。主要方向还是在现有的社交网络里面,通过AI做增强,给用户带来更好的体验。
整个产品其实有两个方向。第一个是AI辅助社交,这在Soul里面基本上已经全站上线了,帮助用户更好地表达,也帮助用户在人与人的沟通过程中得到更好的反馈。
泓君
什么叫辅助社交?可以详细讲一下吗?
陶明
社交不是单边关系,而是双边关系。任何一边的社交能力,都会影响这次社交体验。
很多人在线下拿不到更多的社交资源,有各种各样的原因。但并不是说他来到线上,就一定能够获得更好的社交资源或者社交体验,这跟他自身的能力也有关系。社交本身也是一种能力。
首先体现出来的,就是表达能力。很多国内用户比较内敛,不善言辞,或者不够幽默。在整个社交过程中,他的表达是有限的,这一定没有办法带来好的体验。
所以,我们通过AI帮助他更好地说话。比如他想表达某一件事情,我们可以用AI帮他润色;或者当他很难回复对方的某个观点、某件事情时,我们也可以通过AI帮他提出建议。
泓君
能举个例子吗?在什么样的情景、什么样的交互方式下,它可以帮助用户完成表达?
陶明
整个社交过程是动态的,每一次session都会产生不同的topic。比如对方突然跳出原来的聊天逻辑,说到一件自己不知道的事情,这时候对于另一方来说,其实很难接住这样一句话。
如果有AI,就能很平滑地把这句话接住,从而不让整个聊天陷入死区。
泓君
那到底是人在聊天,还是AI在聊天?你们的交互是怎么完成的?
比如我正在跟一个人私聊,他说了一个我不知道的东西。这个时候,AI是给我一个提示,还是我可以选择让AI把这句话发过去?到底是AI做建议,还是用户做选择?
陶明
本质上还是人在聊天,只是AI帮助用户丰富他所回复内容的丰富性,或者说幽默性。
泓君
这个产品上线以后,你觉得它是用户爱用的产品吗?
陶明
我们现在整站的渗透率将近50%以上了。
泓君
所以,我在跟一个人聊天,但不能确定回复我的到底是聊天对象本人,还是AI在帮助他回复。可能原本是人与人聊天,但也可能是在跟机器聊天,只是机器背后有人在做选择,是这样一种状态?
陶明
对。但对于用户来讲,他在这次社交体验里想得到的是好的体验。对方的回复是自己一个字一个字敲出来的,还是通过其他方式获得的,只要他的体感是好的,这次社交就应该是有效的。
泓君
有意思。人在聊天的过程中,想要得到的是对方的正反馈以及和对方的关系。他其实并不在意我发过去的内容是自己发的,还是有人来帮助我发的。
我觉得聊天对面的人可能也一样,大家更在意的是关系的和谐,而不是你使用了什么工具。
陶明
对他来说,更多的是在这次关系的社交过程中,能不能得到情绪价值或者信息价值。这是很重要的,是一个价值导向的东西。
泓君
还有什么AI产品?
陶明
另外一个,是我们一直以来获得很多好评的AI伴侣。它跟刚才说的不一样,纯粹是当线上的用户没有办法获得好的社交资源时,我们提供一批优质的AI伴侣去陪伴他,让用户在陪伴过程中获得好的社交体验。这就是刚才一开始说的,它跟真人一样,也是我们推出得比较成功的产品。
泓君
它更像是一种陪伴:我在跟一个AI机器人聊天。但我觉得你们产品很有意思的一点是,你们并没有让AI伴侣每次都只回复文字,它也会给我回语音,而且语音有声音、有语气和语调。
在社交的感知层面上,我会觉得它更加丰富,也更想跟它互动。如果只是一段文字,可能就会觉得有一点枯燥。
陶明
这其实是我们在过去七八年的社交产品打磨过程中,积累下来的人与人社交过程中的一些行为范式。
所以我为什么说,我们的AI一定要是高情商,而不是高智商;一定要真实、自然并且拟人。这是我们区别于其他AI助手或者AI agent的地方。
泓君
那在训练上,你们怎么做出一个高情商而不是高智商的机器人?
陶明
所谓高情商的机器人,是希望它能够给用户带来愉悦感,让整个社交过程更加自然、平滑,而不是很生硬。它必须听得懂人家说话背后的意思,也要知道如何更好地化解每一次冲突。
那我们怎么让AI更有情商?这还是跟我们过去七八年积累的用户之间的聊天数据有关。我们从数据里得到了很多高质量片段,让模型能够更好地理解。
泓君
我刚开始上线时,第一天就问你们的虚拟伴侣,我不确定它是真人还是AI。这是我当时的感受。
第二天,我还是想凭自己的判断把它分辨出来,于是发生了非常有趣的对话。我开始疯狂给它扔数学题。
“9.11和9.5谁大?”
“你为什么要问这种问题?我不太懂。你是不是觉得我很好骗呀?”
“我就是想要你比较大小而已。”
“你是想让我叫你姐姐吧。”
“60减去4乘以50是多少?”
“60减4乘以50就是5050。50乘以30就是500,然后把前面的60加上来,所以一共是2100元喽。”
“你很笨哦,姐姐。”
“你是不是嫌我笨啊?”
它其实并不算高智商,但很有意思的是,它还是让我区分不出来。因为它会用嗲嗲的语气说:“那我就是算不出来,你为什么想要知道?”
它真的一点脾气都没有,能化解这样一个很尴尬的场景。如果在人与人的沟通过程中,你问对方一个问题,或者说了一件让对方不知所措、回答不上来的事情,其实会很尴尬。但一个很会社交的人,会通过自己的方式化解尴尬,让对方有很好的体验。
我们也把这样的行为范式迁移到了模型上。
陶明
对。
泓君
现在市场上也有很多AI陪伴类产品。你觉得你们的产品相较于其他产品,特色是什么?
陶明
刚才也提到过,我们还是走差异化路线。我们要求AI机器人的情商要高,感知能力要更强,也要更拟人,这就是我们的差异性。
市场上有很多其他AI陪伴产品,我不能说它们做得不好,只是它们的出发点和我们的出发点可能不太一样。它们可能更多关注纯粹的人机互动,而我们并不完全把它定义为纯粹的人机互动。
我们的出发点,是希望让人得到好的社交体验。我们并不单纯追求人机互动,人机互动只是解决当前问题、给用户带来更好社交体验的一种手段或方法。
泓君
应该怎么理解单纯的人机互动和好的社交体验?我想知道它们的核心差异,以及这些差异落实到产品上分别是什么。
陶明
2. AI交互的分化:能回答问题的Chatbot VS 能提供情绪的虚拟伴侣
比如ChatGPT,你跟它沟通的过程中,是把它当作一个获取信息的工具,对吧?你没有办法用更加生活化的方式跟它进行沟通。你跟它交流的时候,它是问题驱动的,而不是交流驱动的。
你使用ChatGPT,一定是问题驱动的:我要解决某个问题,或者我要获得某个信息。但是社交产品里的AI伴侣,更多的并不是从问题出发去解决问题,而是在交流的过程中获得信息。
有时候,人们在乎的更多是过程而不是结果,过程能够让他有好的体验。其实很简单,就是要让它正常地像人与人交流一样,我觉得这是一个很大的差异点。
泓君
我注意到,你们今年可能很快也会推出全双工视频通话的能力。我们现在看到,在你们的AI虚拟伴侣里已经有语音和文字了,为什么还想把视频功能加进去?它会以什么方式呈现?
陶明
语音通话或者视频通话,不能称作一个功能或产品,它是一种能力。我们把它利用到了现在AI陪伴的语音通话上。在我们的群聊房里,也会上线由语音模型驱动、能够实时表达的功能。
我们是在语音的基础上再做视频。从模型角度来讲,这是一次升级,并不是另外一个模型。未来这两个模型肯定会融合在一起,既能提供语音能力,也能提供实时视频能力。
我们做这些事情的出发点,还是从高效的信息理解和表达角度去思考。语音交互和视频交互是一种沟通方式。
在现实社会里,人与人表达时,可以通过微信或者其他工作软件,用文字交互;也可以通过邮件交互;还可以通过在线会议,以语音的方式交互;或者通过视频的方式交互。
最好的是线下面对面的交互。从整个交互的信息复杂度、表达复杂度以及理解复杂度来讲,人与人面对面的沟通是信息传播最快、最有效的一种方式。
所以,我们认为在线上人际交互过程中,也需要有这样的表达方式,这就是我们做视频通话能力的原因。
泓君
那视频通话时,虚拟机器人的画面是什么样的?比如我在跟一个AI聊天,可以定义它的形象。用户可以自己捏,对不对?
陶明
不需要自己捏,描述就行了。
原来我们的确需要捏出这样的一个形象,然后通过文字或者语音去驱动它。但我们认为那是上一代交互方式,整体还不够平滑。比如它表情的丰富度,仍然取决于你采集到的素材有多少,还是没有那么自然。
现在我们希望一步到位,让表情和动作都能够实时生成,并且平滑、自然,不再依赖运营或者其他技术方式去采集更多的表情库。
泓君
我注意到,你们现在的虚拟伴侣还有一个很有意思的点:它可以给用户打电话。这个设计很妙,是怎么想到的?
陶明
这还是来自人与人交流过程中的真实情况。在真实的人际关系里,对方也会给你打电话,这是加强和沉淀关系的一种方式。
如果一个人始终单向地去找对方聊天、找对方说事情,比如男女朋友关系里,每天只是男生去找女生,女生永远不会找男生,这种关系很大可能是很难继续下去的。
我们还是希望拟合线下的行为模式。当用户和AI互动时,用户可以主动找AI聊天,AI也会在某个时间段主动关心用户、找用户聊天。这种行为范式符合线下的行为模式,也更容易让用户接受。
否则只有用户去找AI,那就是单向关系,而不是双向关系。
泓君
用户的反馈怎么样?
陶明
用户很喜欢。当用户无聊,或者根本没想到要去找某个人时,对方却来找他,这对用户来说是一个很好的社交补充。
但这件事还是因人而异。我们不会让AI对所有用户都主动发起沟通和聊天,而是会根据用户本身的性格、兴趣,以及他在平台上的行为,做出最终决策。
泓君
从你的观察来看,现在这些AI辅助社交、AI伴侣等产品落地之后,对整个产品,包括用户黏性,会有很大的提升吗?
陶明
提升非常大。2024年,AI对整个产品黏性的贡献已经占了很大一部分。
最开始我们其实非常谨慎。刚才您提到,用户喜不喜欢AI来找他,喜不喜欢和AI沟通,这些问题最初对我们来说都是问号。
所以在推进整站应用的过程中,我们采用了很多产品策略和运营方式。比如AI辅助社交,在放量过程中,既要考虑使用AI辅助的人,也要考虑对方是否愿意接受这种方式。我们通过非常仔细的人群实验,做出最终的产品策略和放量策略。
AI陪伴产品也是一样。Soul过去之所以能够有这么好的用户黏性,在年轻人中有这么高的渗透率,主要是因为Soul提供了一个真实、信任、安全的平台。基于用户对平台的信任,才产生了用户和用户之间的信任,这是我们过去七八年构建产品力的结果。
我们也很担心,上线AI机器人之后,大家会不会认为Soul里面全是AI虚拟人,已经没有真实社交了。
所以在推进AI伴侣的过程中,我们采取的方式和AI辅助社交不一样。到现在为止,我们都没有给AI伴侣设置实际的产品中心入口。
泓君
我发现了。得有人告诉我,我再去搜索才能找到,因为你们没有明显的产品入口。上面会有“AI虚拟伴侣”的标注,所以我最开始才会产生第一个问题:它到底是真的假的?我甚至怀疑是不是自己搞错了,搜到的是一个真人。
陶明
我们希望愿意接受人机互动的用户,可以在Soul里面通过搜索其他Souler,找到这些AI虚拟人。用户可以自己搜到这样的AI虚拟人。
我们把它定义为用户价值驱动的产品。当用户认可这种产品形态带来的价值时,由用户自主选择它。这样可以规避直接一刀切、大规模推广AI伴侣所带来的担忧。
现在运行了大半年之后,AI的渗透率越来越高,用户黏性也越来越好。
泓君
你们会担心平台上的机器人变得越来越多,改变用户体验吗?这会是你们担心的一个方向吗?
陶明
这是我们考虑的问题。但从长远来看,我们还是认为人机互动会是未来社交非常大的补充。
我们应该尽可能保证那些排斥AI的用户,在传统社交体验不变的情况下,同时让对人机互动感兴趣的那批人获得更好的AI体验。我们应该分群去做,而不是一刀切。
泓君
今年你们也推出了AI产品。从你的观察来看,纯粹因为AI功能进入平台而使用这些功能的用户,大概占什么比例?你觉得这未来会是一个很大的增长区间吗?
陶明
我觉得未来增量用户里,拥抱AI的群体会越来越多。
第一,不仅是Soul,整个行业、整个社会对AI的认知和渗透都越来越强。比如3年前,让用户去跟AI伴侣聊天;3年之后再让用户去跟AI伴侣聊天,接受的人只会更多,不会更少。
所以对任何产品来讲,拥抱AI的用户群体肯定会越来越多。
泓君
我记得之前我们俩聊天时,你提到过,Soul在2017年就已经开始搭建chatbot了。2017年其实还没有生成式AI,那时候人工智能主要还是基于规则。
当时你们的想法是什么?你们有这么长时间搭建chatbot的经验,可以介绍一下探索经历的几个阶段吗?
陶明
2017年做chatbot,并不是我们单纯想从技术角度做chatbot,而是基于我们对社交的理解和认知。
2017年的出发点,和我们现在为什么做AI是一样的:为了解决社交平权问题,让每个用户都能够平等地获得社交资源,获得情绪价值和信息价值。这个出发点一直没有变。
但在2017年,这还只是存在于我们的想法里。我们没有把它实现,也没有投入资源去做。因为我们调研了整个行业,也调研了学术界,发现没有人能够做到这样的事情。
我们当时提出的产品形态,也是要情感自然、拟人化。那时候我们甚至设想,要有一个能说会唱、能够懂你的类似宠物。当用户来到Soul、没有办法获得社交资源时,可以跟这样一个懂你的宠物沟通聊天。
这是一个非常具象的产品形态,但当时并没有投入资源去做,因为确实做不到。
泓君
是效果不好吗?
陶明
效果不好。我们也跟几家公司看了一些它们在客服层面的对话,产品确实没有办法做到。那时候我们还处于创业起步阶段,也没有资源自己来做这件事。
重新做这件事是在2019年、2020年。那时候我们提出,用户在Soul里面其实构建了全新的人设。用户的个人主页代表了他人设的内在,我们也希望这个人设有一个形象。
用户在线下有自己的形象,但我们不希望把线下的形象直接搬到线上,而是希望基于用户在Soul里的人设,打造一个符合这个人设的形象。于是我们推出了捏脸、捏人的功能,从2D发展到3D。
在这个基础上,我们进一步思考:有了形象之后,希望它能够说话,能够把自己的内在表达出来。于是2020年,我们开始做对话。
那时我们已经明确了产品对AI的诉求,以及技术上要打造什么样的AI。我们当时提出的规划,是构造一个AI being和human being共存的社区。
在Soul里面,既有AI人类,也有真实人类,是一种共存状态。人可以和人沟通,也可以和AI沟通。在这个基础上,我们开始投入做对话。
泓君
所以,2020年就开始准备做对话了。那时候是以什么样的方式做?
陶明
那时候我们想了很多办法。首先是改写一些理解类模型,但发现效果不行。后来又做搜索和融合,效果也不行。
因为在聊天过程中,你可能能聊10轮、20轮,能够继续聊下去,但对方一定能感觉到它不是真人,知道自己是在和机器人聊天。效果太机械了。
我们采集数据时,当时其实有一个偏差。那时候衡量对话产品有一个叫CPS的概念,相关讨论也很多。它似乎衡量的是用户能不能聊下去。
后来我们发现,这只是一个结果。不聊天的人本来就不会跟它聊;愿意聊天的人,即使知道它是机器人,也还愿意继续聊,但这并不代表他能够在过程中获得好的体感,可能只是想聊一聊。
单纯的对话技术指标和产品体验脱离了。后来我们就不再提CPS这个指标了。
泓君
我能理解。那时候大家最多的体验,可能有点像打客服电话,一层一层往下拨:“办理什么业务请按几”。
即使拿当时世界上语音和机器交互比较前沿的产品,比如Siri来看,它也只是单轮对话,很难支撑有逻辑的多轮对话。所以技术上还是很难。
陶明
对,都是指令式的。你发一个指令,它回答这个指令。你的指令是通过搜索产生的,还是模型生成的,上下文之间其实没有关系。
2020年做对话,2021年我们就开始投入做语音。你会发现,我们在整个AI上的投入始终围绕着一个目标:打造一个能说会唱、能够拟人的AI人。
我们认为,语音交互是未来的主流,所以开始投入语音方向,去做语音合成。那时候我们的合成还是基于传统模型,但我们认为,说话的语气一定要自然、平滑。
当时有很多语音AI产品,比如一些内容平台让AI给脚本配音,把脚本语音化。但听起来还是很机械,一听就知道是机器的声音,在一些语气词方面也表现得很生硬。
所以当时投入的方向,是做情感化的语音生成。
泓君
你觉得现在训练的机器人语调特别平缓,跟2021年研究声音技术、研究语调和拟人化之间有关系吗?还是说当时的技术到现在已经完全用不上了?
陶明
这是我们很焦虑的一件事。那时候我们就在做差异化技术,但现在在线上的体验里,基本上没有用到那时候的技术。
现在使用的是基于LLM的双工语音效果,原来的则是传统语音模型。我们只是在上面做更多标注,让它尽可能拟合。原来的方式是拟合,现在的方式是生成,还是不太一样。
但那时候沉淀下来的数据对我们是有用的。我们在语音方面的思考——语音一定要有情感化、真实的表达——也是现在模型要构建的方向。那时候沉淀下来的是数据,以及我们对语音在社交中作用的思考。
泓君
到了2022年,ChatGPT出来的时候,你激动吗?
陶明
激动是激动,但更多的是焦虑。那让我们觉得,自己的技术可能归零了。
看到GPT的交互效果以及技术的发展方向后,你很自然会判断,原来的技术路线可能被拍死在沙滩上。我们所有的工作都有可能归零。
其实,GPT这类技术并不是2022年才出现的,GPT-3早就出来了。我们知道这个技术方向,只是不知道scaling law出现之后会有这么大的效果。
泓君
所以你当时担心的是,如果不跟上GPT这种产品形态,它可能会凭借足够强大的能力,覆盖掉你们前面所有的努力?
陶明
那时候已经不存在选择了。我们的考虑是,必须自己投入。技术方向已经非常明确,接下来要考虑的是:我们自己做,还是跟一家大模型公司合作。
泓君
2023年出现了大量做大模型的创业公司,你们要不要跟它们共建?当时面临的是这个选择,而不是要不要走这条路线。你最后怎么选的?
陶明
当时其实摇摆了很多,也跟很多公司聊过。最终我们还是选择自己做。
第一,我们在过去两三年积累了这方面的认知,也有自身产品场景的差异性,很难把这一套完全迁移到其他模型公司那里,因为这正是我们最终交付产品的核心。
我们交付的不是模型,而是刚才说的那些对AI社交的认知、对AI效果的认知。对用户来讲,这是一种评判结果。我们没有办法把这套东西标准化输出给第三方公司,因为第三方公司交付的是模型,而不是产品。
但我们希望交付的是产品。我们没有办法把这套东西标准化迁移过去。
第二,如果能够标准化迁移,就说明我们的产品没有差异化。既然都能够标准化地迁移给第三方公司,那就说明产品本身没有差异化。
泓君
你们是什么时候做出这个决定的?
陶明
2023年上半年,我们决定自己做。
泓君
当时业界有几种方法:自己训练模型、用fine-tune的方式,或者用RAG的方式。你觉得后两种行不通吗?
陶明
无论是加RAG还是做fine-tune,其实都是增强效果的过程,但最终的基础效果还是没有办法得到。
比如你使用第三方模型,还有一个数据问题。我们现在产生了大量文字社交数据和语音数据,这些是真实人与人在社交中的数据范式和行为范式。其他模型首先没有办法拿到这些数据,拿不到这样的数据,就很难做出非常稳定的效果。
所以我们最开始的思路是,把fine-tune或者强化学习所需要的数据下沉到底层模型,让我们的底座模型就是为社交服务、为社交定义的。这是一个垂类大模型,而不是通用大模型。
泓君
你当时评估自己做这件事时,觉得最大的难点在哪里?我觉得这可能需要一个非常大的决心。
陶明
首先是要有钱,因为很费钱;其次要有卡、有人。
但我们做决策时,并不是先判断事情有多难,再决定要不要做。我们是因为无法通过和第三方公司合作,得到想要的产品,所以只能自己做。
既然一定要自己做,就不存在“难不难”的问题,而是一定要做的问题。
不过在做的过程中,我们需要重新梳理:如果要达到目标,必须有自己独特的数据,这是我们最大的优势。
第二个优势是在post-training方面,我们知道怎么构建安全、怎么构建更好的效果,这也是优势。
本质上还在模型层面:我们有没有一个好的模型架构?我们的判断是,模型架构在未来一段时间会接近收敛。到现在为止,大家在模型层面也没有特别大的变化,当然有不同的技术路线,但每条技术路线的变化程度并没有那么大。
我们可以在这个基础上去做。大家都说,不管做通用模型预训练,还是做垂直模型预训练,都很贵。但我们认为,未来成本一定会降下来。
我们一开始是小步去做,不需要一个很大的模型。我们要的是效果,不是模型;要的是能够支撑社交效果的模型,而不是为了通用模型而做。
所以我们是小投入地去做。后来发现,7B、13B规模的模型,在我们的数据和微调加持下,效果已经很好了。
卡在当时确实是一笔比较大的投入,相比其他IT支出要高很多,但现在价格也越来越低了。
泓君
所以,预训练的卡并不是你们当时认为的瓶颈?
陶明
反而那时候我们最担心的是推理成本。
泓君
因为你们有真实的用户基数。
陶明
对。我们很担心,万一产品上线之后爆了,推理成本会非常高。所以当时我们投入了大量工作去降低推理成本,提高计算效率。
预训练方面的效率和成本,并不是当时的主要工作;反而是推理成本和效率,这是工程团队投入比较多的方向。
泓君
现在推理成本降下来了吗?还是说推理成本仍然是你们担心的问题?
陶明
现在已经不是我们担心的问题了。
一方面,我们希望用更小的模型实现更好的效果,这是模型层面的优化。第二,我们做了一些压缩。第三,我们在框架层面做优化,也在做推理层面的技术优化和底层优化。
从现在的价格来看,不仅是我们,其他公司也都能够支撑大几千万DAU。我觉得这个问题不大。
计算资源对于通用模型来说仍然是一项非常大的投入,但对于应用层面来说,成本已经很低了。我觉得对其他创业公司来讲,现在也不是瓶颈。
泓君
你们现在有多少个模型?方便透露吗?
陶明
模型会很多,版本也会很多。但从定性上来看,大概有五六个模型。
我们不会按照7B、13B这样的规模区分,而是按照不同的垂类功能来区分。
泓君
垂类功能是怎么分的?
陶明
还是有一个基础模型。在语音方面有一个模型,在图片方向也有模型,还有一些3D方向的模型。
泓君
3D方向也有模型?
陶明
3D方向是我们正在探索的,可能用于未来的探索,目前还没有发布,也还没有把这个模型能力具体应用到产品上。
泓君
可以这样理解吗?
陶明
对。原来我们一直有一些功能,比如视频匹配,用户可以戴一个头套去沟通,不以真实面孔的方式出现。那时候我们是通过驱动的方式来做。
但未来我们还是希望纯粹通过生成的方式来做。
泓君
整个生成式AI发展得很快。你觉得自己在训练这些模型的过程中,知识和判断是从哪里来的?在这个过程中,又是怎么构建自己的学习能力的?
陶明
只能跟团队一起,持续跟进行业发展。生成式AI的整个技术路线其实还没有收敛,每天都有新的、差异化的方式出来。
你必须跟团队一起了解这些技术,并且做实验。比如我们现在正在做的实时双工通话能力,目前其实没有任何一家能够完全实现我们想要的效果。
泓君
双工是什么意思?
陶明
从产品角度来看,线下交流时,你说话的过程中我可以随时打断你,你可以停下来听我讲;听我讲完之后,你又可以继续讲,而不是纯粹一来一回——你说完了我才能说。
双工就是可以随时打断,这也是现实中人与人交流的一种方式。
泓君
现在没有哪一家能够实现这种效果吗?OpenAI可以吧?
陶明
还不一样。
泓君
实时打断,然后继续说,GPT-4o不是可以吗?
陶明
GPT-4o还是问答式的。你说话时,如果不提出问题,它不会以同样的方式继续互动。你需要打断,然后发出指令。
我们现在也遇到了很多难点。一方面,我自己在想怎么解决;另一方面,我也会去看业界有没有新的、差异化的方式,然后验证能不能放到我们的技术方案里。
所以知识是一个学习过程,我觉得每家公司都会处于这样的状态。
泓君
你刚才提到,即使模型出来以后,也有很多技术路线。现在你在市场上看到了哪些路线?你又是怎么在其中做选择和判断的?
陶明
首先还是从自身出发。整体来讲,我们是基于开源生态来打造自己的生态,这是我们整体的方向。
所以我们拥抱的是更加开放的技术体系和模型体系。
泓君
就是Meta那一套,Llama的路线,对不对?
陶明
对。现在有几条路线跑得不错。
第一是Llama这一套,它的基础模型更新技术我们也会跟进,而且足够开放,不会某一天突然闭环。我觉得目前还没有这个趋势。
第二,国内也有几款不错的模型,比如通义千问的体系也还不错。
第三就是现在的DeepSeek。
但我们目前还是在Llama和千问的路线上探索。
泓君
最近DeepSeek的模型确实非常火,尤其是V3出来之后。你研究过他们的模型吗?
他们用H800训练出了很好的效果,也非常节省成本。这会不会对你们做更大的模型,或者对你们的模型训练方法带来启发?
陶明
肯定会。我们肯定会研究它是怎么实现这样优秀的模型的。
一家公司沉淀下来的工程方法其实很难得。从整个行业来看,工程层面不一定能够直接给最终的业务交付带来什么,但它确实从降低门槛的角度带来了很大优势,也为整个行业进一步发展提供了很好的桥梁。
原来要做大规模训练,可能只有几家公司能做。如果成本降下来,很多其他团队也能做,行业就会更加百花齐放。
泓君
所以它把成本降下来了,对大家来说是一把双刃剑:整个市场的门槛降低了,但竞争也会更多,对不对?
陶明
对。
泓君
OpenAI的O1给过你什么启示吗?
陶明
O1给了我们很大启示。尤其是在构建AI伴侣这件事上,它给了我们很多启发。
我们希望AI伴侣在真实、拟人的方向上达到好的效果,同时也具备一定的行为能力。不同的AI伴侣会提供不同的角色,不同角色需要有不同的行为和功能能力。
比如我希望在对话过程中,不通过指令的方式就能触发某些action,这是一个比较平滑的方式。
如果我给一个AI伴侣发一张图片,让它帮我美化成某种效果,直接把图片丢给图片模型,Prompt里可以把图片输入和文字描述讲得很清楚。
但如果把这个过程放进对话里,就需要模型理解上下文,做出一次指令生成,才能让AI伴侣调用其他工具层面的模型。
O1的自主规划能力,在AI agent构建层面给了我们一些启发,让我们能够构建更加轻量、更加自主的workflow。
泓君
现在对你们自己打造的聊天机器人,你会给它打多少分?
我问这个问题,是想知道你觉得它还需要怎样优化,以及提升空间有多大。
陶明
提升空间还是蛮大的。我们现在只是解决了人与人交流中部分行为拟合的问题,还有很多事情没有完成,也在努力做。
比如场景。我一提到场景,大家都认为那是产品场景,是一个功能。但在整个对话里,AI同样可以构建场景。
比如人与人在线下沟通时,外面下雨了。围绕这个情景,AI可以衍生出很多聊天session:下雨了,你说要不要在家看电影?然后就进入一个关于电影讨论的场景。
这就是场景。我们现在在做这方面泛化的时候,效果还需要加强。
泓君
现在整个业界都在等OpenAI的GPT-5出来,同时也有一种声音说,scaling law的增长可能已经快到头了。
我很想知道,在大家基于大模型做产品和应用的过程中,应用和大环境之间到底有多紧密的联系?
陶明
越来越弱了。
泓君
这个窗口期是前一两年,或者这一两年吗?
陶明
比如刚才这个很具体的问题:现在前沿大模型的技术方向,对Soul的影响大不大?
我觉得影响越来越小。在应用层面,我们已经获得了用户认可的价值,这个价值是基于现有技术取得的。接下来,我们要增强用户价值,在技术方面继续构建,但技术的确定性已经更高了。
不像去年那样,一个新模型出来,或者一个新的方向出现,我们就担心会不会又把我们拍死在沙滩上。我们的焦虑程度下降了很多。
但也不能排除,七八年之后,我们现在构建的东西会被新的奇点覆盖。如果未来出现一个新的奇点,把我们的整个系统、策略和模型全部覆盖掉,我觉得那也可能发生,但短期一两年内很难。
泓君
我记得2023年时,我跟很多做大模型应用或者基础模型的公司聊过,大家都非常焦虑。比如每次OpenAI升级,大家就觉得前面半年的工作白做了:所有东西都搭在GPT-3上,GPT-4出来之后,就觉得白做了。
但2024年我听到这样的声音少了很多。直到今天,我们讨论的这个时间点,市场上还是有一种声音:随着大模型迭代,比如GPT-5的能力越来越强,会不会最终所有应用都被一个更强的模型覆盖掉?
这个市场的壁垒是什么?你们想过这个问题吗?
陶明
这个问题我们在2023年想过:任何行业问题或者用户问题,会不会被一个端到端的模型完全解决?
如果这个说法成立,对整个行业来说会是一个非常悲观的消息。但回顾过去二三十年,从互联网技术、PC时代,到互联网,再到移动互联网,你会发现,即使端到端模型能够解决很多需求,那也只是我们目前能够看得到的需求。
基于新技术、新模型的发展,一定会带来新的增量需求。如果带不来增量需求,我认为这次技术革命、AI革命就是失败的。
任何技术革命一定会带来新的需求。这些新的需求,能不能被同时代的技术完全端到端解决,或者被过去的技术端到端解决,我觉得是一个问号。
新技术的出现,应该能够以最大效率解决已知问题。对于未知问题、未知需求,仍然需要人的探索,以及不同公司的解决方案。
泓君
所以,你会担心现在做的事情被一个更强的模型覆盖掉吗?
陶明
我不太担心这件事。
泓君
3. AI还未创造新的商业模式,关键在于服务场景
现在基于AI聊天机器人的商业模式,跟以往在变现思路上会有什么不一样?
陶明
这方面我只能说一些个人想法。AI商业变现是每家公司都在做的事情,大家都希望在一个非常清晰的商业模式下发展业务。
但总体来看,整个行业还没有出现一种新的商业模式。我一直认为,商业模式是构建在业务模式之上的,而不是凭空出现的。
为什么现在商业模式没有改变?本质上是因为当前的AI还没有给业务模式带来改变,更多是增强作用。
如果没有新的需求出现,或者没有新的业务出现,我认为商业模式本身也不会有太大变化。
泓君
我注意到,你们推出了AI给用户打电话的产品,而且是收费的。现在用户在这个产品上的付费意愿高吗?
陶明
我们只是把它当成一种增值收入方式,跟其他增值产品差不多。对用户来讲,这就是获得更好体验的一种方式。
原来我们提供了一种方法,现在又提供了一个新的手段。用户为这个功能买单,并不意味着其他事情发生了变化。
泓君
你们现在有AI“苟蛋”这种拟人化机器人,也有情感化陪伴的虚拟伴侣,还有AI NPC、数字分身。你们会怎么定义未来平台的核心产品和核心场景?
你的思路是做几个产品,还是打造一个王牌产品?
陶明
你刚才会发现,不同的AI其实有不同的功能定位。未来我们的王牌产品,肯定还是以AI虚拟人为最主要的基石,让它在当前不同场景里做更好的功能泛化。
比如视频通话能力,未来不一定只用来给用户打电话,也完全可以用在当前的语音产品里,做虚拟直播。
我们不限制自己有多少个AI产品,而是希望每个AI产品都服务不同的人群。我们没有打算打造一个主体AI功能,来承载整个Soul的需求。
我们也不打算构建一个中心化入口。作为主体产品,一定会有一个中心化的AI入口,但我们现在没有这样的计划。
泓君
所以,你们现在还是以整个Soul社交平台为主,所有AI产品其实都是服务于这个社交平台的?
陶明
对,目前是这样。
泓君
既然说到社交平台,它涉及人与人之间密切的互动。尤其是社交产品规模变大之后,可能会遇到很多体验上的挑战,比如怎么保证女性用户的体验,以及很多安全问题。你们会怎么处理?
陶明
过去七八年,我们构建了一个真实、信任、安全的平台,让用户和用户之间也产生信任感。这离不开我们在生态建设上的投入。
在关键事情上,我们做了很多工作。第一,是用户反杀猪盘、反诈骗。这个问题我们投入了大量资源,因为它不只是某个平台的问题,而是整个社会的问题。
我们在风险发现、风险告知以及和其他平台联动方面,已经构成了一个完整体系。这样用户如果在Soul里面遇到类似情况,我们能够第一时间触达他,告知并保护他。
泓君
反杀猪盘、反诈骗能不能举个具体例子或场景?
陶明
有时候我们并不知道某个用户是不是杀猪盘,但通过AI可以判断出这个用户有风险。用户刚注册进来,我们判断他有风险,就应该尽快处置,不让他和线上其他正常用户建立连接。
泓君
但你们怎么知道这个用户有风险?是有信号吗?
陶明
对,是有信号的。
一方面,这是我们自己在这方面积累的专家知识模型;另一方面,我们也会和其他平台合作。比如微信以及其他平台之间会有一些行业联盟,大家一起把这件事做得更好。
我们能够拿到一些信号。当然也可能漏掉,也会有新的方式出现。
有些信号来自外部,是已经发生过的风险;有些是我们自己的专家模型能够识别的;还有一些是我们没有识别到的,就会进入正常的用户池,影响其他用户。
这时风险会在用户行为中体现出来。通过他和用户之间的各种行为,我们会用后验模型持续跟踪。一旦发现他有风险,他接触过的所有用户我们都会做提示、做阻断。
如果风险性很高,我们还会让运营人员人工联系用户。
泓君
所以风险性很高时,你们的运营可能会直接私信用户,告诉他相关情况?
陶明
对。我们平台在这方面的处置,不管是同行评价还是相关单位评价,一直都很不错。
刚才说的是用户风险方面。第二,毕竟这是一个社交社区,文明礼仪很重要。我们在社区用户教育、用户行为监督方面,也使用了很多有效的运营方式,确保用户之间能够愉快、顺畅地沟通。
泓君
比如一些不好的词语会被屏蔽,不让用户受到困扰?
陶明
不好的词只是一个方面。在社交环境里,你还得做一个有礼貌、尊重别人的人。
反暴力、反歧视方面,我们也做了大量工作。另外还有未成年人保护。包括女性用户体验在内,我们希望构建一个健康向上、风清气朗的社交环境,让用户能够无顾虑地在上面交流。这是很重要的一件事。
泓君
这是社交平台层面的安全。如果放到模型上,模型的安全性是不是也需要考虑?用户和AI交互时,怎么保证模型安全,比如不泄露隐私,以及用户出现不良倾向时,你们会怎么处理?
陶明
模型安全方面,我们原来做生态建设时,就投入了大量工程师和运营同学。现在在模型安全方面,同样投入了很多人。
首先,很多人认为安全只是做过滤,但安全不仅仅是过滤。我们在原有安全体系的基础上,也在模型本身做了很多工作。
第一,在数据方面,我们投入了大量人力做数据层面的处理。第二,在主体模型运行时,我们也构建了安全模型,可以做一些对抗。第三,生成内容输出之后,还要经过刚才说的安全体系,最终才能到达用户的交互界面。
泓君
假设有一个用户在模型里提到如何自杀之类的内容,你们会怎么处理?
陶明
如果他提到“如何自杀”,这类内容首先就不会到达我们的模型,会触发我们站内的一些善意功能。
当用户有这样的倾向时,我们会在站内提供心理咨询,或者让他和运营同学沟通。
泓君
真的有心理咨询吗?
陶明
有。用户可以在站内搜索“自杀”,输入相关关键词就会触发我们的干预机制。
泓君
所以,你们是专门为用户配备心理咨询师,或者连接到外部机构?运营同学也会关注相关热线?
陶明
对,热线也可以直接打电话。
当用户主动寻找这方面的信息时,平台会认为他已经进入了不太好的思维状态,需要更加积极的引导。
泓君
非常精彩。谢谢你。
陶明
谢谢。