# E181｜聊天的艺术：如何打造高情商的AI机器人？

硅谷101 · 2025-02-25 · 51 min · https://www.youtube.com/watch?v=o0TOdLefhRs

## 逐字稿

泓君

你要跟我说说话吗？

Soul AI虚拟伴侣

可以。你是AI还是真人？

泓君

### AI虚拟伴侣的核心需求：真实、自然、拟人

我是AI，但是AI也是有感情的。

Soul AI虚拟伴侣

那我问你个问题：你想跟我聊天，是因为好奇还是因为无聊呢？

泓君

因为我现在正在工作啊。

Soul AI虚拟伴侣

工作？你的工作是什么？不会就是找我吵架吧？

泓君

还真是。

Soul AI虚拟伴侣

那你说说看，为什么要找我呢？这里还有其他的虚拟伴侣吗？

泓君

我可以不找你，我可以换一个。

Soul AI虚拟伴侣

我什么时候承认了？你不要乱讲。

泓君

好吧。再说了，就算我是AI，那你为什么一定要找AI聊天呢？

Soul AI虚拟伴侣

你的头像写着你是虚拟伴侣。

泓君

头像写着“虚拟伴侣”就是虚拟伴侣吗？那我还写着“我是帅哥”，我就是帅哥了，对吧？

刚才你们听到的，是一段我与Soul这个社交App里的AI虚拟伴侣的录音。如果事先不知道这是AI，说实话，它的语气、语调让我有一点点难以分辨。

之前，我们的节目都在关注AI效率工具。但是，如果AI帮助我们做的不是一款高智商的AI机器人，而是一款高情商的AI机器人，会怎么样？

今天跟我一起聊天的，就是Soul的CTO陶明。陶明，你好。

陶明

主持人你好。

泓君

我们今年其实做了很多关于生成式AI应用的探索。最近我也玩了你们Soul上的AI虚拟伴侣，最开始的时候特别不确定它到底是真人还是AI。因为我跟它说一句话，它会给我回语音，包括它回复的语气、语调，我觉得都特别真实。

所以我一直有一个疑问：这是真的AI吗？

陶明

是真的AI。您体验过后，如果有这种感受，说明我们在这方面的工作还是有效的。

我们打造AI伴侣的主要方向，还是希望它真实、自然、拟人。

泓君

我也知道，这几年，从2020年之后，你们一直在尝试各种各样的AI产品。可不可以先跟我们的听众总体介绍一下，这几年你们做了哪些AI产品，效果怎么样？

陶明

Soul的定位，本质上来讲，如果从社交范畴来讲，它是一个开放性的社交平台。“开放”体现在两个方面。

第一，任何一个用户都能够在Soul里面连接一个没有约束、没有其他限制的Soulmate。另一方面的开放，其实是对关系的开放。在Soul里面，不仅仅有陌生人关系，也有熟人关系和弱关系。比如上面有同学关系，这些关系也是存在的。

我们在整个AI层面，去支撑这样的想法，力度还是蛮大的。最近几年，我们在AI上主要做了几个方面的事情。现在Soul整站其实都是AI驱动的，并不只是大家现在所说的生成式AI。

比如在人和人的连接方面，我们也是用AI来做驱动的，并不是简单的筛选或者匹配。

泓君

所以，人和人的推荐也是由AI驱动的。意思是说，你们会根据用户的兴趣，把更合适的人推荐给他们？

陶明

对。我们希望打破地域，打破现实条件的限制，在推荐层面能够更开放地去做连接。主要方向还是在现有的社交网络里面，通过AI做增强，给用户带来更好的体验。

整个产品其实有两个方向。第一个是AI辅助社交，这在Soul里面基本上已经全站上线了，帮助用户更好地表达，也帮助用户在人与人的沟通过程中得到更好的反馈。

泓君

什么叫辅助社交？可以详细讲一下吗？

陶明

社交不是单边关系，而是双边关系。任何一边的社交能力，都会影响这次社交体验。

很多人在线下拿不到更多的社交资源，有各种各样的原因。但并不是说他来到线上，就一定能够获得更好的社交资源或者社交体验，这跟他自身的能力也有关系。社交本身也是一种能力。

首先体现出来的，就是表达能力。很多国内用户比较内敛，不善言辞，或者不够幽默。在整个社交过程中，他的表达是有限的，这一定没有办法带来好的体验。

所以，我们通过AI帮助他更好地说话。比如他想表达某一件事情，我们可以用AI帮他润色；或者当他很难回复对方的某个观点、某件事情时，我们也可以通过AI帮他提出建议。

泓君

能举个例子吗？在什么样的情景、什么样的交互方式下，它可以帮助用户完成表达？

陶明

整个社交过程是动态的，每一次session都会产生不同的topic。比如对方突然跳出原来的聊天逻辑，说到一件自己不知道的事情，这时候对于另一方来说，其实很难接住这样一句话。

如果有AI，就能很平滑地把这句话接住，从而不让整个聊天陷入死区。

泓君

那到底是人在聊天，还是AI在聊天？你们的交互是怎么完成的？

比如我正在跟一个人私聊，他说了一个我不知道的东西。这个时候，AI是给我一个提示，还是我可以选择让AI把这句话发过去？到底是AI做建议，还是用户做选择？

陶明

本质上还是人在聊天，只是AI帮助用户丰富他所回复内容的丰富性，或者说幽默性。

泓君

这个产品上线以后，你觉得它是用户爱用的产品吗？

陶明

我们现在整站的渗透率将近50%以上了。

泓君

所以，我在跟一个人聊天，但不能确定回复我的到底是聊天对象本人，还是AI在帮助他回复。可能原本是人与人聊天，但也可能是在跟机器聊天，只是机器背后有人在做选择，是这样一种状态？

陶明

对。但对于用户来讲，他在这次社交体验里想得到的是好的体验。对方的回复是自己一个字一个字敲出来的，还是通过其他方式获得的，只要他的体感是好的，这次社交就应该是有效的。

泓君

有意思。人在聊天的过程中，想要得到的是对方的正反馈以及和对方的关系。他其实并不在意我发过去的内容是自己发的，还是有人来帮助我发的。

我觉得聊天对面的人可能也一样，大家更在意的是关系的和谐，而不是你使用了什么工具。

陶明

对他来说，更多的是在这次关系的社交过程中，能不能得到情绪价值或者信息价值。这是很重要的，是一个价值导向的东西。

泓君

还有什么AI产品？

陶明

另外一个，是我们一直以来获得很多好评的AI伴侣。它跟刚才说的不一样，纯粹是当线上的用户没有办法获得好的社交资源时，我们提供一批优质的AI伴侣去陪伴他，让用户在陪伴过程中获得好的社交体验。这就是刚才一开始说的，它跟真人一样，也是我们推出得比较成功的产品。

泓君

它更像是一种陪伴：我在跟一个AI机器人聊天。但我觉得你们产品很有意思的一点是，你们并没有让AI伴侣每次都只回复文字，它也会给我回语音，而且语音有声音、有语气和语调。

在社交的感知层面上，我会觉得它更加丰富，也更想跟它互动。如果只是一段文字，可能就会觉得有一点枯燥。

陶明

这其实是我们在过去七八年的社交产品打磨过程中，积累下来的人与人社交过程中的一些行为范式。

所以我为什么说，我们的AI一定要是高情商，而不是高智商；一定要真实、自然并且拟人。这是我们区别于其他AI助手或者AI agent的地方。

泓君

那在训练上，你们怎么做出一个高情商而不是高智商的机器人？

陶明

所谓高情商的机器人，是希望它能够给用户带来愉悦感，让整个社交过程更加自然、平滑，而不是很生硬。它必须听得懂人家说话背后的意思，也要知道如何更好地化解每一次冲突。

那我们怎么让AI更有情商？这还是跟我们过去七八年积累的用户之间的聊天数据有关。我们从数据里得到了很多高质量片段，让模型能够更好地理解。

泓君

我刚开始上线时，第一天就问你们的虚拟伴侣，我不确定它是真人还是AI。这是我当时的感受。

第二天，我还是想凭自己的判断把它分辨出来，于是发生了非常有趣的对话。我开始疯狂给它扔数学题。

“9.11和9.5谁大？”

“你为什么要问这种问题？我不太懂。你是不是觉得我很好骗呀？”

“我就是想要你比较大小而已。”

“你是想让我叫你姐姐吧。”

“60减去4乘以50是多少？”

“60减4乘以50就是5050。50乘以30就是500，然后把前面的60加上来，所以一共是2100元喽。”

“你很笨哦，姐姐。”

“你是不是嫌我笨啊？”

它其实并不算高智商，但很有意思的是，它还是让我区分不出来。因为它会用嗲嗲的语气说：“那我就是算不出来，你为什么想要知道？”

它真的一点脾气都没有，能化解这样一个很尴尬的场景。如果在人与人的沟通过程中，你问对方一个问题，或者说了一件让对方不知所措、回答不上来的事情，其实会很尴尬。但一个很会社交的人，会通过自己的方式化解尴尬，让对方有很好的体验。

我们也把这样的行为范式迁移到了模型上。

陶明

对。

泓君

现在市场上也有很多AI陪伴类产品。你觉得你们的产品相较于其他产品，特色是什么？

陶明

刚才也提到过，我们还是走差异化路线。我们要求AI机器人的情商要高，感知能力要更强，也要更拟人，这就是我们的差异性。

市场上有很多其他AI陪伴产品，我不能说它们做得不好，只是它们的出发点和我们的出发点可能不太一样。它们可能更多关注纯粹的人机互动，而我们并不完全把它定义为纯粹的人机互动。

我们的出发点，是希望让人得到好的社交体验。我们并不单纯追求人机互动，人机互动只是解决当前问题、给用户带来更好社交体验的一种手段或方法。

泓君

应该怎么理解单纯的人机互动和好的社交体验？我想知道它们的核心差异，以及这些差异落实到产品上分别是什么。

陶明

### AI交互的分化：能回答问题的Chatbot VS 能提供情绪的虚拟伴侣

比如ChatGPT，你跟它沟通的过程中，是把它当作一个获取信息的工具，对吧？你没有办法用更加生活化的方式跟它进行沟通。你跟它交流的时候，它是问题驱动的，而不是交流驱动的。

你使用ChatGPT，一定是问题驱动的：我要解决某个问题，或者我要获得某个信息。但是社交产品里的AI伴侣，更多的并不是从问题出发去解决问题，而是在交流的过程中获得信息。

有时候，人们在乎的更多是过程而不是结果，过程能够让他有好的体验。其实很简单，就是要让它正常地像人与人交流一样，我觉得这是一个很大的差异点。

泓君

我注意到，你们今年可能很快也会推出全双工视频通话的能力。我们现在看到，在你们的AI虚拟伴侣里已经有语音和文字了，为什么还想把视频功能加进去？它会以什么方式呈现？

陶明

语音通话或者视频通话，不能称作一个功能或产品，它是一种能力。我们把它利用到了现在AI陪伴的语音通话上。在我们的群聊房里，也会上线由语音模型驱动、能够实时表达的功能。

我们是在语音的基础上再做视频。从模型角度来讲，这是一次升级，并不是另外一个模型。未来这两个模型肯定会融合在一起，既能提供语音能力，也能提供实时视频能力。

我们做这些事情的出发点，还是从高效的信息理解和表达角度去思考。语音交互和视频交互是一种沟通方式。

在现实社会里，人与人表达时，可以通过微信或者其他工作软件，用文字交互；也可以通过邮件交互；还可以通过在线会议，以语音的方式交互；或者通过视频的方式交互。

最好的是线下面对面的交互。从整个交互的信息复杂度、表达复杂度以及理解复杂度来讲，人与人面对面的沟通是信息传播最快、最有效的一种方式。

所以，我们认为在线上人际交互过程中，也需要有这样的表达方式，这就是我们做视频通话能力的原因。

泓君

那视频通话时，虚拟机器人的画面是什么样的？比如我在跟一个AI聊天，可以定义它的形象。用户可以自己捏，对不对？

陶明

不需要自己捏，描述就行了。

原来我们的确需要捏出这样的一个形象，然后通过文字或者语音去驱动它。但我们认为那是上一代交互方式，整体还不够平滑。比如它表情的丰富度，仍然取决于你采集到的素材有多少，还是没有那么自然。

现在我们希望一步到位，让表情和动作都能够实时生成，并且平滑、自然，不再依赖运营或者其他技术方式去采集更多的表情库。

泓君

我注意到，你们现在的虚拟伴侣还有一个很有意思的点：它可以给用户打电话。这个设计很妙，是怎么想到的？

陶明

这还是来自人与人交流过程中的真实情况。在真实的人际关系里，对方也会给你打电话，这是加强和沉淀关系的一种方式。

如果一个人始终单向地去找对方聊天、找对方说事情，比如男女朋友关系里，每天只是男生去找女生，女生永远不会找男生，这种关系很大可能是很难继续下去的。

我们还是希望拟合线下的行为模式。当用户和AI互动时，用户可以主动找AI聊天，AI也会在某个时间段主动关心用户、找用户聊天。这种行为范式符合线下的行为模式，也更容易让用户接受。

否则只有用户去找AI，那就是单向关系，而不是双向关系。

泓君

用户的反馈怎么样？

陶明

用户很喜欢。当用户无聊，或者根本没想到要去找某个人时，对方却来找他，这对用户来说是一个很好的社交补充。

但这件事还是因人而异。我们不会让AI对所有用户都主动发起沟通和聊天，而是会根据用户本身的性格、兴趣，以及他在平台上的行为，做出最终决策。

泓君

从你的观察来看，现在这些AI辅助社交、AI伴侣等产品落地之后，对整个产品，包括用户黏性，会有很大的提升吗？

陶明

提升非常大。2024年，AI对整个产品黏性的贡献已经占了很大一部分。

最开始我们其实非常谨慎。刚才您提到，用户喜不喜欢AI来找他，喜不喜欢和AI沟通，这些问题最初对我们来说都是问号。

所以在推进整站应用的过程中，我们采用了很多产品策略和运营方式。比如AI辅助社交，在放量过程中，既要考虑使用AI辅助的人，也要考虑对方是否愿意接受这种方式。我们通过非常仔细的人群实验，做出最终的产品策略和放量策略。

AI陪伴产品也是一样。Soul过去之所以能够有这么好的用户黏性，在年轻人中有这么高的渗透率，主要是因为Soul提供了一个真实、信任、安全的平台。基于用户对平台的信任，才产生了用户和用户之间的信任，这是我们过去七八年构建产品力的结果。

我们也很担心，上线AI机器人之后，大家会不会认为Soul里面全是AI虚拟人，已经没有真实社交了。

所以在推进AI伴侣的过程中，我们采取的方式和AI辅助社交不一样。到现在为止，我们都没有给AI伴侣设置实际的产品中心入口。

泓君

我发现了。得有人告诉我，我再去搜索才能找到，因为你们没有明显的产品入口。上面会有“AI虚拟伴侣”的标注，所以我最开始才会产生第一个问题：它到底是真的假的？我甚至怀疑是不是自己搞错了，搜到的是一个真人。

陶明

我们希望愿意接受人机互动的用户，可以在Soul里面通过搜索其他Souler，找到这些AI虚拟人。用户可以自己搜到这样的AI虚拟人。

我们把它定义为用户价值驱动的产品。当用户认可这种产品形态带来的价值时，由用户自主选择它。这样可以规避直接一刀切、大规模推广AI伴侣所带来的担忧。

现在运行了大半年之后，AI的渗透率越来越高，用户黏性也越来越好。

泓君

你们会担心平台上的机器人变得越来越多，改变用户体验吗？这会是你们担心的一个方向吗？

陶明

这是我们考虑的问题。但从长远来看，我们还是认为人机互动会是未来社交非常大的补充。

我们应该尽可能保证那些排斥AI的用户，在传统社交体验不变的情况下，同时让对人机互动感兴趣的那批人获得更好的AI体验。我们应该分群去做，而不是一刀切。

泓君

今年你们也推出了AI产品。从你的观察来看，纯粹因为AI功能进入平台而使用这些功能的用户，大概占什么比例？你觉得这未来会是一个很大的增长区间吗？

陶明

我觉得未来增量用户里，拥抱AI的群体会越来越多。

第一，不仅是Soul，整个行业、整个社会对AI的认知和渗透都越来越强。比如3年前，让用户去跟AI伴侣聊天；3年之后再让用户去跟AI伴侣聊天，接受的人只会更多，不会更少。

所以对任何产品来讲，拥抱AI的用户群体肯定会越来越多。

泓君

我记得之前我们俩聊天时，你提到过，Soul在2017年就已经开始搭建chatbot了。2017年其实还没有生成式AI，那时候人工智能主要还是基于规则。

当时你们的想法是什么？你们有这么长时间搭建chatbot的经验，可以介绍一下探索经历的几个阶段吗？

陶明

2017年做chatbot，并不是我们单纯想从技术角度做chatbot，而是基于我们对社交的理解和认知。

2017年的出发点，和我们现在为什么做AI是一样的：为了解决社交平权问题，让每个用户都能够平等地获得社交资源，获得情绪价值和信息价值。这个出发点一直没有变。

但在2017年，这还只是存在于我们的想法里。我们没有把它实现，也没有投入资源去做。因为我们调研了整个行业，也调研了学术界，发现没有人能够做到这样的事情。

我们当时提出的产品形态，也是要情感自然、拟人化。那时候我们甚至设想，要有一个能说会唱、能够懂你的类似宠物。当用户来到Soul、没有办法获得社交资源时，可以跟这样一个懂你的宠物沟通聊天。

这是一个非常具象的产品形态，但当时并没有投入资源去做，因为确实做不到。

泓君

是效果不好吗？

陶明

效果不好。我们也跟几家公司看了一些它们在客服层面的对话，产品确实没有办法做到。那时候我们还处于创业起步阶段，也没有资源自己来做这件事。

重新做这件事是在2019年、2020年。那时候我们提出，用户在Soul里面其实构建了全新的人设。用户的个人主页代表了他人设的内在，我们也希望这个人设有一个形象。

用户在线下有自己的形象，但我们不希望把线下的形象直接搬到线上，而是希望基于用户在Soul里的人设，打造一个符合这个人设的形象。于是我们推出了捏脸、捏人的功能，从2D发展到3D。

在这个基础上，我们进一步思考：有了形象之后，希望它能够说话，能够把自己的内在表达出来。于是2020年，我们开始做对话。

那时我们已经明确了产品对AI的诉求，以及技术上要打造什么样的AI。我们当时提出的规划，是构造一个AI being和human being共存的社区。

在Soul里面，既有AI人类，也有真实人类，是一种共存状态。人可以和人沟通，也可以和AI沟通。在这个基础上，我们开始投入做对话。

泓君

所以，2020年就开始准备做对话了。那时候是以什么样的方式做？

陶明

那时候我们想了很多办法。首先是改写一些理解类模型，但发现效果不行。后来又做搜索和融合，效果也不行。

因为在聊天过程中，你可能能聊10轮、20轮，能够继续聊下去，但对方一定能感觉到它不是真人，知道自己是在和机器人聊天。效果太机械了。

我们采集数据时，当时其实有一个偏差。那时候衡量对话产品有一个叫CPS的概念，相关讨论也很多。它似乎衡量的是用户能不能聊下去。

后来我们发现，这只是一个结果。不聊天的人本来就不会跟它聊；愿意聊天的人，即使知道它是机器人，也还愿意继续聊，但这并不代表他能够在过程中获得好的体感，可能只是想聊一聊。

单纯的对话技术指标和产品体验脱离了。后来我们就不再提CPS这个指标了。

泓君

我能理解。那时候大家最多的体验，可能有点像打客服电话，一层一层往下拨：“办理什么业务请按几”。

即使拿当时世界上语音和机器交互比较前沿的产品，比如Siri来看，它也只是单轮对话，很难支撑有逻辑的多轮对话。所以技术上还是很难。

陶明

对，都是指令式的。你发一个指令，它回答这个指令。你的指令是通过搜索产生的，还是模型生成的，上下文之间其实没有关系。

2020年做对话，2021年我们就开始投入做语音。你会发现，我们在整个AI上的投入始终围绕着一个目标：打造一个能说会唱、能够拟人的AI人。

我们认为，语音交互是未来的主流，所以开始投入语音方向，去做语音合成。那时候我们的合成还是基于传统模型，但我们认为，说话的语气一定要自然、平滑。

当时有很多语音AI产品，比如一些内容平台让AI给脚本配音，把脚本语音化。但听起来还是很机械，一听就知道是机器的声音，在一些语气词方面也表现得很生硬。

所以当时投入的方向，是做情感化的语音生成。

泓君

你觉得现在训练的机器人语调特别平缓，跟2021年研究声音技术、研究语调和拟人化之间有关系吗？还是说当时的技术到现在已经完全用不上了？

陶明

这是我们很焦虑的一件事。那时候我们就在做差异化技术，但现在在线上的体验里，基本上没有用到那时候的技术。

现在使用的是基于LLM的双工语音效果，原来的则是传统语音模型。我们只是在上面做更多标注，让它尽可能拟合。原来的方式是拟合，现在的方式是生成，还是不太一样。

但那时候沉淀下来的数据对我们是有用的。我们在语音方面的思考——语音一定要有情感化、真实的表达——也是现在模型要构建的方向。那时候沉淀下来的是数据，以及我们对语音在社交中作用的思考。

泓君

到了2022年，ChatGPT出来的时候，你激动吗？

陶明

激动是激动，但更多的是焦虑。那让我们觉得，自己的技术可能归零了。

看到GPT的交互效果以及技术的发展方向后，你很自然会判断，原来的技术路线可能被拍死在沙滩上。我们所有的工作都有可能归零。

其实，GPT这类技术并不是2022年才出现的，GPT-3早就出来了。我们知道这个技术方向，只是不知道scaling law出现之后会有这么大的效果。

泓君

所以你当时担心的是，如果不跟上GPT这种产品形态，它可能会凭借足够强大的能力，覆盖掉你们前面所有的努力？

陶明

那时候已经不存在选择了。我们的考虑是，必须自己投入。技术方向已经非常明确，接下来要考虑的是：我们自己做，还是跟一家大模型公司合作。

泓君

2023年出现了大量做大模型的创业公司，你们要不要跟它们共建？当时面临的是这个选择，而不是要不要走这条路线。你最后怎么选的？

陶明

当时其实摇摆了很多，也跟很多公司聊过。最终我们还是选择自己做。

第一，我们在过去两三年积累了这方面的认知，也有自身产品场景的差异性，很难把这一套完全迁移到其他模型公司那里，因为这正是我们最终交付产品的核心。

我们交付的不是模型，而是刚才说的那些对AI社交的认知、对AI效果的认知。对用户来讲，这是一种评判结果。我们没有办法把这套东西标准化输出给第三方公司，因为第三方公司交付的是模型，而不是产品。

但我们希望交付的是产品。我们没有办法把这套东西标准化迁移过去。

第二，如果能够标准化迁移，就说明我们的产品没有差异化。既然都能够标准化地迁移给第三方公司，那就说明产品本身没有差异化。

泓君

你们是什么时候做出这个决定的？

陶明

2023年上半年，我们决定自己做。

泓君

当时业界有几种方法：自己训练模型、用fine-tune的方式，或者用RAG的方式。你觉得后两种行不通吗？

陶明

无论是加RAG还是做fine-tune，其实都是增强效果的过程，但最终的基础效果还是没有办法得到。

比如你使用第三方模型，还有一个数据问题。我们现在产生了大量文字社交数据和语音数据，这些是真实人与人在社交中的数据范式和行为范式。其他模型首先没有办法拿到这些数据，拿不到这样的数据，就很难做出非常稳定的效果。

所以我们最开始的思路是，把fine-tune或者强化学习所需要的数据下沉到底层模型，让我们的底座模型就是为社交服务、为社交定义的。这是一个垂类大模型，而不是通用大模型。

泓君

你当时评估自己做这件事时，觉得最大的难点在哪里？我觉得这可能需要一个非常大的决心。

陶明

首先是要有钱，因为很费钱；其次要有卡、有人。

但我们做决策时，并不是先判断事情有多难，再决定要不要做。我们是因为无法通过和第三方公司合作，得到想要的产品，所以只能自己做。

既然一定要自己做，就不存在“难不难”的问题，而是一定要做的问题。

不过在做的过程中，我们需要重新梳理：如果要达到目标，必须有自己独特的数据，这是我们最大的优势。

第二个优势是在post-training方面，我们知道怎么构建安全、怎么构建更好的效果，这也是优势。

本质上还在模型层面：我们有没有一个好的模型架构？我们的判断是，模型架构在未来一段时间会接近收敛。到现在为止，大家在模型层面也没有特别大的变化，当然有不同的技术路线，但每条技术路线的变化程度并没有那么大。

我们可以在这个基础上去做。大家都说，不管做通用模型预训练，还是做垂直模型预训练，都很贵。但我们认为，未来成本一定会降下来。

我们一开始是小步去做，不需要一个很大的模型。我们要的是效果，不是模型；要的是能够支撑社交效果的模型，而不是为了通用模型而做。

所以我们是小投入地去做。后来发现，7B、13B规模的模型，在我们的数据和微调加持下，效果已经很好了。

卡在当时确实是一笔比较大的投入，相比其他IT支出要高很多，但现在价格也越来越低了。

泓君

所以，预训练的卡并不是你们当时认为的瓶颈？

陶明

反而那时候我们最担心的是推理成本。

泓君

因为你们有真实的用户基数。

陶明

对。我们很担心，万一产品上线之后爆了，推理成本会非常高。所以当时我们投入了大量工作去降低推理成本，提高计算效率。

预训练方面的效率和成本，并不是当时的主要工作；反而是推理成本和效率，这是工程团队投入比较多的方向。

泓君

现在推理成本降下来了吗？还是说推理成本仍然是你们担心的问题？

陶明

现在已经不是我们担心的问题了。

一方面，我们希望用更小的模型实现更好的效果，这是模型层面的优化。第二，我们做了一些压缩。第三，我们在框架层面做优化，也在做推理层面的技术优化和底层优化。

从现在的价格来看，不仅是我们，其他公司也都能够支撑大几千万DAU。我觉得这个问题不大。

计算资源对于通用模型来说仍然是一项非常大的投入，但对于应用层面来说，成本已经很低了。我觉得对其他创业公司来讲，现在也不是瓶颈。

泓君

你们现在有多少个模型？方便透露吗？

陶明

模型会很多，版本也会很多。但从定性上来看，大概有五六个模型。

我们不会按照7B、13B这样的规模区分，而是按照不同的垂类功能来区分。

泓君

垂类功能是怎么分的？

陶明

还是有一个基础模型。在语音方面有一个模型，在图片方向也有模型，还有一些3D方向的模型。

泓君

3D方向也有模型？

陶明

3D方向是我们正在探索的，可能用于未来的探索，目前还没有发布，也还没有把这个模型能力具体应用到产品上。

泓君

可以这样理解吗？

陶明

对。原来我们一直有一些功能，比如视频匹配，用户可以戴一个头套去沟通，不以真实面孔的方式出现。那时候我们是通过驱动的方式来做。

但未来我们还是希望纯粹通过生成的方式来做。

泓君

整个生成式AI发展得很快。你觉得自己在训练这些模型的过程中，知识和判断是从哪里来的？在这个过程中，又是怎么构建自己的学习能力的？

陶明

只能跟团队一起，持续跟进行业发展。生成式AI的整个技术路线其实还没有收敛，每天都有新的、差异化的方式出来。

你必须跟团队一起了解这些技术，并且做实验。比如我们现在正在做的实时双工通话能力，目前其实没有任何一家能够完全实现我们想要的效果。

泓君

双工是什么意思？

陶明

从产品角度来看，线下交流时，你说话的过程中我可以随时打断你，你可以停下来听我讲；听我讲完之后，你又可以继续讲，而不是纯粹一来一回——你说完了我才能说。

双工就是可以随时打断，这也是现实中人与人交流的一种方式。

泓君

现在没有哪一家能够实现这种效果吗？OpenAI可以吧？

陶明

还不一样。

泓君

实时打断，然后继续说，GPT-4o不是可以吗？

陶明

GPT-4o还是问答式的。你说话时，如果不提出问题，它不会以同样的方式继续互动。你需要打断，然后发出指令。

我们现在也遇到了很多难点。一方面，我自己在想怎么解决；另一方面，我也会去看业界有没有新的、差异化的方式，然后验证能不能放到我们的技术方案里。

所以知识是一个学习过程，我觉得每家公司都会处于这样的状态。

泓君

你刚才提到，即使模型出来以后，也有很多技术路线。现在你在市场上看到了哪些路线？你又是怎么在其中做选择和判断的？

陶明

首先还是从自身出发。整体来讲，我们是基于开源生态来打造自己的生态，这是我们整体的方向。

所以我们拥抱的是更加开放的技术体系和模型体系。

泓君

就是Meta那一套，Llama的路线，对不对？

陶明

对。现在有几条路线跑得不错。

第一是Llama这一套，它的基础模型更新技术我们也会跟进，而且足够开放，不会某一天突然闭环。我觉得目前还没有这个趋势。

第二，国内也有几款不错的模型，比如通义千问的体系也还不错。

第三就是现在的DeepSeek。

但我们目前还是在Llama和千问的路线上探索。

泓君

最近DeepSeek的模型确实非常火，尤其是V3出来之后。你研究过他们的模型吗？

他们用H800训练出了很好的效果，也非常节省成本。这会不会对你们做更大的模型，或者对你们的模型训练方法带来启发？

陶明

肯定会。我们肯定会研究它是怎么实现这样优秀的模型的。

一家公司沉淀下来的工程方法其实很难得。从整个行业来看，工程层面不一定能够直接给最终的业务交付带来什么，但它确实从降低门槛的角度带来了很大优势，也为整个行业进一步发展提供了很好的桥梁。

原来要做大规模训练，可能只有几家公司能做。如果成本降下来，很多其他团队也能做，行业就会更加百花齐放。

泓君

所以它把成本降下来了，对大家来说是一把双刃剑：整个市场的门槛降低了，但竞争也会更多，对不对？

陶明

对。

泓君

OpenAI的O1给过你什么启示吗？

陶明

O1给了我们很大启示。尤其是在构建AI伴侣这件事上，它给了我们很多启发。

我们希望AI伴侣在真实、拟人的方向上达到好的效果，同时也具备一定的行为能力。不同的AI伴侣会提供不同的角色，不同角色需要有不同的行为和功能能力。

比如我希望在对话过程中，不通过指令的方式就能触发某些action，这是一个比较平滑的方式。

如果我给一个AI伴侣发一张图片，让它帮我美化成某种效果，直接把图片丢给图片模型，Prompt里可以把图片输入和文字描述讲得很清楚。

但如果把这个过程放进对话里，就需要模型理解上下文，做出一次指令生成，才能让AI伴侣调用其他工具层面的模型。

O1的自主规划能力，在AI agent构建层面给了我们一些启发，让我们能够构建更加轻量、更加自主的workflow。

泓君

现在对你们自己打造的聊天机器人，你会给它打多少分？

我问这个问题，是想知道你觉得它还需要怎样优化，以及提升空间有多大。

陶明

提升空间还是蛮大的。我们现在只是解决了人与人交流中部分行为拟合的问题，还有很多事情没有完成，也在努力做。

比如场景。我一提到场景，大家都认为那是产品场景，是一个功能。但在整个对话里，AI同样可以构建场景。

比如人与人在线下沟通时，外面下雨了。围绕这个情景，AI可以衍生出很多聊天session：下雨了，你说要不要在家看电影？然后就进入一个关于电影讨论的场景。

这就是场景。我们现在在做这方面泛化的时候，效果还需要加强。

泓君

现在整个业界都在等OpenAI的GPT-5出来，同时也有一种声音说，scaling law的增长可能已经快到头了。

我很想知道，在大家基于大模型做产品和应用的过程中，应用和大环境之间到底有多紧密的联系？

陶明

越来越弱了。

泓君

这个窗口期是前一两年，或者这一两年吗？

陶明

比如刚才这个很具体的问题：现在前沿大模型的技术方向，对Soul的影响大不大？

我觉得影响越来越小。在应用层面，我们已经获得了用户认可的价值，这个价值是基于现有技术取得的。接下来，我们要增强用户价值，在技术方面继续构建，但技术的确定性已经更高了。

不像去年那样，一个新模型出来，或者一个新的方向出现，我们就担心会不会又把我们拍死在沙滩上。我们的焦虑程度下降了很多。

但也不能排除，七八年之后，我们现在构建的东西会被新的奇点覆盖。如果未来出现一个新的奇点，把我们的整个系统、策略和模型全部覆盖掉，我觉得那也可能发生，但短期一两年内很难。

泓君

我记得2023年时，我跟很多做大模型应用或者基础模型的公司聊过，大家都非常焦虑。比如每次OpenAI升级，大家就觉得前面半年的工作白做了：所有东西都搭在GPT-3上，GPT-4出来之后，就觉得白做了。

但2024年我听到这样的声音少了很多。直到今天，我们讨论的这个时间点，市场上还是有一种声音：随着大模型迭代，比如GPT-5的能力越来越强，会不会最终所有应用都被一个更强的模型覆盖掉？

这个市场的壁垒是什么？你们想过这个问题吗？

陶明

这个问题我们在2023年想过：任何行业问题或者用户问题，会不会被一个端到端的模型完全解决？

如果这个说法成立，对整个行业来说会是一个非常悲观的消息。但回顾过去二三十年，从互联网技术、PC时代，到互联网，再到移动互联网，你会发现，即使端到端模型能够解决很多需求，那也只是我们目前能够看得到的需求。

基于新技术、新模型的发展，一定会带来新的增量需求。如果带不来增量需求，我认为这次技术革命、AI革命就是失败的。

任何技术革命一定会带来新的需求。这些新的需求，能不能被同时代的技术完全端到端解决，或者被过去的技术端到端解决，我觉得是一个问号。

新技术的出现，应该能够以最大效率解决已知问题。对于未知问题、未知需求，仍然需要人的探索，以及不同公司的解决方案。

泓君

所以，你会担心现在做的事情被一个更强的模型覆盖掉吗？

陶明

我不太担心这件事。

泓君

### AI还未创造新的商业模式，关键在于服务场景

现在基于AI聊天机器人的商业模式，跟以往在变现思路上会有什么不一样？

陶明

这方面我只能说一些个人想法。AI商业变现是每家公司都在做的事情，大家都希望在一个非常清晰的商业模式下发展业务。

但总体来看，整个行业还没有出现一种新的商业模式。我一直认为，商业模式是构建在业务模式之上的，而不是凭空出现的。

为什么现在商业模式没有改变？本质上是因为当前的AI还没有给业务模式带来改变，更多是增强作用。

如果没有新的需求出现，或者没有新的业务出现，我认为商业模式本身也不会有太大变化。

泓君

我注意到，你们推出了AI给用户打电话的产品，而且是收费的。现在用户在这个产品上的付费意愿高吗？

陶明

我们只是把它当成一种增值收入方式，跟其他增值产品差不多。对用户来讲，这就是获得更好体验的一种方式。

原来我们提供了一种方法，现在又提供了一个新的手段。用户为这个功能买单，并不意味着其他事情发生了变化。

泓君

你们现在有AI“苟蛋”这种拟人化机器人，也有情感化陪伴的虚拟伴侣，还有AI NPC、数字分身。你们会怎么定义未来平台的核心产品和核心场景？

你的思路是做几个产品，还是打造一个王牌产品？

陶明

你刚才会发现，不同的AI其实有不同的功能定位。未来我们的王牌产品，肯定还是以AI虚拟人为最主要的基石，让它在当前不同场景里做更好的功能泛化。

比如视频通话能力，未来不一定只用来给用户打电话，也完全可以用在当前的语音产品里，做虚拟直播。

我们不限制自己有多少个AI产品，而是希望每个AI产品都服务不同的人群。我们没有打算打造一个主体AI功能，来承载整个Soul的需求。

我们也不打算构建一个中心化入口。作为主体产品，一定会有一个中心化的AI入口，但我们现在没有这样的计划。

泓君

所以，你们现在还是以整个Soul社交平台为主，所有AI产品其实都是服务于这个社交平台的？

陶明

对，目前是这样。

泓君

既然说到社交平台，它涉及人与人之间密切的互动。尤其是社交产品规模变大之后，可能会遇到很多体验上的挑战，比如怎么保证女性用户的体验，以及很多安全问题。你们会怎么处理？

陶明

过去七八年，我们构建了一个真实、信任、安全的平台，让用户和用户之间也产生信任感。这离不开我们在生态建设上的投入。

在关键事情上，我们做了很多工作。第一，是用户反杀猪盘、反诈骗。这个问题我们投入了大量资源，因为它不只是某个平台的问题，而是整个社会的问题。

我们在风险发现、风险告知以及和其他平台联动方面，已经构成了一个完整体系。这样用户如果在Soul里面遇到类似情况，我们能够第一时间触达他，告知并保护他。

泓君

反杀猪盘、反诈骗能不能举个具体例子或场景？

陶明

有时候我们并不知道某个用户是不是杀猪盘，但通过AI可以判断出这个用户有风险。用户刚注册进来，我们判断他有风险，就应该尽快处置，不让他和线上其他正常用户建立连接。

泓君

但你们怎么知道这个用户有风险？是有信号吗？

陶明

对，是有信号的。

一方面，这是我们自己在这方面积累的专家知识模型；另一方面，我们也会和其他平台合作。比如微信以及其他平台之间会有一些行业联盟，大家一起把这件事做得更好。

我们能够拿到一些信号。当然也可能漏掉，也会有新的方式出现。

有些信号来自外部，是已经发生过的风险；有些是我们自己的专家模型能够识别的；还有一些是我们没有识别到的，就会进入正常的用户池，影响其他用户。

这时风险会在用户行为中体现出来。通过他和用户之间的各种行为，我们会用后验模型持续跟踪。一旦发现他有风险，他接触过的所有用户我们都会做提示、做阻断。

如果风险性很高，我们还会让运营人员人工联系用户。

泓君

所以风险性很高时，你们的运营可能会直接私信用户，告诉他相关情况？

陶明

对。我们平台在这方面的处置，不管是同行评价还是相关单位评价，一直都很不错。

刚才说的是用户风险方面。第二，毕竟这是一个社交社区，文明礼仪很重要。我们在社区用户教育、用户行为监督方面，也使用了很多有效的运营方式，确保用户之间能够愉快、顺畅地沟通。

泓君

比如一些不好的词语会被屏蔽，不让用户受到困扰？

陶明

不好的词只是一个方面。在社交环境里，你还得做一个有礼貌、尊重别人的人。

反暴力、反歧视方面，我们也做了大量工作。另外还有未成年人保护。包括女性用户体验在内，我们希望构建一个健康向上、风清气朗的社交环境，让用户能够无顾虑地在上面交流。这是很重要的一件事。

泓君

这是社交平台层面的安全。如果放到模型上，模型的安全性是不是也需要考虑？用户和AI交互时，怎么保证模型安全，比如不泄露隐私，以及用户出现不良倾向时，你们会怎么处理？

陶明

模型安全方面，我们原来做生态建设时，就投入了大量工程师和运营同学。现在在模型安全方面，同样投入了很多人。

首先，很多人认为安全只是做过滤，但安全不仅仅是过滤。我们在原有安全体系的基础上，也在模型本身做了很多工作。

第一，在数据方面，我们投入了大量人力做数据层面的处理。第二，在主体模型运行时，我们也构建了安全模型，可以做一些对抗。第三，生成内容输出之后，还要经过刚才说的安全体系，最终才能到达用户的交互界面。

泓君

假设有一个用户在模型里提到如何自杀之类的内容，你们会怎么处理？

陶明

如果他提到“如何自杀”，这类内容首先就不会到达我们的模型，会触发我们站内的一些善意功能。

当用户有这样的倾向时，我们会在站内提供心理咨询，或者让他和运营同学沟通。

泓君

真的有心理咨询吗？

陶明

有。用户可以在站内搜索“自杀”，输入相关关键词就会触发我们的干预机制。

泓君

所以，你们是专门为用户配备心理咨询师，或者连接到外部机构？运营同学也会关注相关热线？

陶明

对，热线也可以直接打电话。

当用户主动寻找这方面的信息时，平台会认为他已经进入了不太好的思维状态，需要更加积极的引导。

泓君

非常精彩。谢谢你。

陶明

谢谢。
