导读 本文将分享近年来 Soul 基于 AIGC 的一些实践与探索。
1. AIGC 新浪潮发展
2. Soul 的 AIGC 实践与探索
3. AIGC 技术结合产品
4. AIGC 通用 VS 自研
5. 问答环节
分享嘉宾|甘启 上海任意门科技(Soul) 视觉算法负责人
AIGC 新浪潮发展
Soul 的 AIGC 实践与探索




1. 虚拟人

2. 视觉


3. 对话&大模型发展

4. 音频


-
首先,用户的输入会传递给大语言模型的对话模型,产生文本输出和标签。 -
接着,根据不同的文本和标签,使用文本转语音(TTS)生成声音,并使用文字到表情(TTA)模型生成嘴型。 -
然后,驱动算法融合表情和动作,并进行虚拟人渲染。 -
最后,根据语音和文本的播放时间进行对齐,输出结果。
AIGC 技术结合产品






AIGC 通用 VS 自研
-
接受和拥抱变化:要敏锐地意识到外部通用工具的出现,并且不应固守于“比别人做得更好”的想法。如果外部通用模型已经能够完全覆盖我们当前正在进行的工作,就应该果断放弃自研,转向其他领域的探索。 -
善用现有资源:充分利用已有的技术积累,将外部能力整合到我们的产品中。举例而言,如果我们想要开发一个适用于各种场景的图像生成模型,而这一领域已经有很多人在研究并提供了一些解决方案,那么我们就应该专注于提升模型的最后一块砖,即与场景结合的部分,而不是从零开始做整个模型的研发工作。 -
更了解自己的产品和用户:深入了解自己的应用和用户群体,了解用户的喜好和行为习惯。重点思考我们的工作如何在产品中落地,如何满足用户需求。我们需要突出差异性,思考如何在特定场景下实现创新。 -
构筑垂类领域的门槛价值:作为一家专注于社交的公司,我们应该深入了解年轻用户在社交场景中喜欢做什么,并为其提供相应的能力。这些能力可能是通用模型所不具备的,因此我们需要思考如何通过技术和场景结合,构建起我们自己的门槛价值,使通用模型难以突破。
问答环节
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END









