
随着大模型技术的快速发展,通用人工智能技术步入新的发展阶段,其应用领域也在不断拓展。作为通用大模型技术应用的热门领域,角色扮演(Role-Playing)这一应用场景中的创新备受业界瞩目,各大企业纷纷推出角色扮演对话平台等相关产品,角色扮演领域正在成为大模型能力竞争的新焦点。
瞄准角色扮演领域广阔的应用潜力,网易伏羲基于自研的易生诸相多模态大模型(包含文生文“玉言”和文生图“丹青”两部分)技术领域的积累,独具匠心地打造了行业领先的玉言角色扮演模型(CharacterYuyan),该模型能够精准捕捉不同人设特点,为用户提供具备强大共情能力与主动性,兼具深度与广度的高质量人设对话能力。近日,这款专为中文场景量身定制的模型,在角色扮演能力的权威benchmark——CharacterEval评测中脱颖而出,11项评测指标荣膺榜首。这一突破性的成果预示着网易伏羲玉言角色扮演模型有望为泛文化娱乐、短视频/短剧创作、影视动漫创作、教育等众多涉及角色扮演的行业提供新的解决方案,加速内容创作领域的技术变革。
为了测试玉言角色扮演模型的角色扮演能力,此次采用中文场景专门针对角色扮演能力的权威benchmark CharacterEval进行评测。该评测集其包含77个从中文小说和影视等来源中提取出来的人设和1785组对话,并从对话能力、角色一致性、角色扮演吸引力三大类12个细粒度评测维度进行评估。经测试,玉言角色扮演模型对话效果非常优秀,CharacterYuyan-RLHF及CharacterYuyan两个版本模型在该benchmark分别获得第一名和第二名,并且在12项细分维度评测中的11项获得了第一。


图1:玉言角色扮演模型与业内模型的效果对比,业内其他模型的评测结果取自CharacterEval论文(https://arxiv.org/abs/2401.01275)。

图2:玉言角色扮演模型构建框架
那么玉言角色扮演模型的能力是如何打造的呢?可以从文娱知识增强模型训练、基于人机协作的对话数据构建、基于RLHF训练符合用户偏好的角色扮演模型三个角度进行切入分析。
玉言角色扮演模型是基于网易伏羲自研的易生诸相大模型开发而来,易生诸相基座模型是网易伏羲凭借多年大模型积累,在浙江省级尖兵项目“超大规模预训练模型云平台”的支持下持续打磨而成的多模态大模型,并且已经赋能了网易内部多个文娱领域场景的应用落地。为了增强易生诸相在角色扮演领域的能力,网易伏羲使用内部多年探索积累的大量文娱领域数据,进行数据筛选和清洗获得高质量文娱语料,并对易生诸相大模型进行二次预训练,得到文娱知识增强模型,为玉言角色扮演模型提供了较好的模型基础。
玉言角色扮演模型的优秀表现也依赖于不断完善的对话微调数据,其主要是利用网易伏羲有灵众包平台基于人机协作的思路构建而成。具体构建流程如下:
首先是从多个来源搜集对话微调数据集,最大程度保证微调语料的多样性、丰富度及数据规模。用于微调的对话数据来源主要包括:基于文娱领域语料抽取的对话数据、基于标注人员人工创作的高质量对话数据、基于标注人员与AI模型边聊边改的对话数据,基于多个AI模型相互对话合成的对话数据。
其次是对话数据的质量筛选,引入了网易伏羲有灵众包平台的能力,培训出并匹配到具备良好认知的标注人群,采取群体智能的思路,基于用户画像的自动质检技术获得人类共识,在较低成本下获得高质量的对话评估数据集,并大幅超出GPT-4的模型自动评估效果,用于训练对话评估模型。同时设计了不同的评估任务,既有侧重于从数据集里定位有问题对话的任务,也有侧重于对一组对话不同细分维度评估的任务。另外为了提高标注的效率和准确率,采用了Confidence Learning快速定位标注员可能犯错的题目,安排标注员返修,这个过程可以重复多次,直至收敛。其中,Confidence Learning的定位能力依赖于对话评估模型的准确率,当对话评估模型不断提升时,整体标注的效率也会提高,形成一个良性循环。有了高质量的评估标注数据后,可以基于语言模型训练一个分类或回归模型,再基于这个分类或回归模型对不同来源的数据集进行打分与筛选,留下质量最高的数据,形成玉言角色扮演模型的微调数据。
另外,在模型微调时也结合了Early Stopping及Parameter Averaging (参数平均)技术,保留K个在验证集上最好的模型,再对它们的参数进行了平均。同时,基于人机协作思路不断迭代的玉言角色扮演模型也会参与到新一轮对话数据的构建和评估中,当玉言角色扮演模型的对话能力在每一个迭代周期都能稳定提升时,它参与生成的对话数据集的质量也在稳定提升,这样在下一个周期时又能基于新的数据训练出更好的模型,以这样的形式持续闭环迭代玉言角色扮演模型。
使语言模型输出更符合用户偏好是角色扮演场景的重要需求,但人类偏好通常难以形式化定义,而基于人类反馈的强化学习(Reinforcement Learning From Human Feedback,RLHF)因其在ChatGPT产品构建中有效地对齐了人类偏好而被广泛关注。因此,采用RLHF训练流程优化角色扮演场景中的语言模型输出成为了一个很自然的选择。然而,在具体业务实践中,RLHF优化过程面临数据稀缺与标注困难、难以准确验证微调后的模型表现、优化过程的繁琐迭代等挑战,并且当前尚缺乏可解决上述业务场景优化问题的开源框架或工具。
而网易伏羲基于自研的面向智能体编程框架(Agent-oriented programming,AOP)框架搭建的有灵机器人平台可解决上述问题。如图3所示,用户可以通过有灵机器人平台以代码的方式便捷发布众包标注任务,当标注数据达到一定量后将自动触发奖励模型RewardModel的训练,训练结束将自动触发下一个环节强化训练(通常为近端策略优化,Proximal Policy Optimization,PPO)的训练,当PPO训练结束后,可使用最新的LLM生成待标注数据,并自动发送至网易有灵众包平台,从而实现模型评估或新一轮训练数据标注。

图3:基于有灵机器人平台的RLHF闭环流程图(以LLM的PPO训练为例)
所以,通过自研的AOP框架打通了“数据标注-模型训练-模型评估”完整的闭环,主要包含了RLHF流程的训练、评估步骤,众包的数据投放与验收步骤。一方面有灵众包平台提供了基于用户画像的真值推断等自动质检功能,在降本增效、缩短标注周期、保证质量等方面都有一系列的前沿算法举措;另外一方面有灵机器人平台提供了Human-In-Loop(人在环路)训练的必要保障,可通过对众包数据回流过程的质检控制,从而开启或关闭RLHF闭环训练。最终基于自研的AOP框架,网易伏羲面向角色扮演场景开展了自动化多次闭环RLHF训练,有效地提升了玉言角色扮演模型的角色扮演能力。
通过下列展示的不同人设的多轮对话实例可以看出,玉言角色扮演模型所展现的实力远不止于单纯的数据评测指标上的卓越表现。该模型能够精准捕捉并传达不同人设的性格特点,在生成回复时既保持了角色设定的一致性,又兼顾了文本的高质量与信息含量。不仅如此,玉言角色扮演模型还能在对话中自然流露出令人印象深刻的共情特质,使得每一次交流都充满了生动性和趣味性。
更值得关注的是,玉言角色扮演模型具备出色的主动对话能力,能够在对话过程中积极引导话题发展,展现出极强的话题延展性和内容丰富度,避免了无趣的尬聊现象。换言之,不论是在深度还是广度上,与玉言角色扮演模型进行的对话都能保持持续的新鲜感与吸引力,确保用户在长时间互动下仍能体验到饶有趣味且意犹未尽的聊天过程。


图4:玉言角色扮演模型对话效果展示
综上所述,网易伏羲玉言角色扮演模型不仅在理论评估中成绩斐然,更具有广泛而深远的实际应用价值,有望引领泛文化娱乐、短视频/短剧创作、影视动漫创作、教育乃至更多涉及角色扮演元素的产业革新与发展。
着眼于未来,网易伏羲将持续深耕大模型技术研发,继续拓展其在多元场景下的应用边界,满足广大用户对于更加智能化、个性化的娱乐体验需求,共同擘画智能时代的新蓝图。在此,我们也诚邀所有对该领域抱有浓厚兴趣的企业伙伴,携手共创智能时代的崭新篇章,共享技术创新带来的无限机遇与合作可能。

扫描二维码
了解玉言角色扮演模型
市场生态合作:fuxi.mkt@service.netease.com
商务合作:fuxi.bd@service.netease.com
合作电话:(0571)89852163转21951
点击“阅读原文”,访问伏羲官网了解更多详情