我一直在开发 Rexclaw Companions,一个开源AI语音伴侣,带有3D虚拟形象(three.js + VRM),由Grok实时语音API驱动。
每个角色都有一个固定的约20个手势的动作库,通过工具调用触发,但这很有限:任何列表之外的动作请求,它只能假装做出来。
所以我加入了一个运行时文本转动作工具。当角色判断某个动作不在动作库中时,它会调用一个带有文本提示的generate_gesture工具。该工具通过本地HTTP API连接到Kiratchi开发的 Text-To-VRMA,它在我自己的GPU上运行NVIDIA的ARDY运动模型,并返回一个VRMA动画,生成后立即播放。在视频中,我要求它做侧手翻和鸡舞,这两个动作在项目中都不存在现成资源。
在RTX 3070(8 GB显存)上每个动作大约需要5秒,在更好的显卡上可能快得多。我发现这个模型更适合短描述,比如“一个人做侧手翻”,而不是分步舞蹈编排。长描述会导致动作质量明显下降。
我很期待看到这类技术很快能更多地用于游戏中的实时角色动作/NPC行为。有没有其他人尝试过为NPC实现运行时文本转动作?
评论 (0)