Listen

Description

深入探讨HumanOmni,一个为理解以人为中心的场景而设计的多模态大型语言模型。我们讨论了其数据集构建、模型架构以及在情感识别、面部表情理解和动作理解等任务上的表现。