HumanOmni：以人为中心的视频理解大型视觉语音语言模型

Listen

深入探讨HumanOmni，一个为理解以人为中心的场景而设计的多模态大型语言模型。我们讨论了其数据集构建、模型架构以及在情感识别、面部表情理解和动作理解等任务上的表现。