[CVPR'25] Av-flow: Transforming text to audio-visual human-like interactions :
·
카테고리 없음
1. 논문에서는 생성된 head pose와 facial expression의 다양성을 Divh, Dive로 평가하고test set sample들의 표준편차로 측정했지만논문에서도 VASA-1* w/ TTS가 헤드 포즈 다양성에서 AV-Flow보다 약간 높은 것이실제로는 더 자연스러운 다양성이 아니라 noisy head motion 때문이라고 한 것 같습니다. 그렇다면 표준편차 기반의 다양성 지표만으로는 의미 있는 표현 다양성인지 불안정한 노이즈인지 구분하기 어려운 것 같아서 temporal smoothness, jitter처럼 추가적인 정량 지표를 사용하거나 인간이 느끼는 자연스러움을 확인할 수 있도록 user study를 진행할 필요는 없었을지 궁금합니다. 2. 논문은 text-only input으로 a..