[CVPR'25] Av-flow: Transforming text to audio-visual human-like interactions :
·
카테고리 없음
1. 논문에서는 생성된 head pose와 facial expression의 다양성을 Divh, Dive로 평가하고test set sample들의 표준편차로 측정했지만논문에서도 VASA-1* w/ TTS가 헤드 포즈 다양성에서 AV-Flow보다 약간 높은 것이실제로는 더 자연스러운 다양성이 아니라 noisy head motion 때문이라고 한 것 같습니다. 그렇다면 표준편차 기반의 다양성 지표만으로는 의미 있는 표현 다양성인지 불안정한 노이즈인지 구분하기 어려운 것 같아서 temporal smoothness, jitter처럼 추가적인 정량 지표를 사용하거나 인간이 느끼는 자연스러움을 확인할 수 있도록 user study를 진행할 필요는 없었을지 궁금합니다. 2. 논문은 text-only input으로 a..
[ECCV'24] ScanTalk: 3D Talking Heads from Unregistered Scans :
·
카테고리 없음
1. 논문에서는 Fig. 4를 통해 original topology, remeshed version, degraded mesh에서 DiffusionNet encoder가 유사한 descriptor norm heatmap을 생성한다는 점을 보여주면서 이를 ScanTalk의 topology robustness 근거로 제시한 것 같습니다. 또한 ScanTalk의 최종 연구 목표가 descriptor 자체의 안정성보다는 topology가 다른 scan에서도 audio-driven facial animation이 일관되게 생성될 수 있다는 점인 것 같습니다. 디스크립터가 비슷하다고 해서 모션이 물리적으로 수렴하는 것을 보장할 수는 없을 것 같은데 인코더가 안정적인 입력을 만들어내는 것과 최종 결과가 시각적으로 자..
[ECCV'20] Nerf: Representing scenes as neural radiance fields for view synthesis : 논문 요약
·
카테고리 없음
Background Problem Research gap Challenge and solution My thought1. 논문은 LLFF가 여러 scene representation을 blending하기 때문에 카메라 view를 움직일 때 perceptually distracting inconsistency가 생기고 이부분을 supplementary video에서 확인할 수 있다고 설명한 것 같습니다. 대신 NeRF는 하나의 continuous 5D scene representation을 사용한다는 것을 중요한 장점으로 주장하는 것 같은데 Table 1의 PSNR, SSIM, LPIPS는 각각의 test image를 ground truth와 비교하는 per image metric이라서 continuo..
[CVPR'19] VOCA: Capture, Learning, and Synthesis of 3D Speaking Styles : 논문 리뷰
·
카테고리 없음
Background- Audio-driven 3D facial animation은 speech signal로 3D character face animation을 생성하는 기술- virtual avatar, VR/AR, game character, digital human, video synthesis 같은 분야에서 필요- 기존에도 speech-driven facial animation 연구가 있었지만 현실적인 사람 얼굴을 자연스럽게 움직이는 것은 여전히 어려움- 이 문제는 uncanny valley로 이어질 가능성 높** 논문이 찾은 이유는 세 가지. 3D dataset 부족, 일반화 가능한 모델 부족, 표준 평가 지표 부족.Problem- 기존 audio-driven facial animation 모델..
[SIGGRAPH'24] Diffposetalk: Speech-driven stylistic 3D facial animation and head pose generation via diffusion models : 요약
·
카테고리 없음
Background- speech driven 3d facial animation : 음성 신호를 입력으로 받아 3d 얼굴의 입술 움직임, 표정 변화, 턱 움직임, 머리 자세를 자동으로 생성.- virtual human, digital avatar, VR/AR, 게임 캐릭터, 교육용 아바타, 영상 합성 등에 사용- education, entertainment, virtual reality에서 활용 가능성이 크기 때문에 학계와 산업계 모두에서 중요해졌음 - 목표가 단순히 “입이 움직이는 얼굴”을 만드는 것이 아님- 입력 음성과 시간적으로 정확하게 맞는 lip motion을 만들고 동시에 사람마다 다른 말하기 스타일을 반영해야함. 입을 얼마나 크게 벌리는지, 윗얼굴 표정이 얼마나 움직이는지, 고개를 얼마나 ..
[SOSP'25] cache_ext : core contribution
·
[ Laboratory ]
(자유롭게 정리한 글. 가독성 좋게 재정리한 글 업로드 예정)* eBPF 기반 in kernel policy execution - page cache policy를 userspace에서 실행하면 kernel에서 이벤트를 감지하고 userspace로 전달하면 userspace에서 policy를 실행하고 kernel로 다시 전달해야함context switch로 인해 성능 저하가 크게 발생하고 뿐만 아니라 data copy overhead, synchronization으로 인한 contention도 발생함- 페이지 단위로 매우 자주 실행되는 hot path이기 때문에 eBPF를 이용해 in kernel execution하면 userspace overhead를 제거할 수 있음= policy는 반드시 커널에서 ..