Artoke

애니 논문: Everybody Dance Now: 포즈만 옮겨 춤을 전이하다

2026년 7월 28일

Everybody Dance Now: 포즈만 옮겨 남의 춤을 추게 만드는 기술

"Everybody Dance Now"는 Chan 외 연구진이 ICCV 2019에서 발표한 연구로, 잘 추는 사람의 춤 동작을 그대로 다른 사람의 모습으로 옮겨 그리는 방법을 소개합니다. 소스 영상에서 2D 포즈 스켈레톤을 뽑아내고, 그 스켈레톤을 조건으로 받는 조건부 GAN(pix2pixHD 계열)이 타깃 인물의 프레임을 그려내는 구조입니다.

핵심 아이디어는 다음과 같습니다:

  • 포즈 추출: 소스 영상의 프레임마다 OpenPose로 2D 관절 좌표를 뽑아 막대 스켈레톤 그림으로 만듭니다. 이 스켈레톤 그림 자체가 다음 단계의 입력이 됩니다.
  • 포즈 정규화: 소스와 타깃은 키·다리 길이·카메라와의 거리가 다릅니다. 두 사람의 발목 높이와 신체 길이를 비교해 관절 좌표의 크기와 위치를 타깃 기준으로 맞춥니다. 이 보정을 빼면 타깃이 화면에서 붕 뜨거나 잘립니다.
  • 조건부 GAN으로 이미지 생성: 생성자 G는 잠재 벡터가 아니라 스켈레톤 그림을 입력으로 받아 그 자세를 취한 타깃 인물의 프레임을 그립니다(G(스켈레톤) → 프레임). 판별자 D는 스켈레톤과 프레임 쌍이 진짜인지 생성된 것인지를 구분합니다.
  • 시간적 일관성: 프레임 t를 만들 때 직전 프레임의 생성 결과를 함께 입력하고(G(스켈레톤_t, 결과_{t-1})), 판별자는 연속한 두 프레임을 한 묶음으로 보고 판정합니다. 프레임을 따로따로 만들 때 생기는 깜빡임을 이렇게 억제합니다.
  • 얼굴 전용 GAN: 얼굴 영역만 잘라 별도의 작은 생성기가 보정값을 만들어 더합니다. 전신 해상도에서는 얼굴에 배정되는 픽셀이 적어 뭉개지기 때문입니다.

기술의 작동 원리

이 기술은 크게 세 단계로 구성됩니다.

  1. 포즈 추출과 정규화: 댄서의 동작을 프레임별로 분석해 어깨·팔꿈치·손목·골반·무릎·발목 등의 관절 좌표를 뽑고, 타깃 인물의 체형과 화면상 위치에 맞게 크기와 위치를 보정합니다.
  2. 조건부 GAN으로 외형 변환: 보정된 스켈레톤 그림을 생성자 G에 넣어 그 자세를 취한 타깃 인물의 프레임을 그립니다. 판별자 D는 스켈레톤과 프레임 쌍을 함께 보며 학습해 결과를 실제 촬영본에 가깝게 밀어붙입니다.
  3. 얼굴 보정과 일관성 유지: 얼굴 전용 생성기가 얼굴 영역을 다시 그려 더하고, 직전 프레임을 함께 입력하고 연속 두 프레임을 함께 판정하는 방식으로 동작이 끊기거나 깜빡이지 않게 합니다.

알면 좋아지는 점

이 기술을 이해하면 다음과 같은 이점이 있습니다:

  • 동작과 외형을 분리해 생각하게 된다: 이 파이프라인은 "누가 움직이는가(포즈)"와 "누구처럼 보이는가(외형)"를 완전히 나눕니다. 게임·애니메이션·뮤직비디오에서 모션은 그대로 두고 등장인물만 바꾸는 작업이 왜 가능한지 이해하게 됩니다.
  • 제작 비용의 구조가 보인다: 전문 댄서를 매번 섭외하거나 모션 캡처 장비를 갖추지 않고도, 타깃 인물의 영상 몇 분과 학습 시간만으로 동작 영상을 만들 수 있는 이유를 알게 됩니다.
  • 학습·교육에 응용할 지점을 찾게 된다: 배우는 사람의 몸으로 정확한 동작을 재생해 보여줄 수 있어, 시범 영상과 자기 몸 사이의 거리를 좁히는 데 쓸 수 있습니다.

모르면 겪는 문제

이 기술의 복잡성을 이해하지 못하면 다음과 같은 문제에 직면할 수 있습니다:

  • 포즈 추정 품질이 결과를 지배한다는 걸 놓친다: 스켈레톤이 흔들리거나 팔다리가 뒤바뀌면 생성 결과도 그대로 무너집니다. 결과가 이상할 때 GAN을 의심하지만 실제 원인은 앞단의 포즈 추정인 경우가 많습니다.
  • 정규화를 빼먹는다: 소스와 타깃의 체형·카메라 거리를 맞추지 않으면 인물이 화면에서 떠오르거나 잘립니다.
  • 비용을 잘못 잡는다: 타깃 인물마다 새로 학습해야 하고, 얼굴 전용 GAN과 시간적 일관성까지 붙이면 학습 데이터와 GPU 시간이 더 필요합니다. 즉석에서 아무 인물에게나 적용되는 기술이 아닙니다.
  • 결과를 평가할 기준이 없다: 어디까지가 진짜 촬영이고 어디부터가 합성인지 판단하지 못한 채 결과물을 쓰게 됩니다.

시각화: 포즈 변환 과정

애니 논문: Everybody Dance Now: 포즈만 옮겨 춤을 전이하다 도식 왼쪽 사람에게서 뽑아낸 것은 관절 좌표뿐입니다. 이 좌표를 타깃 체형에 맞게 보정한 뒤 생성자에 넣으면, 오른쪽 인물이 같은 자세를 취한 프레임이 나옵니다. 아래쪽 회색 상자들은 결과를 다듬는 보조 장치로, 각각 프레임 사이의 깜빡임과 얼굴 뭉개짐을 담당합니다.

출처

광고

리깅 파이프라인 자동화 도구

반복 작업은 스크립트에게. 현업에서 쓰는 리깅 툴 모음.

리깅 도구 보기