Skip to main content
Wan22ImageToVideoLatent는 이미지로부터 비디오 레이턴트 표현을 생성합니다. 지정된 너비, 높이, 프레임 길이 및 배치 크기로 빈 비디오 레이턴트 공간을 생성하며, 선택적으로 시작 이미지 시퀀스를 처음 프레임에 인코딩할 수 있습니다. 시작 이미지가 제공되면 노드는 이를 레이턴트 공간에 인코딩하고, 생성 중 디노이즈해야 할 영역을 표시하는 해당 노이즈 마스크를 생성합니다.

입력

참고: start_image가 제공되면 이미지 시퀀스는 대상 width 및 height로 업스케일되고, VAE로 인코딩되며, 레이턴트의 처음 프레임에 배치됩니다. 해당 프레임의 노이즈 마스크는 0(보존됨)으로 설정되고, 나머지 프레임은 마스크 값이 1(디노이즈 대상)로 설정됩니다. 레이턴트는 항상 48개 채널, 공간 차원 height / 16 x width / 16, 시간 차원 ((length - 1) // 4) + 1을 가집니다. width와 height는 16으로 나누어져야 하며(32의 단계 값으로 강제됨), length는 4의 단계로 시간 차원을 증가시킵니다. start_image가 제공되지 않으면 노이즈 마스크가 없는 완전히 빈 레이턴트가 반환되며, 해당 빈 레이턴트에는 batch_size 입력이 적용되지 않습니다.

출력

두 필드는 단일 LATENT 출력 안에 함께 반환됩니다.
이 문서는 AI에 의해 생성되었습니다. 오류를 발견하거나 개선 제안이 있으시면 기여해 주세요! GitHub에서 편집

Source fingerprint (SHA-256): 3d05980641eeef2e86df7a845aa8b2bd703882db98fe71adef2746ab34a9d717