diff --git a/comfy/ldm/wan/model.py b/comfy/ldm/wan/model.py index 63ab3fbfc..1d6edb354 100644 --- a/comfy/ldm/wan/model.py +++ b/comfy/ldm/wan/model.py @@ -440,7 +440,7 @@ class WanModel(torch.nn.Module): # embeddings self.patch_embedding = operations.Conv3d( - 20, dim, kernel_size=patch_size, stride=patch_size, device=operation_settings.get("device"), dtype=torch.float32) + in_dim, dim, kernel_size=patch_size, stride=patch_size, device=operation_settings.get("device"), dtype=torch.float32) self.text_embedding = nn.Sequential( operations.Linear(text_dim, dim, device=operation_settings.get("device"), dtype=operation_settings.get("dtype")), nn.GELU(approximate='tanh'), operations.Linear(dim, dim, device=operation_settings.get("device"), dtype=operation_settings.get("dtype"))) diff --git a/comfy_extras/nodes_wan.py b/comfy_extras/nodes_wan.py index 3563b3ad7..d929eee39 100644 --- a/comfy_extras/nodes_wan.py +++ b/comfy_extras/nodes_wan.py @@ -672,11 +672,11 @@ class WanTrackToVideo: mask, video = motion_patched[:, 0:4], motion_patched[:, 4:] # Add motion features to conditioning positive = node_helpers.conditioning_set_values(positive, - {"concat_mask": mask, - "concat_latent_image": video}) + {"concat_mask": motion_patched, + "concat_latent_image": image}) negative = node_helpers.conditioning_set_values(negative, - {"concat_mask": mask, - "concat_latent_image": video}) + {"concat_mask": motion_patched, + "concat_latent_image": image}) # Handle clip vision output if provided