Skip to content

[Bug] hunyuan video crashes with init img, ggml assert #1814

Description

@sca255

Git commit

5114672

Operating System & Version

manjaro not fully updated

GGML backends

Vulkan

Command-line arguments used

./sd-cli -M vid_gen --diffusion-model /home/arp/sd.cpp-webui/models/unet/hunyuanvideo1.5_480p_i2v_cfg_distilled-Q4_K_S.gguf --t5xxl /home/arp/sd.cpp-webui/models/text_encoders/byt5_small_glyphxl_fp16.safetensors --llm /home/arp/sd.cpp-webui/models/text_encoders/Qwen2.5-VL-7B-Instruct.Q3_K_L.gguf --taesd /home/arp/sd.cpp-webui/models/taesd/taehv1_5.pth -p "" -i /mnt/d/projects/sd.cpp-jsui/user_data/uploads/1784882370351_12_7.png -W 720 -H 480 --steps 4 --sampling-method euler_a --scheduler discrete --cfg-scale 1 -s -1 --video-frames 153 --fps 24 --temporal-tiling --offload-to-cpu --clip-on-cpu --eager-load --fa -o /mnt/d/projects/sd.cpp-jsui/outputs/any2video/output_001.mp4 --guidance 1

Steps to reproduce

the command

What you expected to happen

generate vid from img

What actually happened

crashes

Logs / error messages / stack trace

--temporal-tiling --offload-to-cpu --clip-on-cpu --eager-load --fa -o /mnt/d/projects/sd.cpp-jsui/outputs/any2video/output_001.mp4 --guidance 1
ggml_vulkan: Found 2 Vulkan devices:
ggml_vulkan: 0 = AMD Radeon RX 580 2048SP (RADV POLARIS10) (radv) | uma: 0 | fp16: 0 | bf16: 0 | warp size: 64 | shared memory: 65536 | int dot: 0 | matrix cores: none
ggml_vulkan: 1 = Intel(R) UHD Graphics 630 (CML GT2) (Intel open-source Mesa driver) | uma: 1 | fp16: 1 | bf16: 0 | warp size: 32 | shared memory: 49152 | int dot: 0 | matrix cores: none
[INFO ] media_io.cpp:575 - crop input image from 2304x1792 to 2304x1536, image_path = /mnt/d/projects/sd.cpp-jsui/user_data/uploads/1784882370351_12_7.png
[INFO ] media_io.cpp:592 - resize input image from 2304x1536 to 720x480
[INFO ] stable-diffusion.cpp:717 - loading diffusion model from '/home/arp/sd.cpp-webui/models/unet/hunyuanvideo1.5_480p_i2v_cfg_distilled-Q4_K_S.gguf'
[INFO ] model_loader.cpp:236 - load /home/arp/sd.cpp-webui/models/unet/hunyuanvideo1.5_480p_i2v_cfg_distilled-Q4_K_S.gguf using gguf format
[ERROR] ggml_extend.hpp:72 - gguf_init_from_reader: tensor 'img_in.proj.weight' has invalid number of dimensions: 5 > 4
[ERROR] ggml_extend.hpp:72 - gguf_init_from_reader: failed to read tensor info
[INFO ] stable-diffusion.cpp:764 - loading t5xxl from '/home/arp/sd.cpp-webui/models/text_encoders/byt5_small_glyphxl_fp16.safetensors'
[INFO ] model_loader.cpp:242 - load /home/arp/sd.cpp-webui/models/text_encoders/byt5_small_glyphxl_fp16.safetensors using safetensors format
[INFO ] stable-diffusion.cpp:779 - loading llm from '/home/arp/sd.cpp-webui/models/text_encoders/Qwen2.5-VL-7B-Instruct.Q3_K_L.gguf'
[INFO ] model_loader.cpp:236 - load /home/arp/sd.cpp-webui/models/text_encoders/Qwen2.5-VL-7B-Instruct.Q3_K_L.gguf using gguf format
[INFO ] stable-diffusion.cpp:801 - loading tae from '/home/arp/sd.cpp-webui/models/taesd/taehv1_5.pth'
[INFO ] model_loader.cpp:245 - load /home/arp/sd.cpp-webui/models/taesd/taehv1_5.pth using torch zip format
[INFO ] stable-diffusion.cpp:854 - Version: Hunyuan Video
[INFO ] stable-diffusion.cpp:909 - Weight type stat: f32: 142 | f16: 1057 | q3_K: 113 | q4_K: 542 | q5_K: 84
[INFO ] stable-diffusion.cpp:910 - Conditioner weight type stat: f32: 141 | f16: 111 | q3_K: 113 | q5_K: 84
[INFO ] stable-diffusion.cpp:911 - Diffusion model weight type stat: f32: 1 | f16: 818 | q4_K: 542
[INFO ] stable-diffusion.cpp:912 - VAE weight type stat:
[INFO ] hunyuan.hpp:556 - HunyuanVideo blocks: 54 double, 0 single
[INFO ] stable-diffusion.cpp:1391 - using TAE for encoding / decoding
[INFO ] stable-diffusion.cpp:1505 - Using flash attention
[INFO ] stable-diffusion.cpp:1519 - Using flash attention in the diffusion model
|#################################### | 1361/1938 - 7.41MB/s
|###################################### | 1472/1938 - 7.65MB/s
|############################################### | 1810/1938 - 9.33MB/s
|##################################################| 1938/1938 - 9.33MB/s
[INFO ] model_loader.cpp:1279 - loading tensors completed, taking 921.39s (read: 5491.21s, memcpy: 0.00s, convert: 0.77s, copy_to_backend: 0.00s)
[INFO ] stable-diffusion.cpp:1625 - total params memory size = 10461.59MB (VRAM 0.00MB, RAM 10461.59MB): text_encoders 5741.07MB(RAM), diffusion_model 4698.82MB(RAM), vae 21.70MB(RAM), controlnet 0.00MB(N/A), extensions 0.00MB(N/A)
[INFO ] stable-diffusion.cpp:1741 - running in FLOW mode
[INFO ] denoiser.hpp:1026 - get_sigmas with discrete scheduler
[INFO ] stable-diffusion.cpp:4171 - sampling using Euler A method
[INFO ] stable-diffusion.cpp:5703 - Hunyuan Video IMG2VID
/home/arp/stable-diffusion.cpp/ggml/src/ggml.c:4429: GGML_ASSERT(a->ne[2] == b->ne[2]) failed

Additional context / environment details

No response

Metadata

Metadata

Assignees

No one assigned

    Labels

    bugSomething isn't working

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions