Git commit
5114672
Operating System & Version
manjaro not fully updated
GGML backends
Vulkan
Command-line arguments used
./sd-cli -M vid_gen --diffusion-model /home/arp/sd.cpp-webui/models/unet/hunyuanvideo1.5_480p_i2v_cfg_distilled-Q4_K_S.gguf --t5xxl /home/arp/sd.cpp-webui/models/text_encoders/byt5_small_glyphxl_fp16.safetensors --llm /home/arp/sd.cpp-webui/models/text_encoders/Qwen2.5-VL-7B-Instruct.Q3_K_L.gguf --taesd /home/arp/sd.cpp-webui/models/taesd/taehv1_5.pth -p "" -i /mnt/d/projects/sd.cpp-jsui/user_data/uploads/1784882370351_12_7.png -W 720 -H 480 --steps 4 --sampling-method euler_a --scheduler discrete --cfg-scale 1 -s -1 --video-frames 153 --fps 24 --temporal-tiling --offload-to-cpu --clip-on-cpu --eager-load --fa -o /mnt/d/projects/sd.cpp-jsui/outputs/any2video/output_001.mp4 --guidance 1
Steps to reproduce
the command
What you expected to happen
generate vid from img
What actually happened
crashes
Logs / error messages / stack trace
--temporal-tiling --offload-to-cpu --clip-on-cpu --eager-load --fa -o /mnt/d/projects/sd.cpp-jsui/outputs/any2video/output_001.mp4 --guidance 1
ggml_vulkan: Found 2 Vulkan devices:
ggml_vulkan: 0 = AMD Radeon RX 580 2048SP (RADV POLARIS10) (radv) | uma: 0 | fp16: 0 | bf16: 0 | warp size: 64 | shared memory: 65536 | int dot: 0 | matrix cores: none
ggml_vulkan: 1 = Intel(R) UHD Graphics 630 (CML GT2) (Intel open-source Mesa driver) | uma: 1 | fp16: 1 | bf16: 0 | warp size: 32 | shared memory: 49152 | int dot: 0 | matrix cores: none
[INFO ] media_io.cpp:575 - crop input image from 2304x1792 to 2304x1536, image_path = /mnt/d/projects/sd.cpp-jsui/user_data/uploads/1784882370351_12_7.png
[INFO ] media_io.cpp:592 - resize input image from 2304x1536 to 720x480
[INFO ] stable-diffusion.cpp:717 - loading diffusion model from '/home/arp/sd.cpp-webui/models/unet/hunyuanvideo1.5_480p_i2v_cfg_distilled-Q4_K_S.gguf'
[INFO ] model_loader.cpp:236 - load /home/arp/sd.cpp-webui/models/unet/hunyuanvideo1.5_480p_i2v_cfg_distilled-Q4_K_S.gguf using gguf format
[ERROR] ggml_extend.hpp:72 - gguf_init_from_reader: tensor 'img_in.proj.weight' has invalid number of dimensions: 5 > 4
[ERROR] ggml_extend.hpp:72 - gguf_init_from_reader: failed to read tensor info
[INFO ] stable-diffusion.cpp:764 - loading t5xxl from '/home/arp/sd.cpp-webui/models/text_encoders/byt5_small_glyphxl_fp16.safetensors'
[INFO ] model_loader.cpp:242 - load /home/arp/sd.cpp-webui/models/text_encoders/byt5_small_glyphxl_fp16.safetensors using safetensors format
[INFO ] stable-diffusion.cpp:779 - loading llm from '/home/arp/sd.cpp-webui/models/text_encoders/Qwen2.5-VL-7B-Instruct.Q3_K_L.gguf'
[INFO ] model_loader.cpp:236 - load /home/arp/sd.cpp-webui/models/text_encoders/Qwen2.5-VL-7B-Instruct.Q3_K_L.gguf using gguf format
[INFO ] stable-diffusion.cpp:801 - loading tae from '/home/arp/sd.cpp-webui/models/taesd/taehv1_5.pth'
[INFO ] model_loader.cpp:245 - load /home/arp/sd.cpp-webui/models/taesd/taehv1_5.pth using torch zip format
[INFO ] stable-diffusion.cpp:854 - Version: Hunyuan Video
[INFO ] stable-diffusion.cpp:909 - Weight type stat: f32: 142 | f16: 1057 | q3_K: 113 | q4_K: 542 | q5_K: 84
[INFO ] stable-diffusion.cpp:910 - Conditioner weight type stat: f32: 141 | f16: 111 | q3_K: 113 | q5_K: 84
[INFO ] stable-diffusion.cpp:911 - Diffusion model weight type stat: f32: 1 | f16: 818 | q4_K: 542
[INFO ] stable-diffusion.cpp:912 - VAE weight type stat:
[INFO ] hunyuan.hpp:556 - HunyuanVideo blocks: 54 double, 0 single
[INFO ] stable-diffusion.cpp:1391 - using TAE for encoding / decoding
[INFO ] stable-diffusion.cpp:1505 - Using flash attention
[INFO ] stable-diffusion.cpp:1519 - Using flash attention in the diffusion model
|#################################### | 1361/1938 - 7.41MB/s
|###################################### | 1472/1938 - 7.65MB/s
|############################################### | 1810/1938 - 9.33MB/s
|##################################################| 1938/1938 - 9.33MB/s
[INFO ] model_loader.cpp:1279 - loading tensors completed, taking 921.39s (read: 5491.21s, memcpy: 0.00s, convert: 0.77s, copy_to_backend: 0.00s)
[INFO ] stable-diffusion.cpp:1625 - total params memory size = 10461.59MB (VRAM 0.00MB, RAM 10461.59MB): text_encoders 5741.07MB(RAM), diffusion_model 4698.82MB(RAM), vae 21.70MB(RAM), controlnet 0.00MB(N/A), extensions 0.00MB(N/A)
[INFO ] stable-diffusion.cpp:1741 - running in FLOW mode
[INFO ] denoiser.hpp:1026 - get_sigmas with discrete scheduler
[INFO ] stable-diffusion.cpp:4171 - sampling using Euler A method
[INFO ] stable-diffusion.cpp:5703 - Hunyuan Video IMG2VID
/home/arp/stable-diffusion.cpp/ggml/src/ggml.c:4429: GGML_ASSERT(a->ne[2] == b->ne[2]) failed
Additional context / environment details
No response
Git commit
5114672
Operating System & Version
manjaro not fully updated
GGML backends
Vulkan
Command-line arguments used
./sd-cli -M vid_gen --diffusion-model /home/arp/sd.cpp-webui/models/unet/hunyuanvideo1.5_480p_i2v_cfg_distilled-Q4_K_S.gguf --t5xxl /home/arp/sd.cpp-webui/models/text_encoders/byt5_small_glyphxl_fp16.safetensors --llm /home/arp/sd.cpp-webui/models/text_encoders/Qwen2.5-VL-7B-Instruct.Q3_K_L.gguf --taesd /home/arp/sd.cpp-webui/models/taesd/taehv1_5.pth -p "" -i /mnt/d/projects/sd.cpp-jsui/user_data/uploads/1784882370351_12_7.png -W 720 -H 480 --steps 4 --sampling-method euler_a --scheduler discrete --cfg-scale 1 -s -1 --video-frames 153 --fps 24 --temporal-tiling --offload-to-cpu --clip-on-cpu --eager-load --fa -o /mnt/d/projects/sd.cpp-jsui/outputs/any2video/output_001.mp4 --guidance 1
Steps to reproduce
the command
What you expected to happen
generate vid from img
What actually happened
crashes
Logs / error messages / stack trace
--temporal-tiling --offload-to-cpu --clip-on-cpu --eager-load --fa -o /mnt/d/projects/sd.cpp-jsui/outputs/any2video/output_001.mp4 --guidance 1
ggml_vulkan: Found 2 Vulkan devices:
ggml_vulkan: 0 = AMD Radeon RX 580 2048SP (RADV POLARIS10) (radv) | uma: 0 | fp16: 0 | bf16: 0 | warp size: 64 | shared memory: 65536 | int dot: 0 | matrix cores: none
ggml_vulkan: 1 = Intel(R) UHD Graphics 630 (CML GT2) (Intel open-source Mesa driver) | uma: 1 | fp16: 1 | bf16: 0 | warp size: 32 | shared memory: 49152 | int dot: 0 | matrix cores: none
[INFO ] media_io.cpp:575 - crop input image from 2304x1792 to 2304x1536, image_path = /mnt/d/projects/sd.cpp-jsui/user_data/uploads/1784882370351_12_7.png
[INFO ] media_io.cpp:592 - resize input image from 2304x1536 to 720x480
[INFO ] stable-diffusion.cpp:717 - loading diffusion model from '/home/arp/sd.cpp-webui/models/unet/hunyuanvideo1.5_480p_i2v_cfg_distilled-Q4_K_S.gguf'
[INFO ] model_loader.cpp:236 - load /home/arp/sd.cpp-webui/models/unet/hunyuanvideo1.5_480p_i2v_cfg_distilled-Q4_K_S.gguf using gguf format
[ERROR] ggml_extend.hpp:72 - gguf_init_from_reader: tensor 'img_in.proj.weight' has invalid number of dimensions: 5 > 4
[ERROR] ggml_extend.hpp:72 - gguf_init_from_reader: failed to read tensor info
[INFO ] stable-diffusion.cpp:764 - loading t5xxl from '/home/arp/sd.cpp-webui/models/text_encoders/byt5_small_glyphxl_fp16.safetensors'
[INFO ] model_loader.cpp:242 - load /home/arp/sd.cpp-webui/models/text_encoders/byt5_small_glyphxl_fp16.safetensors using safetensors format
[INFO ] stable-diffusion.cpp:779 - loading llm from '/home/arp/sd.cpp-webui/models/text_encoders/Qwen2.5-VL-7B-Instruct.Q3_K_L.gguf'
[INFO ] model_loader.cpp:236 - load /home/arp/sd.cpp-webui/models/text_encoders/Qwen2.5-VL-7B-Instruct.Q3_K_L.gguf using gguf format
[INFO ] stable-diffusion.cpp:801 - loading tae from '/home/arp/sd.cpp-webui/models/taesd/taehv1_5.pth'
[INFO ] model_loader.cpp:245 - load /home/arp/sd.cpp-webui/models/taesd/taehv1_5.pth using torch zip format
[INFO ] stable-diffusion.cpp:854 - Version: Hunyuan Video
[INFO ] stable-diffusion.cpp:909 - Weight type stat: f32: 142 | f16: 1057 | q3_K: 113 | q4_K: 542 | q5_K: 84
[INFO ] stable-diffusion.cpp:910 - Conditioner weight type stat: f32: 141 | f16: 111 | q3_K: 113 | q5_K: 84
[INFO ] stable-diffusion.cpp:911 - Diffusion model weight type stat: f32: 1 | f16: 818 | q4_K: 542
[INFO ] stable-diffusion.cpp:912 - VAE weight type stat:
[INFO ] hunyuan.hpp:556 - HunyuanVideo blocks: 54 double, 0 single
[INFO ] stable-diffusion.cpp:1391 - using TAE for encoding / decoding
[INFO ] stable-diffusion.cpp:1505 - Using flash attention
[INFO ] stable-diffusion.cpp:1519 - Using flash attention in the diffusion model
|#################################### | 1361/1938 - 7.41MB/s
|###################################### | 1472/1938 - 7.65MB/s
|############################################### | 1810/1938 - 9.33MB/s
|##################################################| 1938/1938 - 9.33MB/s
[INFO ] model_loader.cpp:1279 - loading tensors completed, taking 921.39s (read: 5491.21s, memcpy: 0.00s, convert: 0.77s, copy_to_backend: 0.00s)
[INFO ] stable-diffusion.cpp:1625 - total params memory size = 10461.59MB (VRAM 0.00MB, RAM 10461.59MB): text_encoders 5741.07MB(RAM), diffusion_model 4698.82MB(RAM), vae 21.70MB(RAM), controlnet 0.00MB(N/A), extensions 0.00MB(N/A)
[INFO ] stable-diffusion.cpp:1741 - running in FLOW mode
[INFO ] denoiser.hpp:1026 - get_sigmas with discrete scheduler
[INFO ] stable-diffusion.cpp:4171 - sampling using Euler A method
[INFO ] stable-diffusion.cpp:5703 - Hunyuan Video IMG2VID
/home/arp/stable-diffusion.cpp/ggml/src/ggml.c:4429: GGML_ASSERT(a->ne[2] == b->ne[2]) failed
Additional context / environment details
No response