Digital twin Dominiki — testy lokalne (15.09.2026)

Wszystko policzone u nas (4× DGX Spark GB10, ComfyUI). Ten sam skrypt w każdej próbie. Materiał: nagrania Dominiki z 14.09 (twin-nagrania-2026-09). Strona robocza, niepubliczna (noindex) — wizerunek i głos to dane biometryczne.

Skrypt testowy (ten sam we wszystkich próbach)
  1. Cześć! Mam na imię Dominika i jestem z Numeriki. To jest test dłuższego tekstu.
  2. Bartosz Paszek to najlepszy wspólnik. Trafił mi się jak ślepej kurze ziarno.
  3. Legia Warszawa to najlepszy klub, a kto nie wierzy, chuj mu w dziób.
  4. Kocham Czarodziejkę z Księżyca. I wiem, że czterdzieści plus sześćdziesiąt daje sto.
  5. Jest taka supertajna formuła w Excelu. Nazywa się SUMA. Ale nikomu nie mówcie.
  6. Excel to jedyny program, który zamienia datę urodzenia w liczbę czterdzieści cztery tysiące.
  7. Otwierasz plik, a on pyta, czy zapisać zmiany. Jakie zmiany? Ja tylko patrzyłam!
  8. Scal komórki to nie funkcja. To pułapka na ludzi, którzy ufają Excelowi. Koniec testu!

Grupy prób

LTX-2.3 — jeden model: obraz + głos + usta

L1

Baza: LTX-2.3 i2v, 8 ujęć, klon głosu z 5 s

Punkt odniesienia. Jeden model robi obraz, mowę po polsku i ruch ust naraz; głos sklonowany z 5 s referencji; obraz startuje z prawdziwej klatki Dominiki (3 klatki na zmianę).

Silnik

LTX-2.3 22B distilled fp8 (ComfyUI-h3, spark5) — jeden przebieg generuje wideo i audio

Wejście

3 klatki z nagrań (IMG_5110 @0.2 s, IMG_5137 @15.9 s, IMG_5125 @5.0 s) + 5 s głosu + 8 linijek tekstu w promptach (po jednej na ujęcie)

Modele / wagi

  • LTX-2.3 22B distilled (fp8) — model wideo+audioltx-2.3-22b-distilled-fp8.safetensors · źródło · checkpoint ComfyUI (zawiera VAE wideo i VAE audio); 29,5 GB
  • Gemma 3 12B IT (fp4 mixed) — enkoder tekstugemma_3_12B_it_fp4_mixed.safetensors · źródło · 9,4 GB

Ustawienia

rozdzielczość576×1024 (pion)
klatki/ujęcie201 = 8 s @ 25 fps
kroki8 (distilled, ManualSigmas 1.0→0.0)
samplereuler_cfg_pp, cfg 1.0
klon głosuLTXVReferenceAudio, 5 s referencji (IMG_5137 2.0–7.2 s), identity_guidance_scale 3.0
i2vLTXVImgToVideoInplace strength 1.0, LTXVPreprocess 18
dekoderVAEDecodeTiled 768/64

Wykonanie

węzełspark5 (GB10)
czas renderu1695 s za 8 ujęć (~212 s/ujęcie)
ComfyUI prompt_idd8a3f7a5-404a-44ef-8e5e-15ddb501a131
graf APIjobs/20260915-ltx-dominika-E-8shots/workflow.json (143 węzły)
Transkrypcja Whisper (large-v3, PL) — miara zrozumiałości
shot1 | Cześć, mam na imię Dominika i jestem z Numeriki. To jest test dłuższego tekstu.
shot2 | Lonian, Bartosz Paszek to najlepszy wspólnik. Trafił mi się jak ślepej kurze ziarno.
shot3 | Legia Warszawa to najlepszy klub. A kto nie wierzy, chuj mu w dziób.
shot4 | Kocham czarodziejkę z Księżyca i wiem, że 40 plus 60 daje 100.
shot5 | Także co wiem, jest taka super tajna formuła w Excelu. Nazywa się SUMA. Ale nikomu nie mówcie!
shot6 | Excel to jedyny program, który zamienia datę urodzenia w bliskie 44 tysiące.
shot7 | Otwierasz plik, a on pyta, czy zapisać zmiany. Jakie zmiany? Ja tylko patrzyłam.
shot8 | Gmurki to nie funkcja, to pułapka na ludzi, którzy ufają Excelowi. Koniec testu.

Ocena / uwagi

Tożsamość i mimika bardzo dobre. 4/8 linijek idealne, 4/8 z błędem w pierwszej sekundzie (doklejona sylaba, dodany wstęp, 'Gmurki' zamiast 'Scal komórki') — LTX ma niestabilny start kwestii. Ogony ciszy przycięte do końca mowy (+0,45 s).

L2

720p: LTX-2.3 w 704×1280

Ta sama konfiguracja co L1, wyższa rozdzielczość (704×1280 zamiast 576×1024).

Silnik

LTX-2.3 22B distilled fp8 (ComfyUI-h3)

Wejście

jak L1 (linijki 1–8)

Modele / wagi

  • LTX-2.3 22B distilled (fp8) — model wideo+audioltx-2.3-22b-distilled-fp8.safetensors · źródło · checkpoint ComfyUI (zawiera VAE wideo i VAE audio); 29,5 GB
  • Gemma 3 12B IT (fp4 mixed) — enkoder tekstugemma_3_12B_it_fp4_mixed.safetensors · źródło · 9,4 GB

Ustawienia

rozdzielczość704×1280 (pion, 720p)
klatki/ujęcie201 = 8 s @ 25 fps
kroki8 (distilled, ManualSigmas 1.0→0.0)
samplereuler_cfg_pp, cfg 1.0
klon głosuLTXVReferenceAudio, 5 s referencji (IMG_5137 2.0–7.2 s), identity_guidance_scale 3.0
i2vLTXVImgToVideoInplace strength 1.0, LTXVPreprocess 18
dekoderVAEDecodeTiled 768/64

Wykonanie

węzełspark6
czas renderu2868 s (GPU)
ComfyUI prompt_id5a4862a7-0671-4ce6-9d5a-aab0b568b224
graf APIjobs/20260915-L2-ltx-720p/workflow.json
Transkrypcja Whisper (large-v3, PL) — miara zrozumiałości
shot1 | Cześć! Mam na imię Dominika i jestem z Numeriki. To jest test dłuższego tekstu.
shot2 | Pienodogę. Bartosz Paszek to najlepszy wspólnik. Trafił mi się jak ślepej kurze ziarno.
shot3 | Ja, Trogłaśka. Legia Warszawa to najlepszy klub, a kto nie wierzy, chuj mu w dziób.
shot4 | Kocham czarodzieńkę z księżyca I wiem, że 40 plus 60 daje 100
shot5 | Jest taka super tajna formuła w Excelu, nazywa się suma, ale nikomu nie mówcie.
shot6 | Excel to jedyny program, który zamienia datę urodzenia w bliskę 44 tysiące.
shot7 | Otwierasz plik, a on pyta czy zapisać zmiany. Jakie zmiany? Ja tylko patrzyłam.
shot8 | To pułapka na ludzi, którzy ufają Excelowi. Koniec testu.

Ocena / uwagi

Obraz wyraźnie ostrzejszy niż L1 (oczy, skóra, włosy — porównanie kadrów 1:1 w tej samej sekundzie), tożsamość i mimika jak w L1. Koszt: 2881 s za 8 ujęć (360 s/ujęcie, 1,7× dłużej niż 576×1024). Mowa: 5/8 idealnie, 2/8 z doklejoną sylabą/słowem na starcie („Pienodogę.", „Ja, Trogłaśka."), 1/8 z uciętym początkiem (shot 8 bez „Scal komórki to nie funkcja") — problem pierwszej sekundy nie zależy od rozdzielczości.

L4

Lek na zjadaną 1. sekundę: „bierze krótki oddech, potem mówi”

W TOKU
brak pliku

Jak L1, ale prompt każe najpierw wziąć oddech — sprawdzamy, czy początek kwestii przestaje ginąć.

Silnik

LTX-2.3 22B distilled fp8 (ComfyUI-h3)

Wejście

jak L1 (linijki 1–8)

Modele / wagi

  • LTX-2.3 22B distilled (fp8) — model wideo+audioltx-2.3-22b-distilled-fp8.safetensors · źródło · checkpoint ComfyUI (zawiera VAE wideo i VAE audio); 29,5 GB
  • Gemma 3 12B IT (fp4 mixed) — enkoder tekstugemma_3_12B_it_fp4_mixed.safetensors · źródło · 9,4 GB

Ustawienia

rozdzielczość576×1024 (pion)
klatki/ujęcie201 = 8 s @ 25 fps
kroki8 (distilled, ManualSigmas 1.0→0.0)
samplereuler_cfg_pp, cfg 1.0
klon głosuLTXVReferenceAudio, 5 s referencji (IMG_5137 2.0–7.2 s), identity_guidance_scale 3.0
i2vLTXVImgToVideoInplace strength 1.0, LTXVPreprocess 18
dekoderVAEDecodeTiled 768/64
promptShe takes a short breath, then says in Polish: „…”

Wykonanie

węzełspark5
ComfyUI prompt_idad4527f7-5aab-45d3-9484-6ead4b0a3d0b
graf APIjobs/20260915-L4-ltx-breath/workflow.json
L5

LTXVModalityGuidance 3.0 (sprzężenie audio↔wideo)

W TOKU
brak pliku

Jak L1 na linijkach 1–4 + dodatkowy przebieg z odciętą uwagą audio↔wideo, wynik dopychany do wersji sprzężonej (mocniejszy lip-sync).

Silnik

LTX-2.3 22B distilled fp8 (ComfyUI-h3)

Wejście

jak L1 (linijki 1–4)

Modele / wagi

  • LTX-2.3 22B distilled (fp8) — model wideo+audioltx-2.3-22b-distilled-fp8.safetensors · źródło · checkpoint ComfyUI (zawiera VAE wideo i VAE audio); 29,5 GB
  • Gemma 3 12B IT (fp4 mixed) — enkoder tekstugemma_3_12B_it_fp4_mixed.safetensors · źródło · 9,4 GB

Ustawienia

rozdzielczość576×1024 (pion)
klatki/ujęcie201 = 8 s @ 25 fps
kroki8 (distilled, ManualSigmas 1.0→0.0)
samplereuler_cfg_pp, cfg 1.0
klon głosuLTXVReferenceAudio, 5 s referencji (IMG_5137 2.0–7.2 s), identity_guidance_scale 3.0
i2vLTXVImgToVideoInplace strength 1.0, LTXVPreprocess 18
dekoderVAEDecodeTiled 768/64
modality_guidance3.0 (0–100 % kroków)

Wykonanie

węzełspark6
ComfyUI prompt_idb8082747-9ff6-4d25-a5b8-009a366a0628
graf APIjobs/20260915-L5-ltx-mg3/workflow.json
L6

LTXVSpatioTemporalGuidance 1.0 (detal i koherencja ruchu)

W TOKU
brak pliku

Jak L1 na linijkach 1–4 + STG (blok 29): przebieg z osłabioną self-attention i odpychanie od niego.

Silnik

LTX-2.3 22B distilled fp8 (ComfyUI-h3)

Wejście

jak L1 (linijki 1–4)

Modele / wagi

  • LTX-2.3 22B distilled (fp8) — model wideo+audioltx-2.3-22b-distilled-fp8.safetensors · źródło · checkpoint ComfyUI (zawiera VAE wideo i VAE audio); 29,5 GB
  • Gemma 3 12B IT (fp4 mixed) — enkoder tekstugemma_3_12B_it_fp4_mixed.safetensors · źródło · 9,4 GB

Ustawienia

rozdzielczość576×1024 (pion)
klatki/ujęcie201 = 8 s @ 25 fps
kroki8 (distilled, ManualSigmas 1.0→0.0)
samplereuler_cfg_pp, cfg 1.0
klon głosuLTXVReferenceAudio, 5 s referencji (IMG_5137 2.0–7.2 s), identity_guidance_scale 3.0
i2vLTXVImgToVideoInplace strength 1.0, LTXVPreprocess 18
dekoderVAEDecodeTiled 768/64
stgscale 1.0, blocks 29

Wykonanie

węzełspark6
ComfyUI prompt_id54b0aa23-d182-4611-8d61-5c942452324d
graf APIjobs/20260915-L6-ltx-stg1/workflow.json
L7

Ciągłe ujęcie bez cięć: extend (LTXVAddGuide)

W TOKU
brak pliku

Linijki 1–3 jako łańcuch: każde kolejne ujęcie startuje z ostatnich 9 klatek poprzedniego (guide @ klatka 0), overlap przycięty — 24 s bez cięcia montażowego.

Silnik

LTX-2.3 22B distilled fp8 (ComfyUI-h3)

Wejście

jak L1 (linijki 1–3)

Modele / wagi

  • LTX-2.3 22B distilled (fp8) — model wideo+audioltx-2.3-22b-distilled-fp8.safetensors · źródło · checkpoint ComfyUI (zawiera VAE wideo i VAE audio); 29,5 GB
  • Gemma 3 12B IT (fp4 mixed) — enkoder tekstugemma_3_12B_it_fp4_mixed.safetensors · źródło · 9,4 GB

Ustawienia

rozdzielczość576×1024 (pion)
klatki/ujęcie201 = 8 s @ 25 fps
kroki8 (distilled, ManualSigmas 1.0→0.0)
samplereuler_cfg_pp, cfg 1.0
klon głosuLTXVReferenceAudio, 5 s referencji (IMG_5137 2.0–7.2 s), identity_guidance_scale 3.0
i2vLTXVImgToVideoInplace strength 1.0, LTXVPreprocess 18
dekoderVAEDecodeTiled 768/64
łańcuchLTXVAddGuide(frame_idx 0, strength 1.0) z 9 ostatnich klatek + LTXVCropGuides
klatka startowaIMG_5110 @0.2 s (tylko 1. ujęcie)

Wykonanie

węzełspark5
ComfyUI prompt_id837d523d-abca-4b54-9610-039586a067ee
graf APIjobs/20260915-L7-ltx-extend/workflow.json
L8

Jedno długie ujęcie 24 s: LTXVContextWindows

W TOKU
brak pliku

Linijki 1–3 w JEDNYM prompcie, 601 klatek generowanych oknami 145/40 (pyramid, FreeNoise, retain_first_frame).

Silnik

LTX-2.3 22B distilled fp8 (ComfyUI-h3)

Wejście

jak L1 (linijki 1–3)

Modele / wagi

  • LTX-2.3 22B distilled (fp8) — model wideo+audioltx-2.3-22b-distilled-fp8.safetensors · źródło · checkpoint ComfyUI (zawiera VAE wideo i VAE audio); 29,5 GB
  • Gemma 3 12B IT (fp4 mixed) — enkoder tekstugemma_3_12B_it_fp4_mixed.safetensors · źródło · 9,4 GB

Ustawienia

rozdzielczość576×1024 (pion)
klatki/ujęcie601 = 24 s
kroki8 (distilled, ManualSigmas 1.0→0.0)
samplereuler_cfg_pp, cfg 1.0
klon głosuLTXVReferenceAudio, 5 s referencji (IMG_5137 2.0–7.2 s), identity_guidance_scale 3.0
i2vLTXVImgToVideoInplace strength 1.0, LTXVPreprocess 18
dekoderVAEDecodeTiled 768/64
context windows145 klatek, overlap 40, standard_uniform, pyramid, freenoise, retain_first_frame

Wykonanie

węzełspark6
ComfyUI prompt_id2d1e12db-3a8f-462f-950c-47339895f496
graf APIjobs/20260915-L8-ltx-cw/workflow.json
L10

ID-LoRA TalkVid (oficjalny klon głosu LTX-2.3)

W TOKU
brak pliku

Jak L1 + LoRA identyfikacji mówcy od Lightricks (trenowana na TalkVid) — dopiero z nią węzeł ReferenceAudio działa tak, jak zaprojektowano; L1 używał samego modelu bazowego.

Silnik

LTX-2.3 22B distilled fp8 (ComfyUI-h3)

Wejście

jak L1 (linijki 1–8)

Modele / wagi

  • LTX-2.3 22B distilled (fp8) — model wideo+audioltx-2.3-22b-distilled-fp8.safetensors · źródło · checkpoint ComfyUI (zawiera VAE wideo i VAE audio); 29,5 GB
  • Gemma 3 12B IT (fp4 mixed) — enkoder tekstugemma_3_12B_it_fp4_mixed.safetensors · źródło · 9,4 GB
  • LTX-2.3 ID-LoRA TalkVid 3kltx-2.3-id-lora-talkvid-3k.safetensors · źródło · 1,16 GB

Ustawienia

rozdzielczość576×1024 (pion)
klatki/ujęcie201 = 8 s @ 25 fps
kroki8 (distilled, ManualSigmas 1.0→0.0)
samplereuler_cfg_pp, cfg 1.0
klon głosuLTXVReferenceAudio, 5 s referencji (IMG_5137 2.0–7.2 s), identity_guidance_scale 3.0
i2vLTXVImgToVideoInplace strength 1.0, LTXVPreprocess 18
dekoderVAEDecodeTiled 768/64
id_loraltx-2.3-id-lora-talkvid-3k.safetensors, strength 1.0
_models[{'name': 'LTX-2.3 ID-LoRA TalkVid 3k', 'file': 'ltx-2.3-id-lora-talkvid-3k.safetensors', 'source': 'https://huggingface.co/Comfy-Org/ltx-2.3/tree/main/split_files/loras', 'note': '1,16 GB'}]

Wykonanie

węzełspark5
ComfyUI prompt_id912cc59b-8f26-4a47-946e-c08d64a23ff1
graf APIjobs/20260915-L10-ltx-idlora-talkvid/workflow.json
L11

ID-LoRA CelebV-HQ (drugi wariant klonu głosu)

W TOKU
brak pliku

Jak L10, inna LoRA identyfikacji (CelebV-HQ), linijki 1–4.

Silnik

LTX-2.3 22B distilled fp8 (ComfyUI-h3)

Wejście

jak L1 (linijki 1–4)

Modele / wagi

  • LTX-2.3 22B distilled (fp8) — model wideo+audioltx-2.3-22b-distilled-fp8.safetensors · źródło · checkpoint ComfyUI (zawiera VAE wideo i VAE audio); 29,5 GB
  • Gemma 3 12B IT (fp4 mixed) — enkoder tekstugemma_3_12B_it_fp4_mixed.safetensors · źródło · 9,4 GB
  • LTX-2.3 ID-LoRA CelebV-HQ 3kltx-2.3-id-lora-celebvhq-3k.safetensors · źródło · 1,16 GB

Ustawienia

rozdzielczość576×1024 (pion)
klatki/ujęcie201 = 8 s @ 25 fps
kroki8 (distilled, ManualSigmas 1.0→0.0)
samplereuler_cfg_pp, cfg 1.0
klon głosuLTXVReferenceAudio, 5 s referencji (IMG_5137 2.0–7.2 s), identity_guidance_scale 3.0
i2vLTXVImgToVideoInplace strength 1.0, LTXVPreprocess 18
dekoderVAEDecodeTiled 768/64
id_loraltx-2.3-id-lora-celebvhq-3k.safetensors, strength 1.0
_models[{'name': 'LTX-2.3 ID-LoRA CelebV-HQ 3k', 'file': 'ltx-2.3-id-lora-celebvhq-3k.safetensors', 'source': 'https://huggingface.co/Comfy-Org/ltx-2.3/tree/main/split_files/loras', 'note': '1,16 GB'}]

Wykonanie

węzełspark6
ComfyUI prompt_idf780d226-8d39-437f-a3e9-f0e06b755bfb
graf APIjobs/20260915-L11-ltx-idlora-celebvhq/workflow.json
L9

Inny model: Wan 2.2 I2V 14B — b-roll bez mowy

W TOKU
brak pliku

Wan 2.2 nie generuje mowy; pokazuje, jak inny model animuje tę samą klatkę (do przebitek między ujęciami z mową).

Silnik

Wan 2.2 I2V A14B fp8 (high-noise + low-noise) + lightx2v 4-step LoRA (ComfyUI-h3)

Wejście

klatka IMG_5125 @5.0 s + prompt „uśmiecha się, patrzy na laptop, pisze, kiwa głową”

Modele / wagi

  • Wan 2.2 I2V A14B high-noise (fp8)wan2.2_i2v_high_noise_14B_fp8_scaled.safetensors · źródło
  • Wan 2.2 I2V A14B low-noise (fp8)wan2.2_i2v_low_noise_14B_fp8_scaled.safetensors · źródło
  • lightx2v 4-step LoRA high/lowwan2.2_i2v_lightx2v_4steps_lora_v1_{high,low}_noise.safetensors · źródło
  • umt5-xxl fp8umt5_xxl_fp8_e4m3fn_scaled.safetensors · źródło
  • Wan 2.1 VAEwan_2.1_vae.safetensors · źródło

Ustawienia

rozdzielczość480×832
klatki81 @ 16 fps (5 s)
kroki4 (2 high-noise / 2 low-noise), cfg 1.0, euler simple, shift 5.0
seed2026091509

Wykonanie

węzełspark5
ComfyUI prompt_id2ada7052-4a96-4378-9fa8-6a01fa29fd74
graf APIjobs/20260915-L9-wan22-broll/workflow.json

InfiniteTalk — obraz pod gotowy dźwięk

I1

InfiniteTalk z PRAWDZIWYM audio (3,24 s) — test synchronizacji

Lewo oryginał, prawo InfiniteTalk z jednej klatki + jej prawdziwe nagranie (IMG_5110). Zapętlone 3×. Sprawdza, czy usta idą za dźwiękiem.

Silnik

InfiniteTalk (Wan 2.1 I2V 14B + patch InfiniteTalk), ComfyUI-h3 natywnie, spark8

Wejście

klatka IMG_5110 @0.2 s + audio IMG_5110 0,0–3,24 s (16 kHz, loudnorm −18)

Modele / wagi

  • Wan 2.1 I2V 14B 480p (fp8 scaled) — model wideowan2.1_i2v_480p_14B_fp8_scaled.safetensors · źródło · 16,4 GB
  • InfiniteTalk single-speaker (fp16) — patch audio→ustawan2.1_infiniteTalk_single_fp16.safetensors · źródło · 5,1 GB; MeiGen-AI/InfiniteTalk, Apache-2.0
  • lightx2v I2V 480p cfg/step-distill LoRA (rank 64)lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors · źródło · 6 kroków, cfg 1 — konieczne na GB10 (bug batchowania cond+uncond przy cfg>1)
  • chinese-wav2vec2-base — enkoder audiochinese-wav2vec2-base.bin · źródło · 380 MB
  • umt5-xxl (fp8) — enkoder tekstuumt5_xxl_fp8_e4m3fn_scaled.safetensors · źródło
  • CLIP ViT-H — enkoder klatki referencyjnejclip_vision_h.safetensors · źródło
  • Wan 2.1 VAEwan_2.1_vae.safetensors · źródło

Ustawienia

rozdzielczość480×832 (pion)
segment1 × 81 klatek (3,24 s)
kroki6, euler, scheduler normal, cfg 1.0 (LoRA lightx2v)
audio_scale1.0
klatka startowaIMG_5110 @0.2 s (480×832)
łańcuchprevious_frames = ostatnie 18 klatek poprzedniego segmentu + audio pre-cięte per segment; overlap 9 klatek przycięty przy sklejaniu

Wykonanie

węzełspark8
czas renderu184 s (GPU)
ComfyUI prompt_idaf702721-0a75-47b9-9f69-b9e090484c88
graf APIjobs/20260915-infinitetalk-dominika-D2-lightx2v/workflow.json

Ocena / uwagi

Tożsamość 1:1, usta w rytm mowy (start 0,8 s z głosem, zamknięcie w pauzie), model dodaje własne ruchy głowy i mrugnięcia. Wersja z cfg 4 / 20 kroków (D1) padła na bugu batchowania cond+uncond (ComfyUI upstream), stąd LoRA lightx2v + cfg 1.

I2

InfiniteTalk 44 s: głos Chatterbox (lokalny klon TTS)

Jeden ciągły klip z jednej klatki; dźwięk = 8 linijek z Chatterbox Multilingual (klon z 10 s próbki).

Silnik

InfiniteTalk (Wan 2.1 I2V 14B + patch), ComfyUI-h3 natywnie

Wejście

klatka IMG_5110 @0.2 s + audio G (Chatterbox, 44,2 s)

Modele / wagi

  • Wan 2.1 I2V 14B 480p (fp8 scaled) — model wideowan2.1_i2v_480p_14B_fp8_scaled.safetensors · źródło · 16,4 GB
  • InfiniteTalk single-speaker (fp16) — patch audio→ustawan2.1_infiniteTalk_single_fp16.safetensors · źródło · 5,1 GB; MeiGen-AI/InfiniteTalk, Apache-2.0
  • lightx2v I2V 480p cfg/step-distill LoRA (rank 64)lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors · źródło · 6 kroków, cfg 1 — konieczne na GB10 (bug batchowania cond+uncond przy cfg>1)
  • chinese-wav2vec2-base — enkoder audiochinese-wav2vec2-base.bin · źródło · 380 MB
  • umt5-xxl (fp8) — enkoder tekstuumt5_xxl_fp8_e4m3fn_scaled.safetensors · źródło
  • CLIP ViT-H — enkoder klatki referencyjnejclip_vision_h.safetensors · źródło
  • Wan 2.1 VAEwan_2.1_vae.safetensors · źródło

Ustawienia

rozdzielczość480×832 (pion)
segment81 klatek @ 25 fps, motion_frame_count 9 → 72 nowych klatek/segment
kroki6, euler, scheduler normal, cfg 1.0 (LoRA lightx2v)
audio_scale1.0
klatka startowaIMG_5110 @0.2 s (480×832)
łańcuchprevious_frames = ostatnie 18 klatek poprzedniego segmentu + audio pre-cięte per segment; overlap 9 klatek przycięty przy sklejaniu
segmenty16 × 81 klatek

Wykonanie

węzełspark8
czas renderu2747 s (GPU)
ComfyUI prompt_id3dbaf2e0-357f-41ec-b100-ad0710fc7e13
graf APIjobs/20260915-infinitetalk-F2-chatterbox-chain/workflow.json

Ocena / uwagi

Obraz: tożsamość stabilna przez 44 s (16 segmentów, bez dryfu koloru i twarzy), łączenia segmentów niewidoczne. Usta idą za dźwiękiem, ale dźwięk jest słabym ogniwem — Chatterbox zjada „ść" i nosówki (patrz T2). 2747 s GPU = ~172 s na segment 3,24 s → ~53× wolniej niż czas rzeczywisty na jednym GB10.

I3

InfiniteTalk 60 s: głos z LTX (klon z 5 s)

W TOKU
brak pliku

Jeden ciągły klip z jednej klatki; dźwięk = ścieżka audio z L1 (LTX-2.3 mówi jej głosem).

Silnik

InfiniteTalk (Wan 2.1 I2V 14B + patch), ComfyUI-h3 natywnie

Wejście

klatka IMG_5110 @0.2 s + audio z L1 (60,3 s)

Modele / wagi

  • Wan 2.1 I2V 14B 480p (fp8 scaled) — model wideowan2.1_i2v_480p_14B_fp8_scaled.safetensors · źródło · 16,4 GB
  • InfiniteTalk single-speaker (fp16) — patch audio→ustawan2.1_infiniteTalk_single_fp16.safetensors · źródło · 5,1 GB; MeiGen-AI/InfiniteTalk, Apache-2.0
  • lightx2v I2V 480p cfg/step-distill LoRA (rank 64)lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors · źródło · 6 kroków, cfg 1 — konieczne na GB10 (bug batchowania cond+uncond przy cfg>1)
  • chinese-wav2vec2-base — enkoder audiochinese-wav2vec2-base.bin · źródło · 380 MB
  • umt5-xxl (fp8) — enkoder tekstuumt5_xxl_fp8_e4m3fn_scaled.safetensors · źródło
  • CLIP ViT-H — enkoder klatki referencyjnejclip_vision_h.safetensors · źródło
  • Wan 2.1 VAEwan_2.1_vae.safetensors · źródło

Ustawienia

rozdzielczość480×832 (pion)
segment81 klatek @ 25 fps, motion_frame_count 9 → 72 nowych klatek/segment
kroki6, euler, scheduler normal, cfg 1.0 (LoRA lightx2v)
audio_scale1.0
klatka startowaIMG_5110 @0.2 s (480×832)
łańcuchprevious_frames = ostatnie 18 klatek poprzedniego segmentu + audio pre-cięte per segment; overlap 9 klatek przycięty przy sklejaniu
segmenty21 × 81 klatek

Wykonanie

węzełspark8
ComfyUI prompt_id37f0f377-8942-4c83-a22a-f3bb80c5a882
graf APIjobs/20260915-infinitetalk-F-ltxvoice-chain/workflow.json
I5

InfiniteTalk: bliższa klatka + audio_scale 1.5

Linijki 1–3 (głos z LTX). Inna klatka startowa (IMG_5125 @5.0 s, bliższy kadr) i mocniejsze sprzężenie z dźwiękiem (audio_scale 1.5 zamiast 1.0).

Silnik

InfiniteTalk (Wan 2.1 I2V 14B + patch), ComfyUI-h3 natywnie

Wejście

klatka IMG_5125 @5.0 s (480×832) + audio z L1, linijki 1–3 (24,5 s)

Modele / wagi

  • Wan 2.1 I2V 14B 480p (fp8 scaled) — model wideowan2.1_i2v_480p_14B_fp8_scaled.safetensors · źródło · 16,4 GB
  • InfiniteTalk single-speaker (fp16) — patch audio→ustawan2.1_infiniteTalk_single_fp16.safetensors · źródło · 5,1 GB; MeiGen-AI/InfiniteTalk, Apache-2.0
  • lightx2v I2V 480p cfg/step-distill LoRA (rank 64)lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors · źródło · 6 kroków, cfg 1 — konieczne na GB10 (bug batchowania cond+uncond przy cfg>1)
  • chinese-wav2vec2-base — enkoder audiochinese-wav2vec2-base.bin · źródło · 380 MB
  • umt5-xxl (fp8) — enkoder tekstuumt5_xxl_fp8_e4m3fn_scaled.safetensors · źródło
  • CLIP ViT-H — enkoder klatki referencyjnejclip_vision_h.safetensors · źródło
  • Wan 2.1 VAEwan_2.1_vae.safetensors · źródło

Ustawienia

rozdzielczość480×832 (pion)
segment81 klatek @ 25 fps, motion_frame_count 9 → 72 nowych klatek/segment
kroki6, euler, scheduler normal, cfg 1.0 (LoRA lightx2v)
audio_scale1.5
klatka startowaIMG_5125 @5.0 s (480×832)
łańcuchprevious_frames = ostatnie 18 klatek poprzedniego segmentu + audio pre-cięte per segment; overlap 9 klatek przycięty przy sklejaniu
segmenty9 × 81 klatek

Wykonanie

węzełspark7
czas renderu1538 s (GPU)
ComfyUI prompt_id4ff22a42-2f63-45d8-8606-f903028fb908
graf APIjobs/20260915-I5-infinitetalk-as15-5125/workflow.json

Ocena / uwagi

Bliższy kadr + audio_scale 1.5: usta pracują wyraźnie mocniej (szerokie „o", uśmiech z zębami, zaokrąglone wargi), więcej mimiki i ruchu głowy niż przy 1.0 — miejscami aż za dużo (przerysowane kształty ust w połowie słów). Tożsamość stabilna przez 24,5 s. 1538 s GPU za 9 segmentów (~171 s/segment) — czas nie zależy od audio_scale.

I4

InfiniteTalk 720p (wan2.1_i2v_720p)

W TOKU
brak pliku

Linijki 1–3 (głos z LTX) w 720×1280 na bazie Wan 2.1 I2V 720p — ten sam patch InfiniteTalk i LoRA lightx2v (480p, działa też z 720p).

Silnik

InfiniteTalk (Wan 2.1 I2V 14B + patch), ComfyUI-h3 natywnie

Wejście

klatka IMG_5110 @0.2 s (720×1280) + audio z L1, linijki 1–3 (24,5 s)

Modele / wagi

  • Wan 2.1 I2V 14B 720p (fp8 scaled) — model wideowan2.1_i2v_720p_14B_fp8_scaled.safetensors · źródło · 16,4 GB
  • InfiniteTalk single-speaker (fp16) — patch audio→ustawan2.1_infiniteTalk_single_fp16.safetensors · źródło · 5,1 GB; MeiGen-AI/InfiniteTalk, Apache-2.0
  • lightx2v I2V 480p cfg/step-distill LoRA (rank 64)lightx2v_I2V_14B_480p_cfg_step_distill_rank64_bf16.safetensors · źródło · 6 kroków, cfg 1 — konieczne na GB10 (bug batchowania cond+uncond przy cfg>1)
  • chinese-wav2vec2-base — enkoder audiochinese-wav2vec2-base.bin · źródło · 380 MB
  • umt5-xxl (fp8) — enkoder tekstuumt5_xxl_fp8_e4m3fn_scaled.safetensors · źródło
  • CLIP ViT-H — enkoder klatki referencyjnejclip_vision_h.safetensors · źródło
  • Wan 2.1 VAEwan_2.1_vae.safetensors · źródło

Ustawienia

rozdzielczość720×1280 (pion, 720p)
segment81 klatek @ 25 fps, motion_frame_count 9 → 72 nowych klatek/segment
kroki6, euler, scheduler normal, cfg 1.0 (LoRA lightx2v)
audio_scale1.0
klatka startowaIMG_5110 @0.2 s (720×1280)
łańcuchprevious_frames = ostatnie 18 klatek poprzedniego segmentu + audio pre-cięte per segment; overlap 9 klatek przycięty przy sklejaniu
segmenty9 × 81 klatek

Wykonanie

węzełspark7
ComfyUI prompt_id2b11b911-cb72-45fb-9a74-909d40618fa2
graf APIjobs/20260915-I4-infinitetalk-720p/workflow.json

Sam głos — porównanie

T

Linijka 1 w pięciu wersjach

T1 — LTX-2.3 klon z 5 s (ścieżka z L1)
T2 — Chatterbox Multilingual, próbka A (10 s)
T3 — Chatterbox Multilingual, próbka B (12 s), exaggeration 0.3
T4 — Piper pl_PL-gosia (głos syntetyczny, NIE klon — punkt odniesienia)
T5 — ORYGINAŁ: 10 s prawdziwego nagrania (prawda)

Ten sam tekst: „Cześć! Mam na imię Dominika i jestem z Numeriki. To jest test dłuższego tekstu.” Odsłuchaj i porównaj z oryginałem (T5).

Silnik

T1: LTX-2.3 (ReferenceAudio) · T2/T3: Chatterbox Multilingual 0.1.4 (Resemble AI, MIT; venv na spark8) · T4: Piper 1.2 (Tank, CPU)

Wejście

T1: 5 s ref (IMG_5137) · T2: 10 s z datasetu · T3: 12 s z datasetu · T4: brak (głos Gosia)

Modele / wagi

  • Chatterbox MultilingualResembleAI/chatterbox (t3_mtl23ls_v2, s3gen, ve) · źródło
  • Piper pl_PL-gosia-mediumpl_PL-gosia-medium.onnx · źródło

Ustawienia

Chatterboxlanguage_id=pl, exaggeration 0.45/0.3, cfg_weight 0.5, temperature 0.7/0.6, 24 kHz
Whisper T2„Cze! Mam na imię Dominika i jestem z Numeriki…”
Whisper T3„Czeeej! Mam na imię Dominika, jestem z Numeriki…”

Wykonanie

Ocena / uwagi

Chatterbox: zrozumiały, ale polskie „ść”, nosówki i nazwiska wychodzą krzywo; ElevenLabs nieużyty (klucz w konfiguracji to ID klucza, nie klucz API).