Teledysk, który nie ilustruje tekstu

Od jakiegoś czasu buduję z Hermesem pipeline do generowania teledysków. Założenie jest proste: wrzucam plik muzyczny z metadanymi, agent robi scenariusz, klatki, klipy i montuje całość. To zadanie na noc — GPU na minipcu renderuje, a rano jest gotowy film.

Ale dziś nie renderowaliśmy ani jednej klatki. Zajęliśmy się czymś, co jest ważniejsze od samego renderu: ustaleniem, jak w ogóle wygląda prawdziwy teledysk w danym gatunku.

Problem: AI ilustruje tekst dosłownie

Jak każdy, kto bawił się generowaniem teledysków z AI, wiem, że model dostaje tekst piosenki i robi obrazki jeden-do-jednego. W tekście jest „jadę nocą autostradą"? Dostajesz samochód na autostradzie. „Płonie ogień w moich oczach"? Masz oczy z ogniem.

Tylko że prawdziwe teledyski tak nie działają. Nikt nie kręci dosłownie tego, co jest w tekście. Teledysk to osobny język filmowy — ma własne konwencje, plany, światło, tempo. I te konwencje różnią się zależnie od gatunku.

Co zrobił Hermes

Zamiast zgadywać, kazałem mu zbadać temat porządnie. Polecenie było konkretne: sześć gatunków spokojnych i narracyjnych — country, americana, folk/acoustic, ballady, singer-songwriter, indie folk — i dla każdego ustalić:

  • jaki typ teledysku dominuje (występ artysty czy narracja z aktorami),
  • jakie plany i ujęcia (jak blisko twarzy, czy widać ręce na gitarze, czy szerokie krajobrazy),
  • oświetlenie i paletę,
  • typowe lokacje i motywy,
  • tempo montażu,
  • jak pokazuje się twarz artysty,
  • plus 2-3 konkretne, prawdziwe teledyski z działającymi linkami.

Agent poszukał źródeł — artykuły o konwencjach, rankingi teledysków, przewodniki po generowaniu z AI — i złożył z tego dokument. Wyszło z tego kilka rzeczy, które mnie zaskoczyły.

Po pierwsze, country i folk to nie jest „występ z gitarą". To w dużej mierze historia opowiedziana obrazami — droga, dom rodzinny, złota godzina, ciepłe sepia. Występ jest, ale często przeplatany narracją.

Po drugie, tempa montażu nikt w źródłach nie podaje w sekundach. I tu jest rzecz, którą najbardziej doceniłem: Hermes nie dopisał „średnio 4 sekundy na ujęcie", bo tego w żadnym źródle nie było. Wpisał „nie ustalono". Dokładnie tak, jak mu przykazałem — nie wymyślaj danych.

Po co to wszystko

Ten dokument to nie jest praca na pokaz. To wejście do pipeline’u: zanim GPU dostanie cokolwiek do renderowania, scenariusz musi mówić językiem właściwego gatunku. Ballada ma wyglądać jak ballada, a indie folk jak indie folk — inaczej wyjdzie ten sam generyczny „AI look", który wszyscy rozpoznają na pierwszy rzut oka.

I tu widać tę drugą rolę agenta, o której warto mówić głośno: doradczą. Ja z energetyki wiem sporo o produkcji prądu, ale nie mam pojęcia, czym się różni kadrowanie teledysku country od teledysku indie folk. Hermes wszedł w temat jak ktoś, kto zna konwencje filmowe, poszukał prawdziwych źródeł i wrócił z wiedzą, której sam bym długo nie zbierał.

Rzecz jasna — nadal pilnuję. Polecenie „nie wymyślaj danych" wziąłem do siebie i sprawdzam, czy linki faktycznie działają. Ale większość roboty, od wyszukania źródeł po uporządkowanie tego w jedną notatkę, zrobił się praktycznie sam.

Teledyski przyjdą później. Najpierw gramatyka.