Jak uczymy nasz silnik AI zamieniać artykuły w wideo
7 Feb 2025
To, co zaczęło się od jednego prostego zdania, stało się złożoną sekwencją.
Kiedy zaczęliśmy pracować nad Flipatic, naszym nowym rozwiązaniem do przekształcania artykułów redakcyjnych w wideo, myśleliśmy, że rozwiązujemy prosty problem: automatyzację procesu adaptacji pisanych newsów do angażującego contentu wideo.
Okazało się, że to coś znacznie bardziej złożonego.
Różne typy treści – artykuły informacyjne, wywiady, teksty opiniotwórcze – wymagały unikalnego podejścia. AI potrzebowało znacznie więcej niż prostego prompta do streszczania, by tworzyć ustrukturyzowane, sensowne i angażujące treści.
Oto jak poradziliśmy sobie z wyzwaniami, czego nauczyliśmy się po drodze i dlaczego Flipatic staje się czymś więcej niż tylko narzędziem automatyzacji.
Poznaj Flipatic: rozwiązanie dla redakcji zamieniające artykuły w wideo w kilka minut
Promptowanie: od jednego zdania do 1,5 strony
Na początku świadomie odłożyliśmy na później idealne inżynierowanie promptów. Wiedzieliśmy, że Flipatic ma pilniejsze wyzwania techniczne do rozwiązania.
Zaczęliśmy więc od jednego prostego zdania jako naszego początkowego prompta – tyle, żeby stworzyć proof of concept (PoC).
To zdanie brzmiało: „Utwórz scenariusz wideo na podstawie podanego tematu".
Gdy zbudowaliśmy fundament, problem nas dopadł – zgodnie z oczekiwaniami. Gdy złożyliśmy różne komponenty, wyniki nie były satysfakcjonujące. Wtedy cofnęliśmy się, by przepracować prompt.
To, co zaczęło się od jednego zdania, rozrosło się do 1,5 strony ustrukturyzowanych instrukcji, rozkładając zadanie na sekwencję mniejszych, zarządzalnych kroków.
Instrukcje podzielone są na sekcje, takie jak typ artykułu, typ wideo, długość i format, tytuł, cytowanie, format wyjściowy i dodatkowe wytyczne. Każda sekcja służy odrębnemu celowi, zawierając konkretne polecenia dotyczące budowy scenariusza. Te instrukcje działają niemal jak zmienne w programowaniu, umożliwiając precyzyjne dostosowanie do potrzeb wydawcy, treści, stylu i języka. Niezależnie od tego, czy ton ma być poważny i rzeczowy, czy lekki i angażujący, prompt odpowiednio się adaptuje.
Podejście to jest zgodne z logiką chain promptingu, gdzie złożone zadanie jest rozkładane na sekwencję powiązanych ze sobą promptów krok po kroku, zapewniając, że każdy etap buduje na poprzednim.
Wyzwania, które rozwiązaliśmy dzięki chain promptingowi
Przez chain prompting rozumiemy ustrukturyzowaną sekwencję, w której każda faza udoskonala poprzednią. Oznacza to:
- Przetwarzanie treści stopniowo, zamiast podejmowania wszystkich decyzji naraz;
- Zapewnienie, że każdy krok buduje na poprzednim, redukując błędy i niespójności;
- Poprawę dokładności, spójności i przepływu narracyjnego bez poświęcania efektywności.
Chain prompting pomógł nam w:
Cytatach: Flipatic teraz prawidłowo identyfikuje i formatuje cytaty bezpośrednie, zamiast je parafrazować.
Liczbach: Flipatic teraz zapobiega niespójnościom, zapewniając, że liczby pozostają poprawnie sformatowane zamiast być zamieniane na słowa.
Wprowadziliśmy też nowy etap walidacji – Flipatic nie tylko generuje treść, ale też sprawdza swoją pracę. Po wykonaniu zadania prosimy AI o przegląd swojego wyniku, wychwycenie niespójności i dopracowanie końcowego rezultatu.
Co ważne, traktujemy prompt nie jako statyczny tekst – to żywy system, który stale ewoluuje. Dlatego zbudowaliśmy system zarządzania promptami przy użyciu Langfuse. Pozwala nam to porównywać różne wersje promptów, obserwować, jak Flipatic zachowuje się przy zmianach, i w razie potrzeby wracać do poprzednich wersji.
Langfuse daje nam elastyczność ciągłego testowania, iterowania i dostosowywania wydajności Flipatic – co jest niezbędne w branży, gdzie modele AI szybko ewoluują.
Przykład 1: uczenie AI strukturyzowania newsów
Flipatic jest zaprojektowany do konwertowania pisanych artykułów informacyjnych na wideo – i rozwijamy go, by odpowiadał potrzebom redakcji. Ważne jest tu to, że artykuły informacyjne stosują jasne zasady dziennikarskie – prezentują najważniejsze szczegóły jako pierwsze, zachowują ustrukturyzowaną chronologię i neutralny ton. I właśnie dlatego konwertowanie ich w angażujące wideo nie było prostą sprawą.
Aby generować wysokiej jakości scenariusze wideo, opracowaliśmy wieloetapowy proces, który prowadzi AI przez rozumienie historii. Potrzebowaliśmy, by AI umiało wyodrębnić podstawowe zdarzenie i kluczowe szczegóły newsa, oddzielić fakty od opinii i dopasować wizualizacje do treści.
Kluczowe było też:
Kontrola clickbaitu – Traktujemy intensywność clickbaitu jako zmienną w prompcie. Domyślnie Flipatic utrzymuje neutralny, wyważony ton, ale zdajemy sobie sprawę, że niektórzy wydawcy mają naturalnie intensywny, tabloidowy styl redakcyjny. Przy odpowiednich dostosowaniach Flipatic może adaptować się do tego tonu, odzwierciedlając poziom pilności lub emocji oczekiwany przez ich odbiorców – pozostając jednocześnie w granicach wiarygodności.
Unikanie redundancji – Grupując podobne szczegóły zamiast ich powtarzania na slajdach, treść pozostaje ostra i zwięzła.
Zachowanie kontekstu – Tam gdzie to istotne, Flipatic uwzględnia krótkie tło historyczne lub zewnętrzne odniesienia bez przytłaczania odbiorców.
Aby generować wysokiej jakości scenariusze wideo, opracowaliśmy wieloetapowy proces prowadzący AI przez rozumienie historii. Flipatic musiał wyodrębnić podstawowe zdarzenie i kluczowe szczegóły, oddzielić fakty od opinii i zapewnić płynne dopasowanie wizualizacji do treści.
Przykład 2: wywiady
W odróżnieniu od artykułów informacyjnych, wywiady są dynamiczne, wielowątkowe i pełne subtelnych wymian, które nie wpisują się w format chronologiczny. Nie podążają prostą ścieżką – tematy powracają, pytania się nakładają, a stwierdzenia nabierają znaczenia tylko w kontekście. Proste podejście do streszczania często skutkowało mylącymi, wyrwanymi z kontekstu fragmentami. Zamiast parafrazować chronologicznie, wytrenowaliśmy Flipatic do śledzenia tematów w całej rozmowie, zapewniając spójność zamiast fragmentarycznych odpowiedzi.
Aby zachować autentyczność, wprowadziliśmy „slajdy z cytatami" – kluczowe momenty wyświetlane jako tekst na stylizowanym tle, zapobiegające niezamierzonemu parafrazowaniu przez AI.
Ponieważ wywiady mogą być długie (a my musimy utrzymać zaangażowanie widza), wprowadziliśmy ograniczenie długości wideo dla optymalnego zaangażowania i priorytetyzujemy najbardziej angażujące momenty.
Flipatic zapewnia też, że każdy wywiad zaczyna się od jasnego przedstawienia, kto mówi i dlaczego jest ważny, zanim przejdzie do odpowiedzi.
Aby udoskonalić ten proces, konsultowaliśmy się z doświadczonymi dziennikarzami, zapewniając, że Flipatic strukturyzuje treści oparte na wywiadach zgodnie ze standardami branżowymi.
Oto przykład wywiadu (po polsku)
Co dalej?
Jak widać, Flipatic to nie tylko przyspieszenie produkcji wideo – naprawdę zależy nam na zachowaniu integralności redakcyjnej i zacieraniu granicy między automatyzacją a nadzorem ludzkim. Chcemy zapewnić, że produkowana przez niego treść jest jasna, angażująca i ustrukturyzowana, ale też wierna materiałowi źródłowemu.
W najbliższej przyszłości planujemy dalej łączyć wiele modeli AI (Flipatic integruje teraz Claude AI i OpenAI) i używać różnych modeli do różnych typów treści, zapewniając rozwiązania zapasowe w razie potrzeby.
Będziemy też stale iterować wersje naszego narzędzia, uważnie je monitorować i dostosowywać do potrzeb wydawców. Wiemy, że ta praca nigdy nie będzie w pełni skończona – modele AI ewoluują, słabości znikają, ale pojawiają się nowe wyzwania.
Co możemy powiedzieć z pewnością, to że jesteśmy zaangażowani w adaptowanie i ulepszanie Flipatic – technologia AI będzie się zmieniać, i my też.
Obecnie prowadzimy pilotaże z wybranymi wydawcami. Jeśli chcesz zbadać automatyzację wideo opartą na AI, porozmawiajmy.



