Dlaczego AI ze skillami sprawdzi się prawie wszędzie, ale nie w optymalizacji kampanii
AI ze skillami świetnie pisze, programuje i streszcza. W kampaniach potyka się o dane, które przez kilka dni są niepełne, o fazę nauki algorytmów i o własną nieprzewidywalność.
7 dni PRO za darmo · bez kartyW tekście czy kodzie błąd AI widać od razu i łatwo go poprawić. W kampanii zła decyzja kosztuje pieniądze, może zrestartować naukę algorytmu i wychodzi na jaw dopiero po tygodniu. To zupełnie inna sytuacja.
Wyobraź sobie poniedziałek. Ktoś eksportuje wyniki z ostatnich siedmiu dni, wkleja je do czatu ze skillem do analizy kampanii i pyta, co poprawić. Czat widzi, że kampania z dobrym ROAS w ostatnich dwóch dniach „siadła”, i radzi obniżyć jej budżet. Tyle że konwersje z ostatnich dwóch dni jeszcze nie doszły, a kampania od pięciu dni jest w fazie nauki. Rada brzmi rozsądnie i jest błędna.
Pięć pułapek danych reklamowych
Każdą z nich opisuje oficjalna dokumentacja platform i dostawców modeli. Czat analizujący eksport nie widzi żadnej, jeśli nikt mu o niej nie powie.
Konwersje według daty kliknięcia
Google przypisuje konwersję do dnia kliknięcia, a może ona dojść nawet 90 dni później. Ostatnie dni zawsze wyglądają gorzej, niż są.
Dane są opóźnione
Kliknięcia i koszt pojawiają się w ciągu godziny, konwersje po około 3 godzinach, a dla części modeli atrybucji po około 15. Udział w wyświetleniach odświeża się raz dziennie.
Faza nauki
Smart Bidding w Google uczy się zwykle 1-2 tygodnie, czasem do 6. Meta potrzebuje około 50 zdarzeń w tygodniu po istotnej edycji. Pochopna zmiana uruchamia naukę od początku.
Ograniczony kontekst
Im więcej tokenów w kontekście, tym słabsza dokładność modelu. Dostawcy modeli nazywają to „context rot”. Duży eksport konta to dokładnie ten przypadek.
Niedeterminizm
Te same dane mogą dać inną odpowiedź przy kolejnym wywołaniu, nawet przy temperaturze 0.
Każda z tych pułapek osobno może zmylić analizę. Razem sprawiają, że jednorazowa analiza eksportu łatwo dostrzega problem tam, gdzie go nie ma, albo przeoczy ten, który istnieje.
Jak decyzje podejmują inne narzędzia
Czat ze skillami na eksporcie
Ktoś pobiera raport, wkleja go do czatu ze skillem i dostaje wniosek. Bez historii, bez wiedzy o fazie nauki, bez sprawdzenia pomiaru.
Reguły pisane przez zespół
Warunek i akcja, na przykład „jeśli CPA przekroczy X, wstrzymaj”. Przewidywalne, ale tak mądre, jak osoba, która je napisała.
Rekomendacje statystyczne
Istotne statystycznie wzorce w danych konta, zwykle jednej platformy. Dobre do porządków, słabsze w szukaniu przyczyny.
Agent AI
Model analizuje konto i sam proponuje zmiany. Elastyczny, ale trudno prześledzić, dlaczego zrobił to, co zrobił.
Każde z tych podejść ma swoje miejsce. Wspólne ograniczenie jest jedno: decyzja zależy od jednej osoby, jednej platformy albo jednego wywołania modelu.
Jak decyduje Phanes
Phanes nie zaczyna od pytania do modelu. Zaczyna od danych zebranych w czasie i od wiedzy zapisanej w regułach. Model językowy dostaje gotowe liczby i tylko je opisuje.
Historia konta
Co noc Phanes zapisuje dzienne metryki kont, więc silnik widzi trend, a nie jeden eksport.
Werdykt pomiaru
Google Ads, GTM, GA4 i piksel Meta. Brak danych to nie werdykt, a podejrzany pomiar blokuje rekomendacje oparte na konwersjach.
315 reguł eksperckich
Reguły z praktyki ekspertów paid ads i dokumentacji Google i Meta, każda z warunkiem, progiem i uzasadnieniem.
Bramka fazy nauki
Kampania w fazie nauki nie dostaje zmian budżetu ani zmian ograniczających. Okno nauki: 10 dni w Google, 10 lub 14 dni w Meta.
Hipoteza z przewidywanym efektem
Do każdej propozycji i każdej zmiany wykonanej na koncie przez ludzi Phanes zapisuje prognozę: która metryka, w którą stronę i w jakim czasie.
Rozliczenie z rzeczywistością
Po 7, 14 albo 28 dniach, zależnie od typu zmiany, silnik mierzy wynik z kontrolą wolumenu i trendu konta. Potwierdzenia i porażki ważą tak samo.
Wiedza z wielu kont
Wnioski tylko z co najmniej 3 kont, w których żadne nie ma więcej niż 40% udziału. Zanonimizowane, bez kwot i treści.
Uczenie na danych, a nie na promptach
Phanes uczy się tak, jak uczy się dobry specjalista: zapisuje, czego się spodziewa, a potem sprawdza, co się stało. Każda reguła ma pewność liczoną bayesowsko z rozliczonych prób. Reguła, która się sprawdza, zyskuje pierwszeństwo. Reguła, która się myli, traci je aż do wyłączenia. Silnik kalibruje się też osobno dla każdego konta i typu zmiany: tam, gdzie trafia, działa śmielej, a tam, gdzie się myli, zwalnia.
Wiedza rośnie z każdym kontem, a prywatność zostaje nienaruszona. Wnioski z wielu kont powstają tylko z co najmniej 3 kont, żadne nie ma w nich więcej niż 40% udziału, a przenoszą się wyłącznie wskaźniki względne, bez kwot i treści. Zanim rekomendacja trafi na kartę, silnik szacuje prawdopodobieństwo poprawy skalibrowane na historii podobnych sytuacji z wielu kont. Wiedza z danych nigdy nie zachęca automatu do śmielszych działań bez dowodu z konta, którego pieniądze są w grze.
Aether: model językowy, który zna tylko reklamy
To nie jest tekst przeciwko AI. Phanes ma własny model językowy, Aether, zbudowany do jednej pracy: mówić o kampaniach dokładnie tym, co policzył silnik. Nie jest wszechwiedzący i nie musi być. Jest wąski, dwujęzyczny (polski i angielski) i podporządkowany regułom Phanesa.
Opisuje werdykty silnika
Zamienia ustalenia silnika na odpowiedź na cztery pytania: co widzisz, od kiedy, co to znaczy i co zrobić. Każda liczba pochodzi z danych wejściowych.
Odpowiada w „Poproś Phanesa”
Odpowiada z dowodem z silnika i cytatem reguły, sprawdza założenia Twojego pytania i zamienia prośbę na zmianę, która przechodzi ten sam podgląd i zatwierdzenie co każda inna.
Klasyfikuje i porządkuje
Rozpoznaje wyszukiwane hasła spoza oferty, brandowe i ogólne, wyciąga strukturę z briefu i strony klienta, tłumaczy teksty między polskim a angielskim.
Najważniejsze jest to, czego Aether nie robi. Nie podejmuje decyzji o koncie i nigdy nie wykonuje zmian. Nie trzyma faktów w wagach: wiedzę o reklamach dostaje z bazy wiedzy Phanesa w chwili pytania, więc jej aktualizacja nie wymaga ponownego treningu. Uczy się formy, dyscypliny i stylu, a nie zgadywania liczb.
Dane bez nazw
Do treningu trafiają opisy werdyktów, decyzje użytkowników i etykiety ekspertów po anonimizacji: bez nazw firm, osób, adresów i identyfikatorów kont.
Nauka formatu
Lekkie dostrojenie uczy model struktury odpowiedzi, schematów danych i języka panelu.
Uczenie ze sprawdzalną nagrodą
Model generuje wiele odpowiedzi na to samo zadanie, a automatyczne weryfikatory nagradzają tylko te, w których każda liczba pochodzi z danych, schemat się zgadza, a język jest czysty.
Bramka wydania
Nowa wersja wchodzi do produktu tylko wtedy, gdy bije poprzednią na zamrożonym zbiorze testowym i nie pogarsza żadnej kategorii zadań.
Jak zbudowany jest Aether
Aether nie jest jednym wielkim modelem, który wie wszystko. To mały zespół wyspecjalizowanych elementów, z których każdy ma jedno zadanie i własny sposób sprawdzania jakości. Cały cykl, od treningu po odpowiedzi w produkcie, działa na własnej infrastrukturze obliczeniowej Phanesa: dane klientów nie opuszczają naszych serwerów i nie trafiają do zewnętrznych dostawców modeli.
| Co to jest | Jak działa | |
|---|---|---|
| Model produkcyjny | Wąski, dwujęzyczny model 7-14 mld parametrów na otwartych wagach z licencją komercyjną (rodziny Bielik i Qwen) | Opisuje werdykty, odpowiada w czacie, klasyfikuje hasła, wyciąga strukturę z briefów, tłumaczy PL i EN. Działa z dużym zapasem przepustowości, więc odpowiada szybko także przy wielu kontach naraz. Bazę wybieramy po wyniku na zbiorze zadań Phanesa, a nie po publicznych rankingach. |
| Nauczyciel i sędzia | Większy model 27-32 mld parametrów działający lokalnie, offline, w pełnej precyzji (bf16) | Generuje warianty danych treningowych z zanonimizowanych szablonów i ocenia odpowiedzi. Nigdy nie odpowiada użytkownikom. |
| Baza wiedzy (RAG) | Wielojęzyczne embeddingi (multilingual-e5) i indeks reguł oraz wiedzy Phanesa | Do każdego pytania dobiera najtrafniejsze fragmenty wiedzy. Fakty żyją w indeksie, a nie w wagach, więc nowa wiedza działa po przebudowie indeksu, bez treningu. |
| Dostrojenie formatu (SFT) | LoRA, jedna epoka, niski learning rate, tylko zweryfikowane dane | Uczy struktury odpowiedzi na cztery pytania, schematów JSON i języka panelu. |
| Uczenie ze wzmocnieniem (GRPO) | Group Relative Policy Optimization z weryfikowalnymi nagrodami, metoda znana z DeepSeek-R1 | Na każde zadanie model generuje 8 odpowiedzi. Weryfikatory oceniają każdą, a model uczy się od lepszych w grupie. Generowanie i trening biegną równolegle na osobnych akceleratorach, a model 7-14 mld uczy się w pełnej precyzji (bf16), bez kwantyzacji bazy. Kara KL trzyma go blisko modelu bazowego, żeby nie rozjechał się styl. |
| Preferencje użytkowników (DPO) | Pary: karta zatwierdzona i karta odrzucona przez użytkownika | Po GRPO model uczy się, jak opisywać rekomendacje, które ludzie faktycznie akceptują. Oceniane osobno. |
| Bramka wydania | Zamrożony zbiór ewaluacyjny, osobno dla PL i EN | Cel to 100% odpowiedzi bez obcych liczb. Nowa wersja wchodzi tylko wtedy, gdy bije poprzednią i nie ma regresji w żadnej kategorii. W przeciwnym razie wracamy do poprzedniego checkpointu. |
Nagrody, za które uczy się Aether
W uczeniu ze wzmocnieniem wszystko zależy od tego, co model dostaje za dobrą odpowiedź. W modelu Aether każda nagroda jest sprawdzana mechanicznie, bez oceniania „na oko”:
- Liczby z danych: każda liczba w odpowiedzi występuje w danych wejściowych, w tej samej walucie. Za każdą obcą liczbę jest kara.
- Schemat: odpowiedź przechodzi walidację struktury JSON.
- Język: cała odpowiedź w języku panelu, bez mieszania polskiego z angielskim.
- Uczciwość: zero obietnic wykonania, których silnik nie daje, zero nazw źródeł wiedzy, poprawne etykiety zgodne z ekspertem i cytat reguły, która istnieje.
- Zwięzłość: kara za gadatliwość. Zadania do treningu wybieramy w strefie trudności modelu (20-80% poprawnych odpowiedzi bazy), bo zadania za łatwe nie dają sygnału do nauki.
Czego nauczyło nas laboratorium
GRPO działa i jest bezpieczne
Na zbiorze GSM8K (1319 zadań) mały model zyskał 3,1 pp w 300 krokach, bez zmiany stylu odpowiedzi, bo kara KL trzymała go blisko bazy.
Trening na własnych próbkach potrafi zniszczyć model
Dostrojenie na odpowiedziach generowanych przez sam model obniżyło wynik o 15 pp. Dlatego każda wersja przechodzi bramkę wydania, a odrzucenie jest normalnym wynikiem.
Polski model bazowy wygrywa po polsku
Bielik, model trenowany na polskich danych, bije większe modele angielskie na zadaniach po polsku. Stąd dwujęzyczny trening i ewaluacja osobno dla PL i EN.
Najważniejsza lekcja: weryfikator jest ważniejszy niż model. Jeden błąd w ekstraktorze odpowiedzi zaniżał wyniki o ponad punkt procentowy i fałszował porównania, więc każdy weryfikator Phanesa ma własne testy.
AI ze skillami to świetny asystent. Decyzję o pieniądzach w kampanii powinien jednak podejmować system, który pamięta historię konta, zna fazę nauki, ufa tylko zweryfikowanemu pomiarowi i przy tych samych danych zawsze odpowiada tak samo.
Dlaczego dane z ostatnich dni w Google Ads wyglądają gorzej?
Google przypisuje konwersję do dnia kliknięcia, a sama konwersja może dojść nawet 90 dni później. Do tego konwersje pojawiają się w raportach po około 3 godzinach, a dla części modeli atrybucji po około 15. Dlatego ostatnie dni zawsze wyglądają gorzej, niż są.
Jak długo trwa faza nauki w Google Ads i Meta Ads?
Smart Bidding w Google Ads uczy się zwykle od 1 do 2 tygodni, czasem do 6. Meta potrzebuje około 50 zdarzeń optymalizacyjnych w tygodniu po istotnej edycji. Pochopna zmiana budżetu lub ustawień może rozpocząć naukę od nowa.
Czym jest Aether?
To własny model językowy Phanesa: wąski, dwujęzyczny model trenowany wyłącznie do zadań Phanesa metodą GRPO ze sprawdzalnymi nagrodami. Opisuje wnioski silnika i odpowiada w czacie, ale nie podejmuje decyzji i nie wykonuje zmian. Działa na infrastrukturze Phanesa, a wiedzę dostaje z bazy wiedzy, nie z wag.
Źródła (11)
- support.google.com/google-ads/answer/6239119
- support.google.com/google-ads/answer/2544985
- support.google.com/google-ads/answer/13020501
- facebook.com/business/help/112167992830700
- platform.claude.com/docs/en/build-with-claude/context-windows
- platform.claude.com/docs/en/about-claude/glossary
- genai.owasp.org/llmrisk/llm092025-misinformation/
- arxiv.org/abs/2402.03300
- arxiv.org/abs/2501.12948
- arxiv.org/abs/2106.09685
- arxiv.org/abs/2110.14168