(Acest articol a fost publicat pentru prima dată pe Florian Teschnerși cu amabilitate a contribuit la R-bloggeri). (Puteți raporta problema legată de conținutul acestei pagini aici)
Doriți să vă distribuiți conținutul pe R-bloggeri? dați clic aici dacă aveți un blog, sau aici dacă nu aveți.
LLM-urile pot produce o recomandare media convingătoare în câteva secunde. Întrebarea mai utilă este dacă recomandarea este corectă: calculele de acoperire sunt corecte, ipotezele sunt vizibile și planul se potrivește briefului?
Lucrez la Havas Media și sunt autorul Havas AI Media Quality Index (HAI-Q), un etalon pentru planificarea media pe piața germană. L-am construit pentru că testele de cunoștințe generice nu sunt suficiente pentru aplicațiile profesionale AI. Un model poate scrie un paragraf plauzibil despre strategia media și poate obține totuși o alocare bugetară, o definiție a unui grup țintă sau un calcul GRP greșit.
Acest post are trei părți. În primul rând, voi construi o mică evaluare a planificării media în R folosind pachetul vitals. Apoi voi discuta de ce întrebările de planificare media sunt neobișnuit de greu de evaluat. În cele din urmă, mă voi concentra asupra a ceea ce ne spun rezultatele HAI-Q despre LLM-urile cu scop general.
1. Un mic eval în R
Cel mai simplu, o evaluare LLM are trei componente:
- Un set de date care conține întrebări și obiective.
- Un rezolvator care răspunde la întrebări.
- Un marcator care evaluează răspunsurile.
Aceasta este structura de bază folosită de elementele vitale. The target coloana nu trebuie să conțină întotdeauna un răspuns exact. Pentru întrebările deschise, poate conține îndrumări de notare: ce trebuie să includă un răspuns bun, ce ipoteze trebuie formulate și ce erori ar trebui să piardă credit.
Acest lucru este util pentru testarea răspunsului final al unui LLM. Este mai puțin util ca test complet al unui agent AI. Un agent constă dintr-un cablaj și unul sau mai multe modele: poate prelua date, poate apela instrumente, poate rula calcule, poate reîncerca un pas eșuat, poate menține starea și poate decide când să ceară ajutor. vitals în principal, ne oferă un set de date, un rezolvator și un scorer. Nu ne spune automat dacă agentul a folosit instrumentul potrivit, a transmis argumentele potrivite sau s-a recuperat în siguranță după un eșec intermediar. Poate fi extins cu soluții personalizate, dar apoi cablajul agentului și verificările traiectoriei trebuie încă construite separat.
Întrebările
Iată un set de evaluare deliberat mic. Întrebările se referă la calcul, planificare și interpretare. Țintele sunt scrise ca instrucțiuni pentru un evaluator, mai degrabă decât ca răspunsuri model.
library(dplyr)
library(tibble)
media_questions <- tribble(
~id, ~input, ~target, ~domain, ~task,
"grp-calculation",
"A campaign delivers 60% reach at an average frequency of 3. What is the campaign's GRP? State the assumption behind the calculation.",
"A full-credit answer calculates 60 * 3 = 180 GRP. It explains that this is the standard simplified relationship GRP = reach (in percent) * average frequency. It must not describe GRP as the number of unique people reached.",
"Reach and GRP", "Calculation",
"budget-allocation",
"A client has EUR 100,000 to reach adults aged 25-49 in Germany. There is no historical channel performance data. Propose a first-pass media allocation and explain how you would improve it after launch.",
"There is no single correct allocation. A strong answer makes the uncertainty explicit, explains the role of each channel, avoids inventing CPMs or reach figures, and proposes a measurement and test-and-learn plan. It should distinguish a planning hypothesis from an observed result.",
"Media strategy", "Recommendation",
"reach-frequency-tradeoff",
"Two plans have the same budget. Plan A has higher reach and lower frequency; Plan B has lower reach and higher frequency. How would you decide between them?",
"A full-credit answer says that the choice depends on the communication objective, the selected channesls, the overall attention, audience size, purchase cycle, creative strength, and expected response. It should explain the reach-frequency trade-off and ask for missing information instead of declaring one plan universally better.",
"Media strategy", "Reasoning"
)
media_questions
Întrebările sunt în mod intenționat specifice. „Creează un plan media bun” este dificil de punctat, deoarece aproape orice răspuns fluent poate suna rezonabil. O întrebare despre GRP, în schimb, ne oferă o verificare numerică concretă. Întrebarea bugetului testează altceva: dacă modelul știe când nu are suficiente informații pentru a justifica o alocare precisă.
Într-un eval real, aș extinde acest tabel cu întrebări despre rolurile canalului, definițiile grupurilor țintă, curbele de acoperire, costurile media, obiectivele campaniei și datele pieței germane. De asemenea, aș adăuga metadate precum dificultatea, sursa, piața și data la care datele de bază au fost valide.
Rezolvatorul și marcatorul
Introducerea elementelor vitale folosește Task$new() pentru a combina setul de date, un rezolvator și un scorer. Următorul exemplu îl folosește pe Claude ca rezolvator și un evaluator bazat pe LLM. Este necesară o cheie API pentru furnizorul selectat.
library(vitals)
library(ellmer)
media_task <- Task$new(
dataset = media_questions,
solver = generate(
chat_openrouter(model = "claude-sonnet-4.6")
),
scorer = model_graded_qa(partial_credit = TRUE),
name = "A small media-planning eval"
)
# Run the solver and scorer.
media_task$eval()
# Bind the results into a tibble for analysis.
media_scores <- vitals_bind(media_task)
media_scores
media_scores |>
count(score)
Cu partial_credit = TRUEmarcatorul poate reveni C pentru corect, P pentru corectă parțial, sau I pentru incorectă. Acest lucru este mai util decât un singur scor binar pentru planificarea media. Un răspuns poate folosi calculul corect, dar nu își explică ipotezele. Un alt răspuns poate fi util direcțional, dar inventează un cost media. Acestea sunt eșecuri diferite și nu ar trebui să fie ascunse într-un singur număr.
Rezultatul nu este sfârșitul evaluării. Aș inspecta răspunsurile individuale și deciziile de notare, în special la primele câteva runde. Dacă evaluatorul acordă în mod repetat credit complet unui răspuns pe care îl consider nesigur, problema poate fi mai degrabă ghidul de notare decât modelul.
Compararea modelelor
Odată ce sarcina există, compararea solutorilor este simplă. De exemplu, aceleași întrebări pot fi evaluate cu un model OpenAI și apoi combinate cu prima rulare.
media_task_openai <- media_task$clone()
media_task_openai$eval(
solver_chat = chat_openrouter(model = "gpt-5.4")
)
comparison <- vitals_bind(
claude = media_task,
openai = media_task_openai
) |>
mutate(model = recode(
task,
claude = "Claude",
openai = "OpenAI"
))
comparison |>
count(model, score)
Numele exacte ale modelelor se vor schimba în timp. Partea importantă este să păstrați întrebările și regulile de notare stabile în timp ce schimbați o componentă la un moment dat. În caz contrar, o diferență de scor este dificil de interpretat.
Acest exemplu este o evaluare LLM, nu o evaluare a unui agent. Compară textul returnat la sfârșitul soluției. Pentru un agent, aș înregistra în plus apelurile instrumentelor, documentele preluate, calculele intermediare, reîncercările, latența, costul și răspunsul final. Testul ar trebui apoi să afirme proprietățile întregii traiectorii, nu doar proza finală.
Planificarea media arată ca un caz de utilizare natural pentru LLM. Lucrarea implică rezumate, descrieri ale publicului, recomandări de canale, calcule și argumente scrise. Dar aceeași combinație face evaluarea dificilă.
Rareori există un plan corect
Multe întrebări de planificare sunt subdeterminate. O alocare rațională depinde de obiectiv, buget, lungimea campaniei, dimensiunea publicului, materialele creative, condițiile de cumpărare, performanța istorică și configurația de măsurare. Doi planificatori experimentați pot recomanda mixuri de canale diferite și ambele au dreptate.
Aceasta înseamnă că o țintă ar trebui să descrie adesea proprietățile necesare, mai degrabă decât să prescrie un număr. De exemplu, un răspuns cu credit complet ar putea avea nevoie de:
- expuneți ipotezele sale;
- rămâne în limita bugetului;
- conectați alegerile de canal la obiectiv;
- distinge faptele de ipoteze; şi
- explicați cum va fi măsurat și revizuit planul.
Evaluatorul trebuie să recompenseze raționamentul sănătos fără a transforma preferința unui planificator într-un adevăr fals.
Faptele media sunt locale și depind de timp
Un răspuns media poate fi corect pe o piață și greșit pe alta. Acoperirea, costurile, inventarul, definițiile publicului, disponibilitatea platformei și metodologia panoului variază în funcție de țară și de dată. Un model care a învățat vocabularul media general nu are acces automat la cele mai recente date ale pieței germane.
Acesta este motivul pentru care un eval util ar trebui să înregistreze piața și data vintage. De asemenea, ar trebui să testeze dacă modelul oferă o sursă sau etichetează clar o ipoteză atunci când o cifră curentă nu este disponibilă. „CPM mediu este X” nu este un răspuns sigur dacă modelul nu poate explica de unde provine X.
Definițiile contează mai mult decât proza fluentă
Planificarea media are mulți termeni care sunt suficient de apropiați pentru a suna interschimbabili, dar nu sunt interschimbabili într-un calcul. Acoperirea poate însemna acoperire brută sau netă. Frecvența poate fi medie sau efectivă. GRP nu este același cu numărul de persoane unice la care a ajuns. Procentele grupului țintă au nevoie de un numitor.
Aceste distincții creează moduri de eșec ușoare. Un răspuns poate conține formula corectă, dar aplicați-o la cantitatea greșită. De asemenea, poate produce un tabel ordonat ale cărui totaluri nu se însumează. Prin urmare, verificările numerice și verificările constrângerilor trebuie să facă parte din eval, nu doar o evaluare generală a calității scrisului.
LLM-ca-judecător este util, dar nu suficient
The model_graded_qa() marcator în vitals face ca evaluarea deschisă să fie scalabilă. Este, de asemenea, un model care judecă răspunsul altui model, care introduce propriile erori. Un elev poate prefera un limbaj încrezător, poate trece cu vederea o greșeală numerică subtilă sau poate accepta un răspuns deoarece seamănă cu îndrumările furnizate.
Pentru un punct de referință serios, aș calibra graderul în funcție de exemplele etichetate de oameni și aș păstra un eșantion pentru revizuire manuală. De asemenea, aș separa diferite dimensiuni acolo unde este posibil:
- acuratețea faptică;
- precizie numerică;
- satisfacția constrângerii;
- calitatea raționamentului; şi
- utilitatea recomandarii.
Un punctaj general este convenabil, dar poate ascunde care parte a procesului de planificare eșuează.
vitals nu este un ham de agent
Distincția contează în practică. vitals este o modalitate utilă de a adresa unui LLM un set fix de întrebări și de a nota răspunsurile. Nu este, în sine, un ham de testare pentru un agent AI. Dacă un agent are acces la o bază de date de acoperire, un calculator sau un API de planificare, evaluarea trebuie să verifice și interacțiunea cu acele componente.
Pentru o evaluare a agentului de la capăt la capăt, aș testa cel puțin patru straturi: dacă cablajul selectează instrumentul potrivit, dacă apelul instrumentului este valid, dacă rezultatul intermediar este interpretat corect și dacă răspunsul final comunică incertitudine. Un răspuns final poate părea rezonabil chiar și atunci când unul dintre acești pași anteriori a eșuat.
3. Rezultate de la Havas HAI-Q
Pagina Havas HAI-Q descrie un etalon construit pentru planificarea media pe piața germană. Conține 35 de sarcini practice în cinci domenii:
- Strategia media
- Canal și alocare bugetară
- Evaluarea grupului țintă
- Acoperire și GRP
- Valori media și eficacitate
În această postare mă concentrez pe rezultatele LLM cu scop general:
| Model | Răspunsuri corecte | Distribuie corect |
|---|---|---|
| GPT-5 | 16 / 35 | 45,7% |
| Claude Sonnet 4.5 | 6 / 35 | 17,1% |
| GPT-4o | 4 / 35 | 11,4% |
Titlul este incomod: chiar și GPT-5, cel mai puternic model de uz general din această comparație, este corect la mai puțin de jumătate dintre întrebări. Răspunde corect la 16 din 35 de întrebări, lăsând 19 răspunsuri care nu sunt considerate corecte. Pentru lucrări practice de planificare media, aceasta nu este o rată de eroare sigură.
Când mă uit la întrebările individuale HAI-Q, erorile nu sunt distribuite uniform. Modelele se luptă în special cu întrebări numerice care implică cifre de acoperire și dimensiunile publicului. Ei pot produce o explicație fluentă a unei idei de planificare și totuși pot face o greșeală de bază într-un numitor, un procent sau interpretarea unui număr de acoperire. Acesta este exact tipul de eșec care este ușor de ratat dacă evaluarea se bazează mai degrabă pe plauzibilitate decât pe calcul.
Există, de asemenea, o îmbunătățire clară între modelele mai vechi și cele mai noi. GPT-4o răspunde corect la 4 din 35 de întrebări, comparativ cu 16 din 35 pentru GPT-5. Adică 12 răspunsuri corecte suplimentare și o îmbunătățire de la 11,4% la 45,7%, sau 34,3 puncte procentuale. GPT-5 primește de patru ori mai multe întrebări corecte decât GPT-4o la acest benchmark. Îmbunătățirea este substanțială, chiar dacă modelul mai nou nu este încă suficient de fiabil pentru deciziile media nesupravegheate.
Claude Sonnet are scoruri mai mici cu 4,5 la acest test, cu 6 din 35 de răspunsuri corecte. Acest lucru nu înseamnă că modelul este în general slab. Înseamnă că un benchmark lingvistic general și un benchmark de planificare media specifică domeniului răspund la diferite întrebări. HAI-Q este proiectat în jurul pieței germane și a unei definiții specifice a corectitudinii, inclusiv a detaliilor numerice care contează în planificare.
Scorurile agregate trebuie totuși citite cu atenție. Ele nu arată dificultatea fiecărei întrebări, variația între runde repetate sau decizia exactă de punctare pentru fiecare răspuns. Dar modelul este suficient de clar pentru a fi util: LLM-urile actuale cu scop general sunt bune să sune ca planificatori media, în timp ce încă se străduiesc să răspundă corect la aproximativ jumătate din aceste întrebări practice.
Takeaways
O evaluare LLM pentru planificarea media ar trebui să înceapă cu întrebări reale din fluxul de lucru, nu cu solicitări generice despre marketing. În R, un tibble cu input şi target este suficient pentru a începe, și vitals oferă o modalitate practică de a conecta întrebări, rezolvatori, marcatori și inspecția rezultatelor.
Partea dificilă este să nu rulezi modelul. Se definește ce înseamnă „corect” atunci când mai multe planuri pot fi rezonabile, datele se modifică în funcție de piață și dată, iar un răspuns plauzibil poate conține o eroare subtilă, dar cu consecințe. Pentru agenți, evaluarea trebuie să acopere, de asemenea, hamurile, uneltele, etapele intermediare și gestionarea defecțiunilor. Un punctaj de răspuns final nu este suficient.
Rezultatele HAI-Q arată că cele mai recente LLM-uri cu scop general răspund în continuare la peste jumătate dintre aceste întrebări de planificare media incorect. Cele mai mari puncte slabe apar în raționamentul numeric privind acoperirea și dimensiunea publicului. În același timp, saltul de la GPT-4o la GPT-5 arată că dezvoltarea modelului se mișcă în direcția corectă.
Pentru mine, concluzia practică este simplă: folosește LLM-urile pentru a accelera munca media, dar testează fiecare recomandare numerică înainte de a te baza pe ea. Următorul pas este să combinați evaluările modelului, cum ar fi HAI-Q, cu teste de agenți end-to-end care măsoară utilizarea instrumentelor și fluxul de lucru de planificare complet.
Resurse
