AI-laber og teknologiselskaperPublisert 21. juli 2026
Apple dokumenterer tre systematiske svakheter i AI-modellers videoforståelse
Ny benchmark viser at beste modell når 75 prosent av menneskelig presisjon — og at transkribert tale gir bedre resultater enn selve bildet
Dagens beste AI-modeller forstår hva en lang video handler om, men ikke når de viktige øyeblikkene inntreffer. Apple ML Research har publisert et benchmark som måler nettopp dette gapet — og resultatene er ubehagelige for hele bransjen.
Problemet ingen målte riktig
Multimodale store språkmodeller — AI-systemer som behandler tekst, lyd og video samtidig — har lenge blitt testet på korte klipp. De fleste virkelige bruksscenarier involverer imidlertid lange videoer: møteopptak, forelesninger, nyhetsreportasjer, podkaster. Her har evalueringsverktøyene manglet.
Apple ML Research publiserte i juli 2026 LVSum, et benchmark for å teste hvor godt AI-modeller oppsummerer lange videoer med presis tidsfesting. Datasettet består av 72 videoer fra 13 domener — fra nyhetsreportasjer til vlogger og forelesninger — med et gjennomsnitt på 16 minutter per video. Hver video er annotert med opptil ti menneskeskrevne oppsummeringer med eksplisitte tidsreferanser.
Tidligere benchmarks som SumMe og TVSum inneholdt 25–50 videoer med 15–20 annotasjoner per video — tilstrekkelig for eldre modeller, men ifølge Apple-forskerne utilstrekkelig for å evaluere moderne multimodale språkmodeller. LVSum er bygget for å tette dette hullet.
Tre funn — alle ubehagelige
Apple-teamet testet tre ledende modeller: Anthropics Claude Sonnet-4.5 (Opus-4.5 i benchmarktabellen), Googles Gemini-2.5-Pro og Alibabas åpne modell Qwen3-VL-235B. Resultatene avdekker tre mønstre som går igjen på tvers av alle modellene.
Det mest overraskende funnet: tekstlige transkripter bidrar vesentlig mer til oppsummeringskvaliteten enn visuelle bilder alene. En AI som leser underteksten til en dokumentar, forstår innholdet bedre enn en AI som ser bildene. Det peker mot et arkitekturproblem: modellene er trent til å være sterke på språk og lener seg på det selv når de prosesserer video.
Det andre funnet er prestasjonsgapet. Menneskelige annotatorers temporale overensstemmelse, målt med Kendalls tau, nådde 0,134. Beste modell, Opus-4.5, nådde 0,101 — omtrent 75 prosent av menneskelig nivå. Gemini-2.5-Pro kom til 0,089, mens Qwen3-VL-235B endte på 0,064. Modellene forstår semantikken, men klarer ikke å komprimere innholdet presist i tid.
Det tredje funnet handler om instruksjonslyding. Benchmarken setter et budsjett for oppsummeringslengde på rundt 15 prosent av videolengden. Opus-4.5 brukte i snitt 30 prosent, Qwen3-VL-235B hele 56 prosent. Kun Gemini-2.5-Pro holdt seg innenfor med 12 prosent — og oppnådde samtidig høyest score på modalitetskoherens, altså samsvar mellom valgte tidsstempler og det som faktisk skjer i video og lyd på det tidspunktet.
To nye evalueringsmetrikker
Eksisterende benchmarks bruker rangkorrelasjoner som Kendalls tau og Spearmans rho — mål som sier noe om i hvilken rekkefølge modellen plukker ut viktige øyeblikk, men ingenting om tekstkvaliteten eller om lyd og bilde henger sammen.
Apple-teamet introduserer Content Relevance (CR) og Modality Coherence (MC). CR måler semantisk troskap: stemmer oppsummeringen med hva som faktisk ble sagt og vist? MC måler kryssmodal koherens: peker tidsstemplene på øyeblikk der innholdet faktisk matcher beskrivelsen? Disse dimensjonene er ifølge forskerne nødvendige for å avdekke svakheter tradisjonelle metrikker skjuler.
Alle modellene scorer høyt på CR — de forstår hva en video handler om. Det er MC og temporal kompresjon som skiller dem, og det er her de systematisk feiler.
Konsekvenser for innkjøp og forskning
For virksomheter som vurderer AI-verktøy til møtereferater, kursoppsummeringer eller medieovervåking, gir funnene et konkret varsel: en modell som er god på korte videoer, holder ikke nødvendigvis mål på 15–20 minutters innhold. Den modellen som lager den mest detaljerte oppsummeringen, er heller ikke nødvendigvis den mest presise.
Apple offentliggjør datasett og kildekode — en uvanlig åpen praksis for selskapet. Det signaliserer at LVSum er ment som et fellesverktøy for bransjen, ikke bare intern kvalitetskontroll. Uavhengig reproduksjon av resultatene gjenstår, og det er foreløpig ikke dokumentert hvilke treningsdata de testede modellene har brukt, noe som kan påvirke tolkningene.
Parallelt arbeider Apple-forskere med tilgrensende problemer: et annet prosjekt fra juli 2026 ser på hvordan modeller kan trenes til å resonnere bedre om rekkefølge og hendelsesutvikling i egosentriske videoer. Samlet peker dette mot en koordinert satsing på temporal forståelse som forskningsprioritet.
Neste steg i benchmarkkampen
LVSum er ikke alene i feltet. CoMET-Bench fra juni 2026 tester lokalisering av flere samtidige hendelser i videoer på over 30 minutter, og CVPR 2026 inkluderte flere arbeider om instruert temporal grounding. Feltet beveger seg raskt mot mer krevende og realistiske testscenarier.
Apple-teamet skriver at LVSum skal danne grunnlag for forskning mot modeller som balanserer semantisk relevans, tidsstempelpresisjon og kryssmodal konsistens. Datasettet og koden er tilgjengelig via GitHub. Ingen av dagens ledende systemer når menneskelig presisjon på alle tre dimensjonene.
«Current systems exhibit strong semantic understanding yet lack robust temporal compression, multimodal grounding, and constraint adherence.»
De viktigste AI- og reguleringssakene, oversatt til hva de betyr for din virksomhet. Gratis.
Kilde: https://machinelearning.apple.com/research/lvsum-video-summarization
Bakgrunnskilder: LVSum: A Benchmark for Timestamp-Aware Long Video Summarization (arXiv) · Apple ML Research – LVSum publikasjonsside · VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding (CVPR 2026)