AIGATO.

Kunstig intelligens · Regulering · Hva det betyr for Norge

AI-laber og teknologiselskaperPublisert 22. juli 2026

Apple kutter beregningstid for AI-video med 58 prosent – uten å trene modellen på nytt

En ny teknikk fra Apples forskningsavdeling hopper over overflødige beregninger i videogenererende AI og leverer opptil 1,58 ganger raskere generering. Metoden krever ingen ny trening og kan i prinsippet påføres eksisterende modeller direkte.

TIMUR AKTAS · Ansvarlig redaktør · 22. juli 2026
AI-generert · redaksjonelt kontrollert

CalibAtt kartlegger på forhånd hvilke beregninger som er overflødige, og hopper over dem under selve produksjonen. Illustrasjon: generert av DALL-E / OpenAI

Å generere et kort AI-videoklipp kan ta titalls minutter på kraftig maskinvare og koste deretter. Apple ML Research presenterer CalibAtt, en metode som gjør det samme arbeidet opptil 58 prosent raskere uten at modellen behøver ny trening. Forskningen publiseres ved konferansen ECCV i juli 2026.

Flaskehalsen heter oppmerksomhet

Moderne videogenererende modeller er bygget på en arkitektur kalt diffusjonstransformer. I kjernen ligger spatiotemporal oppmerksomhet (attention): modellen beregner parvise relasjoner mellom alle bildepunkter på tvers av både rom og tid. Antallet beregninger vokser kvadratisk med klipplengden – en dobling av lengden kan firedoble regnebyrden. Ifølge uavhengig forskning kan oppmerksomhetsberegningen alene stå for over 75 prosent av total forsinkelse i enkelte modeller, og et fem sekunder langt 720p-klipp kan ta nærmere femti minutter på ett høyytelses-GPU.

Det er dette CalibAtt angriper. Metoden er utviklet av forskere tilknyttet Apple og Tel Aviv University.

Mønsteret er stabilt – og kan forhåndsberegnes

Innsikten bak CalibAtt er at en stor andel av token-til-token-forbindelsene konsekvent gir ubetydelige skårer uavhengig av hva slags video som genereres, og at disse mønstrene gjentar seg på tvers av ulike spørringer, ifølge Apple ML Research. Disse beregningene kan dermed hoppes over uten merkbar effekt på resultatet.

CalibAtt gjennomfører et kalibreringssteg offline – én gang, separat fra selve videogenereringen. Her kartlegges hvilke blokknivå-mønstre av glissen beregning og hvilke repeterende spørringsmønstre som er stabile på tvers av inndata. Resultatene kompileres til optimaliserte oppmerksomhetsoperasjoner for hvert lag, hvert oppmerksomhetshode og hvert diffusjonstidssteg. Under generering kjøres de utvalgte forbindelsene fullt ut, mens øvrige hoppes over på en maskinvareeffektiv måte.

Metoden er treningsfri: eksisterende, allerede trente modeller kan påføres CalibAtt uten ny kostbar treningskjøring.

1,58 ganger raskere i praksis

Apple tester CalibAtt mot tre åpne videogenererende modeller: Wan 2.1 14B fra Alibaba, Mochi 1 fra Genmo og LightX2V, en såkalt «few-step distilled»-modell beregnet på rask generering. Testene dekker ulike oppløsninger og antall diffusjonssteg.

Resultatet er en ende-til-ende-akselerasjon på opptil 1,58 ganger – tilsvarende en ventetidsreduksjon på 37 prosent – med opprettholdt videokvalitet og samsvar mellom tekst og video, ifølge selskapet. Apple hevder at CalibAtt overgår eksisterende treningsfrie metoder på dette målet. Tallene er Apples egne og er foreløpig ikke uavhengig verifisert.

Hva akselerasjonen betyr i kroner og tid

Skyleverandørers spotpriser for NVIDIA A800-GPU ligger typisk på 2–4 dollar per time. En 1,58 ganger akselerasjon rekker ikke til sanntidsgenerering, men kutter GPU-kostnaden per video med omtrent en tredjedel og korter ned ventetiden tilsvarende.

For lavere oppløsninger og distillerte modeller – den typen som brukes i markedsføring og sosiale medier – er utgangspunktet raskere, men den prosentvise gevinsten er den samme.

Relevant for innholdsproduksjon, ikke tilgjengelig ennå

Reklamebyråer og videoprodusenter som bruker løpende AI-videoproduksjon til sosiale medier, opererer i et marked der leveringstakt og kostnad per klipp avgjør om AI-video er konkurransedyktig mot tradisjonell innspilling for kortformater.

CalibAtt er et forskningsresultat, ikke en ferdig API eller abonnementstjeneste. Metoden må implementeres i et rammeverk eller en skyleverandørs inferenstjeneste for å bli tilgjengelig i praksis. Den er likevel relevant som retningsindikator: billigere inferens per sekund video gjør det mulig å iterere raskere på konsepter og generere flere varianter innenfor et gitt budsjett.

Apple er ikke alene om å angripe problemet. Konkurrerende treningsfrie metoder som Sparse VideoGen2 og Compact Attention opererer på lignende prinsipper. Kappløpet handler om hvem som kan kombinere høyest kvalitet med størst hastighetsgevinst uten ny modelltrening.

Neste steg: implementering og åpne vekter

Kildekode er per nå ikke offentliggjort. Det er uklart om Apple planlegger å integrere CalibAtt i egne produkter som Final Cut Pro, i skybaserte tjenester, eller om metoden primært er et bidrag til forskningsmiljøet.

Modellene som er testet – Wan 2.1 og Mochi 1 – er tilgjengelige som åpne vekter under Apache 2.0-lisens, noe som gjør det mulig for teknisk kompetente aktører å eksperimentere med glissen oppmerksomhet med eksisterende verktøy. Skybaserte inferenstjenester som tilbyr Wan 2.1 oppdaterer sine optimaliseringsmetoder løpende; akselererte varianter vil trolig gradvis dukke opp i tjenester som allerede er i bruk.

Få dette rett i innboksen

De viktigste AI- og reguleringssakene, oversatt til hva de betyr for din virksomhet. Gratis.

Kun nyhetsbrevet, ingen spam. Meld deg av når som helst.

Kilde: https://machinelearning.apple.com/research/calibrated-sparse-attention
Bakgrunnskilder: Apple ML Research – Accelerating Text-to-Video Generation with Calibrated Sparse Attention · arXiv – CalibAtt paper (2603.05503) · Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers · Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation · GitHub – Wan-Video/Wan2.1

Apple kutter beregningstid for AI-video med 58 prosent – uten å trene modellen på nytt · AIGATO