AIGATO.

Kunstig intelligens · Regulering · Hva det betyr for Norge

AI-laber og teknologiselskaperPublisert 19. juli 2026

Apple-forskning: Toppmodeller som GPT-4o og Gemini svikter på ren visuell resonering

Ny studie dokumenterer et strukturelt gap mellom tekstlig og visuell resonneringsevne i dagens AI-modeller — og foreslår en ny arkitektur for å tette det.

TIMUR AKTAS · Ansvarlig redaktør · 19. juli 2026
AI-generert · redaksjonelt kontrollert

Dagens toppmodeller ignorerer ofte det visuelle mønsteret i en bildeserie og faller tilbake på innlærte tekstlige antagelser. Illustrasjon: [redaksjonen]

AI-modeller som GPT-4o og Gemini mestrer komplekse tekstinstruksjoner, men feiler systematisk når de skal trekke et felles mønster ut av bilder alene, uten tekstlige ledetråder. Forskning fra Apple, akseptert til ECCV 2026, dokumenterer svakheten som strukturell og foreslår en ny treningsarkitektur.

En kvalitetskontrollør på en fabrikk trenger bare se tre eller fire eksempler på en feil før hun gjenkjenner den på neste produkt — selv om det er et helt annet objekt. Hun abstraherer et visuelt mønster direkte fra bildene, uten at noen forklarer hva hun skal se etter. Det er denne evnen en ny Apple-studie viser at dagens AI-modeller mangler.

Forskerteamet — Nick Stracke, Kolja Bauer, Josh Susskind, Miguel Angel Bautista Martin og Björn Ommer, fra Apples ML Research og Ludwig Maximilian University i München — introduserer en ny testoppgave de kaller VICIS (Visual Concept Inference from Sets). Artikkelen er akseptert til ECCV 2026 i Malmö.

Tekst forstås, bilder ikke

VLM-er — vision-language models som GPT-4o og Gemini — kan følge komplekse tekstinstruksjoner, men sliter med å resonnere ut fra rent visuell kontekst. Konkret betyr det at modellene feiler når de skal trekke et felles konsept ut av en samling eksempelbilder og anvende det på nye inndata.

VICIS-oppgaven er konstruert slik: modellen får et lite sett bilder som deler et konsept, pluss ett spørrebilde, og skal deretter generere nye bilder som bevarer konseptet fra eksempelsettet og er konsistente med spørrebildet. Oppgaven opererer utelukkende på visuelt grunnlag — ingen tekst, ingen etiketter, ingen forhåndstrening på den spesifikke oppgaven.

Ledende modeller presterer dårlig: de ignorerer ofte den visuelle konteksten eller faller tilbake på innlærte antagelser, ifølge studien. Apple-forskerne omtaler dette som et grunnleggende gap mellom tekstlig og visuell resonneringsevne.

Språkmodellen tar snarveien

Svikten er ikke tilfeldig. Dagens VLM-er utfører resonneringen primært i tekstrommet: modellene har lært store mengder tekst som beskriver visuelle fenomener, og bruker denne kunnskapen som snarvei fremfor å analysere selve bildeinnholdet. Det gir gode resultater når tekst og bilde samsvarer, men bryter sammen når bildet alene bærer informasjonen.

En parallell studie fra april 2026 konkluderer med at «nåværende VLM-er utfører resonneringen primært i tekstrommet, med begrenset reell avhengighet av visuell evidens» — en formulering som treffer kjernen i det Apple-teamet dokumenterer. Svakheten er strukturell, ikke modellspesifikk.

Ny arkitektur og treningsrammeverk

Apple-teamet foreslår et nytt treningsrammeverk og en modellarkitektur som lærer å inferere visuelle konsepter direkte fra bildesett og trekke ut konseptspesifikke representasjoner — embeddings — fra spørrebildet. Arkitekturen trenes med svake tilsynssignaler, det vil si indirekte veiledning snarere enn fullstendig merkede datasett.

Eksperimenter på syntetiske data og storskala ImageNet/WordNet-data viser at den nye modellen genererer mer presise og varierte resultater og generaliserer til konsepter den ikke har sett under trening, ifølge Apple. Studien rapporterer også at modellen fungerer på tvers av modaliteter, inkludert skisser. Resultatene er per i dag ikke uavhengig verifisert utenfor Apples eget forskningsmiljø.

Direkte relevant for bildeanalyse i næringslivet

Virksomheter som bruker AI til bildeanalyse — kvalitetskontroll, medisinsk bildetolkning, produktkategorisering eller designstøtte — er bygget på de VLM-arkitekturene Apple-studien evaluerer. Bruksområder som krever at modellen trekker et visuelt mønster ut av eksempler uten tekstbeskrivelse, kan gi upålitelige resultater.

Apple-studien er blant de første til å formalisere problemet som en egen benchmarkoppgave med tilhørende evalueringsprotokoll. VICIS gir et måleinstrument for hva som faktisk mangler — og et referansepunkt for utvikling av modeller som resonnerer visuelt på samme måte som språkmodeller resonnerer tekstlig.

Artikkelen presenteres ved ECCV 2026 i Malmö 8.–13. september, der metodekritikk og sammenligninger med konkurrerende tilnærminger vil bli utforsket av et bredt internasjonalt forskningsmiljø.

Få dette rett i innboksen

De viktigste AI- og reguleringssakene, oversatt til hva de betyr for din virksomhet. Gratis.

Kun nyhetsbrevet, ingen spam. Meld deg av når som helst.

Kilde: https://machinelearning.apple.com/research/visual-concept-inference
Bakgrunnskilder: Apple ML Research: Show Me Examples — Inferring Visual Concepts from Image Sets · arXiv-preprint: Show Me Examples (2607.02402) · Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap (arXiv, april 2026) · ECCV 2026 — offisiell konferanseside

Apple-forskning: Toppmodeller som GPT-4o og Gemini svikter på ren visuell resonering · AIGATO