Los Angeles, och en varning från leverantören

På SIGGRAPH i Los Angeles presenterade Nvidia den 20 juli 2026 Synthetic Video Detector, en mikrotjänst i plattformen AI for Media som analyserar material bild för bild och bedömer om det har genererats. Rev Lebaredian, företagets vicepresident för fysisk AI-simulering, formulerade insatsen rakt och sade att om vi inte kan se skillnad på en syntetisk och en verklig video kan det urholka allmänhetens förtroende.

Den mer användbara meningen kom längre ned i meddelandet, och den kom från Nvidia självt och inte från en kritiker. I stället för att ersätta etablerade verifieringsrutiner, skrev företaget, ger mikrotjänsten ytterligare en signal för tidskritiska beslut. Det är en leverantör som i förväg säger att du inte ska behandla resultatet som bevis. Det bör tas bokstavligt.

Tre siffror, och den lägsta är din

Nvidia publicerade träffsäkerheten på tre komprimeringsnivåer. I de egna testerna nådde modellen upp till 92 procent på okomprimerad video, 87 procent vid 15 procents komprimering och 82 procent vid 50 procent. Företaget rapporterade även en area under kurvan på 0,9614 och en träffsäkerhet på 0,9453 på en intern testmängd. Hastigheten räcker för direktsänd användning, med 1080p på så lite som 22 millisekunder på RTX-system och omkring 30 millisekunder på L40-acceleratorer.

Fundera nu på vilken av de tre siffrorna som beskriver din situation. Video som når ett europeiskt företag har gått igenom en leveranskodning och oftast också en plattform som kodade om den igen. Ett klipp vidarebefordrat via en meddelandetjänst, hämtat från ett socialt nätverk eller inspelat från ett videomöte är inte okomprimerat material. De 92 procenten hör till ett laboratorietillstånd. Siffran som beskriver en vanlig arbetsdag är 82.

Produkten tar inte emot formatet i sin egen rubrik

Nvidias tekniska dokumentation anger att tjänsten tar emot H.264-kodad MP4-video, avkodad på grafikkortet till enskilda bilder. H.264 är ett komprimerat format. Den indata produkten faktiskt accepterar är alltså komprimerad per definition, medan träffsäkerhetssiffran överst i meddelandet mättes på okomprimerad video. Båda uppgifterna står på två olika Nvidia-sidor och motsäger inte varandra, men lästa tillsammans säger de att rubrikens siffra beskriver indata som tjänsten inte tar emot.

Samma dokumentation beskriver modellens signaler som motståndskraftiga mot vanliga videobearbetningar, inklusive komprimering och omkodning. Motståndskraftig är ett adjektiv. Meddelandet levererar räkneverket bakom, nämligen ett fall på tio procentenheter mellan okomprimerat material och material vid 50 procents komprimering. När en leverantör ger dig både ett lugnande ord och sina egna mätningar, håll dig till mätningarna.

Den svarar på generering, inte på sanning

Detektorn bedömer om bildpunkter har syntetiserats. Den värderar inte om händelserna på skärmen inträffade. En verklig kamera framför en iscensatt scen, en äkta inspelning med en falsk bildtext eller autentiskt material från fel år passerar alla som verkliga, för i den enda mening modellen mäter är de det. Arkitekturen är en sammansättning av bildmodellerna DINOv2 och DINOv3 och returnerar en enda sannolikhet mellan noll och ett för hela videon, med valfria poäng per bild.

Den luckan väger tyngst i just de fall företag verkligen möter. Fakturan som omdirigeras efter ett övertygande videosamtal, försäkringskravet som stöds av filmat material, identitetskontrollen vid registrering på distans: överallt är frågan om det som visas är verkligt, inte enbart om en modell ritade bildpunkterna. En hög äkthetspoäng är förenlig med en helt bedräglig transaktion.

Vad du bör klargöra innan den står framför ditt inflöde

Wowza bygger in tjänsten via sitt Video Intelligence Framework, som når mer än 35 000 installationer i över 170 länder, så den kommer in i en infrastruktur många företag redan driver och inte som ett separat inköp. Klargör tre saker dessförinnan. Be om uppmätt träffsäkerhet vid den komprimeringsnivå ditt eget material bär. Fråga vilket sannolikhetströskelvärde som utlöser en åtgärd, eftersom Nvidia inte publicerar någon vägledning om falska larm. Fråga sedan vem som granskar markeringarna, för i den skalan skapar en frekvens nära en av fem på komprimerat material arbete i stället för svar.

Håll också mekanismerna åtskilda i din egen planering. Att märka innehåll när det skapas och att klassificera det i efterhand är olika saker: ursprunget följer med filen så länge ingen tar bort det, medan en klassificerare gissar utifrån bildpunkterna varje gång. En detektor är en rimlig andra signal. Den är inte en kontroll du kan sätta ditt namn under, och Nvidia har sagt just det.