Meningen som ett ledande AI-labb sällan skriver

Långt ner i Thinking Machines Labs tillkännagivande av Inkling den 15 juli ligger en rad som inget annat ledande AI-labb har velat publicera. Modellen är, skriver bolaget, "inte den starkaste modellen totalt sett som finns i dag". Sedan följer en beskrivning av vad bolaget i stället anser att Inkling är: "en bra bas med öppna vikter för anpassning". Varje modellansering de senaste tre åren har inletts med ett benchmarkdiagram. Den här inleddes med en begränsning.

Läs det som strategi, inte blygsamhet. Mira Murati, tidigare teknikchef på OpenAI, grundade Thinking Machines och tog ungefär nio månader på sig att leverera en modell i frontlinjens storleksklass, mot närmare fem år för OpenAI och tre för Anthropic. Labbet har omkring 200 anställda och förlorade två medgrundare till OpenAI i januari. Ett bolag i det läget vinner inget benchmarklopp mot labb med hundra gånger så stor beräkningsbudget. Så det avstod från att ställa upp.

Det användbara för den som köper AI är att en ärlig begränsning går att planera efter. En leverantör som säger sig ha högsta poängen på en offentlig topplista berättar om en siffra som slås inom några veckor, mycket möjligt innan er upphandling är klar. En leverantör som talar om vad produkten inte är har gett er något som håller. Det är ovanligare än det borde vara, och det är värt mer än det ser ut.

Vad som faktiskt finns i lådan

Inkling är en mixture-of-experts-transformer med 975 miljarder parametrar totalt och 41 miljarder aktiva åt gången. Den förtränades på 45 biljoner tokens av text, bild, ljud och video och stöder ett kontextfönster på upp till 1 miljon tokens. Den resonerar över text, bild och ljud, men skriver än så länge bara ut text, inklusive kod och strukturerade data. En lättare variant, Inkling-Small, har 276 miljarder parametrar totalt och 12 miljarder aktiva.

Två designval visar vad modellen är optimerad för. Den erbjuder styrbar tankeansträngning, så att den som anropar kan väga resonemangsdjup mot tokenkostnad för varje enskild förfrågan, och det är en kostnadsspak de flesta API:er inte ger er. Thinking Machines valde också relativa positionsinbäddningar framför RoPE och rapporterar att de extrapolerar bättre till längre sekvenser. Bolaget uppger att Inkling använder ungefär en tredjedel så många tokens som Nvidias Nemotron 3 Ultra för motsvarande prestanda på kod. På en faktura som räknas i tokens är tokeneffektivitet ingen teknisk detalj.

Kontrollera de praktiska siffrorna före rubriksiffrorna. Vikterna finns på Hugging Face, och Inkling går att nå via Tinker, bolagets plattform för finjustering, vid kontextlängder på 64 000 och 256 000 tokens, för närvarande med 50 procent rabatt under en begränsad period. Notera glappet: modellen stöder upp till en miljon tokens kontext, medan den hanterade plattformen i dag erbjuder en fjärdedel av det. Om ert användningsfall bygger på hela fönstret får ni köra modellen i egen drift, och att själv driva en modell med 975 miljarder parametrar är ett tungt infrastrukturåtagande, inte en eftermiddag.

Den öppna forskningsfronten är numera ett gemensamt arv

Uppgiften om härkomst i det här släppet förtjänar mer uppmärksamhet än parameterantalet. Thinking Machines uppger att Inklings mixture-of-experts-design i stora drag följer DeepSeek-V3, med 256 routade experter och två delade experter, där sex routade experter är aktiva per token. Bolaget använde också modeller med öppna vikter, bland dem Moonshot AI:s Kimi K2.5, för att generera data till tidig efterträning, innan den storskaliga förstärkningsinlärningen. Ett labb i San Francisco, grundat av OpenAI:s tidigare teknikchef, byggde sin arkitektur på ett kinesiskt labbs publicerade design och startade upp den med ett annat kinesiskt labbs modell.

Så här ser en öppen forskningsfront ut i praktiken. Inte som ett lopp om att plantera flaggor mellan två block, utan som ett gemensamt tekniskt arv som flödar åt alla håll och inte ber om lov vid någon gräns. Ingenjörsarbetet flyttade från Hangzhou och Peking till San Francisco därför att det var publicerat, och resultatet publicerades i sin tur.

För en europeisk ägare har det ett konkret och osentimentalt värde. Tillgång till en hostad frontmodell är en affärsrelation som styrs av policy-, pris- och tillgänglighetsbeslut fattade i en annan jurisdiktion, vilket alla vars modell lanserades i 47 länder men inte i EU redan har lärt sig. En nedladdad uppsättning öppna vikter är en annan sorts tillgång. Den blir inte begränsad, omprissatt eller avvecklad under fötterna på er, eftersom ni redan har den. Det är inget argument för att öppna vikter är bättre. Det är ett argument för att de fallerar på ett annat sätt, och att veta hur ett beroende fallerar är det mesta av vad upphandling är till för.

Om det här är ett köp ni bör göra

Gränsen går mellan att hyra intelligens och att äga en förmåga. Är ert AI-arbete brett, skiftande och ändras varje vecka ska ni hyra: betala per token för den bästa hostade modellen och byt när en bättre dyker upp, för det ni köper är rörlighet. Är arbetet smalt, repetitivt, av hög volym och specifikt för er verksamhet kan en anpassningsbar bas som ni finjusterar och behåller slå en generell modell som aldrig har sett er domän, och kostnaden slutar växa med användningen.

Var ärlig om vad anpassning kräver, för det är här planen brukar spricka. Finjustering kräver träningsdata som ni faktiskt äger och har rätt att använda. Den kräver en utvärderingsuppsättning byggd på ert verkliga arbete, inte på en offentlig benchmark, annars har ni inget sätt att veta om er version är bättre än den ni utgick från. Och den kräver en namngiven person som äger modellen i produktion, för en finjusterad modell som ingen underhåller förfaller tyst medan verksamheten förändras runt omkring den. Saknas någon av de tre är en bas med öppna vikter en nedladdning, inte en förmåga.

Den ärliga läsningen av Inkling är att erkännandet är själva funktionen. Thinking Machines har talat om vad modellen inte är, och då återstår bara frågan om anpassningsbarhet är det ni behöver. För de flesta bolag som kör en handfull generella AI-uppgifter är det inte det, och att hyra förblir rätt val. För den mindre skara som har ett smalt problem med hög volym och verkliga egna data är en bas ni kan äga och forma ett genuint annat ekonomiskt erbjudande än tillgång som mäts per token till någon annans modell. Båda går att försvara. Att köpa det andra och budgetera för det första gör det inte.