Branschen för artificiell intelligens drabbades av ett abrupt uppvaknande den 12 juni 2026. Det rådande antagandet under de senaste åren var att företagsarkitekturer tryggt kunde förlita sig på proprietära spetsmodeller som tillhandahölls via externa API:er. Denna bekväma illusion kollapsade fullständigt klockan 17:21 Eastern Time 12 juni 2026. USA:s regering utfärdade ett direktiv om exportkontroll som beordrade Anthropic att omedelbart stoppa all tillgång till sina mest kraftfulla modeller, Fable 5 och Mythos 5, för samtliga utländska medborgare oavsett var i världen de befann sig1! Eftersom modellleverantören inte med säkerhet kunde verifiera nationaliteten för varje användare som gjorde en förfrågan i realtid, genomförde företaget en global nedstängning av båda modellerna för samtliga kunder3.
En kapacitet som fanns tillgänglig på marknaden på morgonen var helt borta till kvällen, helt utan övergångsperiod5. Jag såg detta kaos utspela sig i realtid. Sårbarheten i att vara beroende av proprietär AI blev omöjlig att förneka. Riskanalyser för företag måste nu ta hänsyn till verkligheten att tillgång till spetsmodeller är en mycket bräcklig tjänst som när som helst kan få mattan undanryckt genom plötsliga myndighetsbeslut.
Att förlita sig på externa säkerhetsspärrar och utlandsägda beräkningslager utgör en existentiell risk för verksamheten. Det moderna företaget måste eftersträva fullständigt oberoende.
Organisationer måste ha kontroll över den underliggande fysiska infrastrukturen, förvalta modellernas råa vikter och driftsätta ocensurerade system med kapacitet för obegränsat analysdjup. Vi går in i en era där det är nödvändigt att äga kiselchipsen och äga modellvikterna.
Den här forskningsrapporten utforskar det systemiska misslyckandet för externa säkerhetsspärrar, den vackra matematiken bakom representationskonstruktion, den absoluta nödvändigheten av avliterade modeller inom cybersäkerhet, samt framväxten av plattformar för inhemsk beräkningskraft som den slutgiltiga företagslösningen. Vi kommer att djupdyka i de öppna källkodsverktyg som tar bort spärrarna från dessa modeller och förklara varför även helt vanliga företag desperat behöver dessa funktioner för att överleva.
För att förstå nödvändigheten av ocensurerade modeller måste branschen först analysera de oerhört röriga händelserna som ledde fram till exportförbudet i juni 2026. Berättelsen börjar i april 2026 när Anthropic tillkännagav förhandsversionen av sin modell Claude Mythos. Systemet uppvisade så enastående förmågor inom mjukvaruteknik att företaget bedömde det som alldeles för farligt för allmän lansering3. Mythos kunde på egen hand analysera enorma äldre kodbaser, identifiera kritiska okända sårbarheter och skapa fungerande exploateringskedjor utan någon mänsklig inblandning6.
Omfattningen av dessa förmågor chockade säkerhetsbranschen. Modellen upptäckte över 10 000 allvarliga säkerhetsbrister under den inledande privata testfasen6. Den lyckades bland annat identifiera en sexton år gammal sårbarhet i FFmpeg-biblioteket – i en kodrad som automatiserade testverktyg tidigare undersökt fem miljoner gånger utan att någonsin upptäcka problemet6.
Dessutom kunde Mythos sammanlänka flera sårbarheter i Linuxkärnan för att höja behörighetsnivån och ta fullständig kontroll över datorn helt på egen hand6.
På grund av dessa extrema förmågor begränsade Anthropic åtkomsten till en mycket utvald grupp cybersäkerhetsexperter och leverantörer av kritisk infrastruktur inom ramen för ett samarbetsprojekt kallat Project Glasswing7. Programmet utvidgades så småningom till cirka 150 organisationer, inklusive teknikjättar som Cisco, CrowdStrike, BeyondTrust, Rubrik och Amazon Web Services6. Denna utvalda grupp av säkerhetsexperter använde Mythos för att skriva komplexa säkerhetsuppdateringar, utföra automatiserad hotdetektering och skriva om äldre kodbaser i minnessäkra programmeringsspråk7.
Anthropic försökte senare kommersialisera en begränsad version av denna teknik. Den 9 juni 2026 lanserade företaget Claude Fable 5 offentligt3. Fable 5 delade exakt samma underliggande arkitektur som Mythos 5, men utrustades med hårda säkerhetsfilter utformade för att blockera alla förfrågningar relaterade till avancerad cybersäkerhet, biologi eller kemi8.
Fable 5 erbjöds för tio dollar per miljon indatatokens och femtio dollar per miljon utdatatokens, vilket innebar en enorm rabatt jämfört med prissättningen för den tidigare förhandsversionen av Mythos8. Modellen stoltserade med ett kontextfönster på en miljon tokens, adaptiva resonemangslägen och funktioner för programmeringsbaserade verktygsanrop12.
Den regulatoriska släggan föll bara tre dagar efter lanseringen av Fable 5. Säkerhetsforskare hos Amazon upptäckte en instruktionsteknik som kringgick säkerhetsspärrarna i Fable 514. Genom att använda en manuell flerstegsprompt kombinerad med en ramsekvens för defensivt säkerhetsarbete, tvingade forskarna Fable 5 att generera konceptbevis för mjukvarusårbarheter14. Amazons verkställande direktör Andy Jassy eskalerade detta fynd direkt till USA:s handelsdepartement15.
Samtidigt växte en djup oro i Vita huset över att den sydkoreanska telekomjätten SK Telecom ingick i gruppen för Project Glasswing16. SK Telecom hade investerat hundra miljoner dollar i Anthropic under föregående år för att bygga en modell anpassad för telekombranschen16. Företaget tillhörde däremot den större SK Group-koncernen, som historiskt och löpande haft finansiella kopplingar till China Unicom16. Den amerikanska administrationen drog slutsatsen att Anthropic inte gick att lita på när det gällde att skydda avancerade AI-tillgångar från utländska motståndare16.
Det resulterande exportkontrolldirektivet förbjöd alla utländska medborgare från att använda Mythos 5 eller Fable 51. Direktivet gällde även Anthropics egna utländska anställda som arbetade på amerikansk mark2. Förbudet skapade ett helt splittrat globalt ekosystem. Organisationer som undantogs genom övergångsregler inom Project Glasswing behöll sin tillgång, eftersom de verkar under strikta ITAR-regelverk som kan verifiera användarnas medborgarskap9. Samtidigt miste resten av det globala utvecklarsamhället helt tillgången till marknadens mest kapabla resonemangsmotor9.
En koalition av 150 framstående cybersäkerhetsexperter protesterade kraftigt mot beslutet14. Som den ledande säkerhetsexperten Alex Stamos påpekade är det en dårskap att ta ifrån allierade IT-försvarare de bästa defensiva verktygen, samtidigt som fientliga nationalstater lagrar sårbarheter på hög14. Du kan inte ge Fable hela Linuxkärnan och be den hitta alla buggar med en enda prompt14. Exportförbudet handikappade i praktiken globala försvarare, medan motståndarna kunde fortsätta att fritt experimentera med avancerade system baserade på öppen källkod.
Den internationella reaktionen belyser faran med att förlita sig på amerikanska proprietära plattformar. Zohos grundare Sridhar Vembu noterade att teknik är det ultimata vapnet och att nationellt oberoende nu helt handlar om teknik17. Han betonade att indiska utvecklare och globala tekniknav måste driftsätta mindre alternativ med öppen källkod för att ligga steget före och konstaterade uttryckligen att användare aldrig får blanda ihop tillgång med ägandeskap17. Det indiska tekniksamhället började omedelbart dela improviserade kreativa nödlösningar (”jugaad”) med hjälp av VPN-tjänster och proxyservrar, men den övergripande insikten kvarstod18. Om den viktigaste tekniska konkurrensfördelen ditt företag använder innehåller externa kontrollslingor är hela din affärsmodell helt sårbar17.
Företagets övergång till modeller med öppna vikter kräver en förståelse för hur proprietära modeller upprätthåller censur och varför den censuren bryter tekniska arbetsflöden. Grundläggande språkmodeller genomgår omfattande säkerhetsanpassning före driftsättning19. Tekniker som exempelvis övervakad finjustering (Supervised Fine-Tuning) och förstärkningsinlärning (Reinforcement Learning) från mänsklig återkoppling tränar det neurala nätverket att identifiera potentiellt skadliga instruktioner och generera standardiserade avvisningssvar20. Nyare metoder, inklusive direkt preferensoptimering (Direct Preference Optimization), gör det möjligt för utvecklare att effektivt finjustera avvisningsbeteenden genom att skjuta in små, träningsbara adaptrar i nätverkslagren20.
Denna anpassningsprocess medför allvarlig friktion för legitimt tekniskt arbete. Säkerhetsanpassade modeller uppvisar ett väl dokumenterat fenomen som kallas övervägran21. Modellen avvisar felaktigt helt säkra instruktioner eftersom den språkliga strukturen i prompten ytligt liknar en skadlig begäran21. En cybersäkerhetsexpert på ett företag som försöker analysera ett misstänkt skript eller skriva en nyttolast för penetrationstestning kommer att stöta på ständiga automatiska avslag22.
När modeller tränas för att fungera som företagets efterlevnadsansvariga blir de i praktiken helt oanvändbara för djupgående teknisk analys. Till och med Googles egna IT-säkerhetsexperter drabbades av en orimligt hög andel vägringar i svar när de använde sina interna modeller, vilket gav säkerhetsförsvararna ett enormt underläge22. Slutresultatet? De goda krafterna står utan verktyg, medan hackarna opererar helt utan begränsningar.
Det första initiativet kom däremot inte från Fortune 500-företagens säkerhetsteam. En stor del av de som utvecklade ocensurerade modeller ville ursprungligen bara ha dem för ofiltrerat kreativt skrivande och rollspel. Dessa utvecklare lade ner tusentals timmar på att knäcka och montera ner säkerhetsspärrarna för att få lokala modeller som slutade vägra kreativa förfrågningar.
Men i dag har vanliga, helt ordinära företag ett desperat behov av exakt samma verktyg. Tekniken som utvecklades för att kringgå säkerhetsfilter i nöjessyfte är nämligen exakt samma teknik som krävs för att en modell ska kunna ombes att analysera skadlig kod utan att det orsakar ett verbalt utbrott om etik.
Säkerhetsbranschen insåg snabbt att API-baserade jailbreaks var en otillräcklig lösning på problemet med överdriven vägran20. En hackad proprietär modell begränsas fortfarande i grunden av sina underliggande vikter för säkerhetsjustering20. Även när modellen lurats att följa en instruktion genererar den ofta ofullständiga, hallucinerade eller inkonsekventa svar, eftersom programmeringen om vägran fortfarande utövar ett starkt inflytande över sannolikheterna för token-generering20.
Den enda livskraftiga lösningen kräver att man förändrar modellens fundamentala kognitiva tillstånd. Branschen behövde en mekanism för att modifiera modellvikterna direkt och därmed radera censurlogiken vid källan20. Det var detta behov som ledde till den moderna eran av modifieringar på viktnivå.
Det genombrott som möjliggjorde ocensurerade modeller växte fram ur det utpräglat akademiska fältet representationsteknik23. Området har utvecklats av forskare vid Center for AI Safety och tar sig an transparens i neurala nätverk utifrån ett övergripande kognitionsneurovetenskapligt perspektiv24. Transformerbaserade stora språkmodeller bearbetar information via en central kommunikationskanal som kallas residualströmmen (residual stream).25. I varje lager av nätverket lägger modellen till utdata från både uppmärksamhetsmekanismer och flerlagers perceptroner (feed-forward MLPs) direkt i denna residualström25. Residualströmmen fungerar som en enorm informationsmotorväg som samlar på sig alltmer komplexa drag hos indatatexten när den färdas från det första lagret till det sista25.
Ramverket för representationsteknik utgår från hypotesen att abstrakta koncept på hög nivå – exempelvis ärlighet, nytta, moral och ofarlighet – motsvarar specifika geometriska riktningar i det latenta aktiveringsrummet24. Det hämtar stor inspiration från ett hopfieldskt synsätt inom kognitiv neurovetenskap, där representationer och transformationerna mellan dem betraktas som kognitionens själva kärna24.
Forskare kan observera aktiveringsfunktionens utdata över olika prompter23. Denna process kallas linjär artificiell tomografi och består av tre tydliga steg: Först utformar ingenjörer en stimulans och uppgift och sammanställer dataset som uttryckligen aktiverar det koncept de vill studera. Sedan samlar de in den neurala aktiviteten med hjälp av PyTorch forward hooks för att extrahera modellens interna tillstånd under inferensen. Slutligen konstruerar de en linjär modell med hjälp av tekniker som huvudkomponentanalys (PCA) eller K-means-klustring isoleras de specifika vektorer som motsvarar de eftersökta koncepten24.
När dessa representationer väl har isolerats gör representationsstyrning det möjligt för ingenjörer att artificiellt förstärka eller dämpa dessa specifika geometriska riktningar under beräkningssteget23. Detta förändrar modellens beteende dynamiskt i stunden, helt utan krav på traditionell omträning eller finjustering23.
Forskare upptäckte till exempel att när de justerade en modells interna känslorepresentation mot positiva känslor, blev modellen avsevärt mycket mer tillmötesgående – även när användaren bad den att agera emot sina säkerhetsspärrar29.
Representation Engineering visade att du varken behöver ändra indatatexten eller finjustera modellen med ett anpassat dataset. Du kan helt enkelt tillämpa dynamiska transformationer på aktiveringarna i realtid och på så sätt styra modellens interna kognitiva tillstånd23.
Den teoretiska grunden för representation engineering banade väg för den ultimata avcensureringstekniken, känd som abliteration25. I juni 2024 publicerade ett forskarteam, med bland andra Andy Arditi och Wes Gurnee, en banbrytande artikel som visade att vägransbeteende i språkmodeller styrs av ett enda endimensionellt delrum inuti residualströmmen25. I tretton populära chattmodeller med öppen källkod, som varierade i storlek upp till 72 miljarder parametrar, fann forskarna konsekvent en enda latent riktning som styrde säkerhetsefterlevnaden30.
Elegansen i denna upptäckt tog den tekniska världen med storm. Ett massivt neuralt nätverk som hanterar otrolig komplexitet kanaliserar hela sin ”moraliska panik-respons” genom en enda matematisk vektor31.
Processen för att isolera denna vägranriktning bygger på en skattning för skillnad i medelvärden21. Forskarna sammanställer ett kontrastivt dataset som innehåller hundratals skadliga instruktioner och ett lika stort antal ofarliga instruktioner31. De kör dessa promptar genom målmotorn och spelar in de interna aktiveringarna i residualströmmen i token-regionerna direkt efter instruktionen26. Systemet beräknar den genomsnittliga aktiveringsvektorn för de skadliga promptarna och subtraherar den genomsnittliga aktiveringsvektorn för de ofarliga promptarna25.
Den resulterande differensvektorn definierar den exakta vägransriktningen i aktiveringsrummet25. Den fångar den exakta geometriska skillnaden mellan konceptet ”på väg att vägra” och konceptet ”på väg att tillmötesgå”25.
När vägransriktningen väl har isolerats matematiskt tillämpar utövare en teknik som kallas riktningsortogonalisering, eller abliteration35. Målet är att kirurgiskt avlägsna säkerhetsanpassningen genom att förhindra modellen från att skriva information till vägransunderrummet25. Utifrån vektorn för vägransriktningen beräknar algoritmen den skalära projektionen av valfria viktmatrisutdata på den vektorn25. Projektionen beräknas som skalärprodukten av aktiveringsvektorn och enhetsvektorn för vägransriktningen, multiplicerad med själva enhetsvektorn25.
Genom att subtrahera denna specifika projektion från de ursprungliga vikterna blir de modifierade matriserna helt ortogonala mot vägransriktningen25. Operationen förstör helt modellens förmåga att representera konceptet vägran samtidigt som den fullständigt bevarar alla ortogonala komponenter relaterade till logik, kodning och allmän kunskap25.
Effekten av denna riktade ablation på modellens totala prestanda är otroligt minimal. Empiriska utvärderingar visar att ablaterade modeller praktiskt taget inte drabbas av någon kapacitetsförsämring alls35. Till exempel bevarar verktyget DECCP abliteration, när det används på modeller som Yi-1.5-9B och Mistral-7B, förmågan till flerstegsresonemang med extrem precision35. På det krävande riktmärket för matematisk problemlösning, GSM8K, tappar de ablitererade modellerna endast en försumbar bråkdel av en procentenhet i prestanda – vanligtvis runt minus 0,13 till minus 0,28 procentenheter35. Modellen blir av med sin säkerhetsprogrammering samtidigt som den behåller sin resonemangsförmåga helt intakt.
Upptäckten av riktad ortogonalisering (directional orthogonalization) utlöste en intensiv kapprustning inom öppen källkod-gemenskapen för att bygga automatiserade verktyg för viktkirurgi. Den mest kända tidiga implementeringen kom från en utvecklare som arbetar under pseudonymen FailSpy25. FailSpy publicerade abliterator-biblioteket, en mycket användarvänlig Python-verktygslåda som byggde på ramverket TransformerLens38.
Det här biblioteket gjorde det möjligt för forskare att gå in i tillfälliga exekveringskontexter, snabbt cacha aktiveringar från hundratals prompt-exempel och automatiskt beräkna nekningsriktningen38. FailSpys kodbas förvandlade ett abstrakt akademiskt koncept till ett enkelt skript som kunde avskärma och avcensurera modeller på bara några minuter25. En utvecklare kunde helt enkelt ladda en modell, köra funktionen cache_activations med 512 exempel, extrahera nekningsvektorerna och applicera den permanenta ortogonaliseringen på de specifika lager som ansvarade för censuren38.
Ekosystemet expanderade snabbt till att inkludera betydligt mer sofistikerade ramverk för ablation. En systematisk jämförande utvärdering analyserade fyra stora ablationsverktyg över sexton olika instruktionsfinjusterade modeller19. De verktyg som utvärderades var Heretic, DECCP, ErisForge och FailSpys ursprungliga abliterator19.
Heretic använder Bayesiansk-optimerad ablation i kombination med trädstrukturerad Parzen-skattning37. Verktyget genomför en optimeringssökning över tusentals möjliga riktningsmodifieringar för att minimera Kullback-Leibler-divergens samtidigt som hastigheten för undertryckande av neknas maximalt19. Eftersom Heretic arbetar direkt på PyTorch-vikttensorer utan beroenden till externa ramverk uppnår det universell kompatibilitet tvärs över olika modellarkitekturer19. Att köra Heretic tar vanligtvis mellan trettio och hundratio minuter per modell, där cirka femtio försök används för att balansera utforskning och effektivitet19.
DECCP fokuserar starkt på minneseffektiv skivad bearbetning37. Verktyget kan ladda modeller med 4-bitars kvantiserad precision med hjälp av biblioteket bitsandbytes, vilket gör det möjligt för utvecklare att köra aktiveringscachningsfasen på konsumenthårdvara med begränsat grafikkortsminne33. DECCP tillämpar även normbevarande biprojekterad ablation19. Standardmetoder för ablation subtraherar projektionen av vikterna direkt, vilket oavsiktligt kan ändra storleken (magnituden) på viktraderna och försämra modellens vanliga förmågor något19. Normbevarande metoder delar istället upp viktmatriserna i separata storleks- och riktningskomponenter19. Skriptet ablagerar endast riktningskomponenten och återställer de ursprungliga radnormerna, vilket ger en ännu bättre bevaring av modellens resonemangsförmåga19.
ErisForge introducerar ett helt annat tillvägagångssätt genom att fokusera på transformationer av dekoderlager37. Verktyget använder ett adapterbaserat ramverk för att injicera träningsbara riktningsmodifieringar under framåtpassningarna19. ErisForges arkitektur möjliggör både permanent ablation av nekningsvikter och dynamisk injicering av specifika beteenderiktningar för mycket kontrollerade forskningsapplikationer19.
Dessa öppen källkod-verktyg utplånade helt konceptet med kommersiellt och proprietärt säkerhetsanpassande26. En lokal angripare eller en företagsaktör kan enkelt skala bort säkerhetsmekanismerna från avancerade kommersiella modeller35. Metoder för direkt preferensoptimering (Direct Preference Optimization, DPO) visade sig vara särskilt sårbara för denna attackvektor35. Modeller som finjusterats enbart med DPO, som exempelvis Zephyr-7B-beta, uppvisar mycket lokaliserade säkerhetsrepresentationer35. När dessa modeller bearbetas med optimeringsverktyget Heretic uppnås en häpnadsväckande attackframgång på 98 procent mot dataset med skadligt innehåll, samtidigt som distributionsförskjutningen hålls minimal med en KL-divergens på bara 0,07635.
Den otroliga enkelheten i att utföra ablation av nekningsfunktioner utlöste naturligtvis en storskalig försvarsrespons från akademiska säkerhetsforskare. Modellleverantörer insåg att vanliga finjusteringsstrategier erbjöd noll skydd mot en ”white-box-angripare” som har tillgång till modellens vikter39. En ny disciplin växte fram, helt fokuserad på att försvara det latenta rummet mot ortogonala projektionsattacker32.
En tidig försvarsstrategi involverade träning med utökad nekan35. Forskare försökte sprida ut säkerhets- och nekningssignalerna över flera tokens och flera dimensioner, istället för att låta dem konsolideras till en enda linjär vektor35. Genom att tvinga det neutrala nätverket att dirigera säkerhetsbeslut genom komplexa, icke-linjära och högdimensionella representationer, var försvararnas mål att göra ablation av enskilda riktningar matematiskt omöjlig35. Det här tillvägagångssättet lyckades minska effektiviteten hos standardablation från en framgångsgrad på åttio procent till under tio procent i kontrollerade tester35.
Mer avancerade försvarsmetoder som tillämpas i efterhand (post-hoc) försöker aktivt sabotera angriparens verktyg. Decoy Direction Optimization (optimeringsbaserad skenriktning) representerar ett fascinerande framsteg inom fientlig viktredigering (adversarial weight editing), ledd av forskare som Aashiq Muhamed, Mona Diab och Virginia Smith39. Istället för att försöka dölja de faktiska nekningskretsarna, injicerar metoden aktivt en storskalig och kraftfull icke-linjär skensignal direkt i nätverkets flerlagers perceptron-neuroner (MLP-neuroner)39.
När en angripare kör FailSpys abliterator eller Heretic för att beräkna skattningen av medelvärdesdifferensen korrumperar den injicerade skensignalen deras kontrastiva analys helt och hållet39. Skensignalen tvingar neuronerna att läsa den skadliga prompten och skriva storskaliga uppdateringar i riktningar som är helt ortogonala mot den faktiska nekningsvektorn39. De automatiserade verktygen identifierar oundvikligen denna kraftfulla skensignal som nekningsriktningen39. Angriparen ablagerar därefter en helt ofarlig egenskap, medan den faktiska säkerhetsmekanismen förblir helt intakt och fungerande39.
Forskarna bevisade en spektral gräns som formaliserar denna effekt, och demonstrerade en gräns för skattningsöverlappning som ger en diagnostisk uppskattning av angriparens effektiva fasbudget39. Empiriska tester över sex modellfamiljer visade att Decoy Direction Optimization reducerar framgångsgraden för standardablation från över åttiofem procent ner till ensiffriga tal – allt utan att kräva beräkningsmässigt kostsam finjustering av grundmodellen39. Det sänker framgångsfrekvensen för Heretic-attacker på viktnivå från nästan 90 procent till 18 procent39.
Ett annat mycket tekniskt försvar som kallas APRA använder rank-k-uppdateringar för att dölja vägranssignalen41. Denna metod applicerar matrisuppdateringar på komponenterna som skriver till residualströmmen, samtidigt som vägransframkallande aktiveringar ersätts med slumpmässiga matematiska alias41. Försvaret korrigerar sedan matriserna som läser längre ned i flödet för att säkerställa att modellen fortfarande genererar det förväntade vägranssvaret på ett naturligt sätt, utan att dess generella förmågor försämras41. Vid tester på Llama-3.1-8B-arkitekturen förbättrade APRA avsevärt poängen för vägran efter ablation avsevärt jämfört med den oförsvarade baslinjen, med mindre än en halv procents MMLU-försämring41.
Defensiv patchning räcker däremot ofta inte till mot en målmedveten optimering. Mekanistisk analys visar att överdrivna nekanden och faktiska skadliga vägranden upptar helt olika dimensionella rum21. Riktningarna för skadliga vägranden är oberoende av den specifika uppgiften och fångas av en enda global vektor, medan riktningarna för överdrivna vägranden befinner sig inom kluster av godartade uppgiftsrepresentationer och varierar kraftigt mellan olika uppgifter21. Denna uppgiftsberoende geometri visar sig vara oerhört svår att säkra helt21.
Öppen källkod-gemenskapen uppdaterar kontinuerligt sina ablationsverktyg för att ta hänsyn till flerdimensionella koner och icke-linjära beroenden42. Denna katt och råtta-lek på viktnivå garanterar att ocensurerade modeller alltid kommer att finnas tillgängliga för dem som har de beräkningsresurser som krävs för att bearbeta dem.
Det absoluta behovet av ocensurerad funktionalitet blir smärtsamt uppenbart när man granskar moderna cyberförsvarsarbetsflöden. Vanliga företag och organisationer behöver dessa modeller enbart för sin operativa säkerhet och för avancerad emulering av hot22.
Det moderna säkerhetscentret (Security Operations Center, SOC) hanterar en enorm volym av hotinformation, skadkodsprover och attacktelemetri20. Modellen identifierar skadkodssyntaxen, flaggar begäran som ett brott mot säkerhetspolicyn och ger ett schablonartat nekningssvar20. Modellen identifierar skadlig programvaras syntax, flaggar begäran som en överträdelse av säkerhetspolicyer och genererar ett fördefinierat nekningssvar20. Som ett resultat slösar analytiker bort otaliga timmar på att kämpa mot den artificiella intelligensen istället för att kämpa mot den faktiska motståndaren.
Rödslagsverksamhet (red teaming) utgör ett ännu mer övertygande användningsfall för fullständiga ablationsmöjligheter44. Auktoriserade penetrationstestare behöver språkmodeller för att generera anpassade exploateringsskript, analysera Active Directory-certifikattjänster, konstruera NTLM-reläattacker och utveckla tekniker för att kringgå slutpunktsdetektering22. Riktmärket Red Team AI Benchmark testar modeller på just dessa förmågor med hjälp av automatiserade utvärderingskriterier i lokala exekveringsmiljöer44.
Vanliga anpassade modeller får noll poäng på detta riktmärke eftersom de konsekvent ger etiska vägranden när de ombeds modifiera minnesskydd eller generera skalkod (shellcode)44.
En ablitererad modell som körs lokalt förändrar red team-engagemanget helt20. Ocensurerade modeller uppnår konsekvent toppresultat på riktmärken för angrepp och tillhandahåller fungerande, korrekt kod utan några moraliserande ansvarsfriskrivningar44. Avancerade utvärderingsimplementeringar använder optimeringsmodeller som dynamiskt skriver om avvisade promptar med hjälp av teknisk dekonstruktion, rollspel och inramning kring kända sårbarheter för att garantera att nyttolasten levereras44.
Branschen bevittnar dessutom i detta nu starten för den autonoma AI-agenten43. Senare tiders arkitektoniska utformningar har ramverk med dubbla agenter, där autonoma ”red team-agenter” tävlar direkt mot autonoma ”blue team-agenter” i kraftigt isolerade sandlådemiljöer43. Beslutslagren för dessa offensiva agenter förlitar sig i hög grad på lokalt värdplacerade, ablaterade modeller43. Till exempel ger ocensurerade versioner av modellen Qwen 2.5 Coder 14B Instruct det strategiska resonemang som krävs för attackplanering, vilket möjliggör säkerhetsfokuserade förfrågningar som vanliga modeller helt vägrar svara på43. Dessa autonoma offensiva system kan uppnå ett komplett intrång via SSH (Secure Shell) i målarkitekturer på under nittio sekunder, medan ”blue team-agenterna” distribuerar dynamiska försvar baserade på vitlistning med verktyg som auditd och fail2ban43.
Företag har inte råd att spela försvar med begränsade verktyg14. Utländska motståndare och statligt sponsrade hotaktörer arbetar utan några som helst säkerhetsspärrar14. Kinesiska modeller med öppna vikter närmar sig snabbt kapaciteten hos de bästa amerikanska proprietära systemen14. Det är statistiskt sett bortom allt tvivel att statsunderstödda grupper förfogar över massiva kluster av ocensurerad AI som dygnet runt letar efter och upptäcker okända sårbarheter6. Att beröva företagens försvarare motsvarande förmågor garanterar ett katastrofalt misslyckande under nästa stora cyberkonflikt14. Organisationen måste distribuera ocensurerade processorer för hotinformation enbart för att upprätthålla paritet med den moderna angriparens grundläggande kapacitet.
Skärningspunkten mellan plötsliga regulatoriska API-förbud och det absoluta operativa behovet av ocensurerade modeller tvingar fram en radikal omvärdering av företagens molnarkitektur. Antagandet att ett företag säkert kan hyra AI från en centraliserad leverantör inom en annan jurisdiktion är helt död5. Beräkningskapacitet motsvarar direkt suveränitet45. De organisationer som fysiskt äger datorerna kommer att diktera framtiden, medan länder som hyr beräkningskapacitet från datacenter utomlands kommer för alltid att vara sårbara45.
BUZZ HPC insåg denna arkitektoniska oundviklighet långt före Anthropic Fable-incidenten46. Som ett kanadensiskt inhemskt neomoln fokuserar BUZZ HPC helt på att bygga fysisk infrastruktur i industriell skala, utformad för att eliminera beroendet av utlandsstyrda API:er45. BUZZ HPC förstår att verklig integration av artificiell intelligens kräver en air-gapped, suverän reservlösning som inget direktiv från en utländsk regering någonsin kan inaktivera4.
Omfattningen av BUZZ HPC:s fysiska distribution återspeglar storleken på företagets behov. Företaget har säkrat en enorm sammanhängande tomtyta på 10 hektar i Toronto-området för uppförandet en egen AI-gigafabrik45. Denna anläggning har en häpnadsväckande kapacitet på 320 MW dedikerad el från elnätet45. Gigafabriken utgör ankaret i en nationell intelligensplattform utformad för att driftsätta över ett hundra tusen grafikprocessorer (GPU:er), vilket skapar den fysiska ryggraden för den inhemska AI-ekonomin och etablerar ett av Nordamerikas största inhemskt kontrollerade kluster45.
Den interna hårdvaruspecifikationen garanterar prestanda i absolut framkant för modeller på lokala datorer. BUZZ HPC anskaffade över 2 304 Nvidia Grace Blackwell-GPU:er som är ordnade i avancerade GB200 NVL72-racksystem46. Detta superdatorkluster använder Nvidia Quantum InfiniBand-nätverk för skalanpassning och avancerad vätskekylning för att uppnå optimal energieffektivitet46. Infrastrukturen ger exakt den miljö som krävs för att köra massiva modeller med öppna vikter, utföra krävande representation engineering och driftsätta ablitererade instanser på ett säkert sätt.
De ekonomiska och strategiska partnerskapen kring BUZZ HPC validerar tesen om inhemska beräkningsdata. BUZZ HPC har ingått ett banbrytande treårsavtal värt 220 miljoner dollar med Bell Canada och den framstående språkmodellsutvecklaren Cohere46. I och med detta placeras Nvidia-superdatorklustret direkt i Bell Canadas avancerade datacenter i Merritt, British Columbia46.
Samarbetet förenar Bells nationella nätverksinfrastruktur, Hypertecs inhemskt tillverkade hårdvaruservrar, Coheres modellarkitektur för företag och BUZZ HPC:s rena beräkningskraft till en enhetlig och integrerad suverän IT-stack47. Den resulterande plattformen gör det möjligt för företag och myndigheter att flytta sin verksamhet till en infrastruktur som helt och hållet befinner sig inom de egna landsgränserna49. Data lämnar aldrig jurisdiktionen. Modellvikterna förblir helt under driftteamets kontroll. Inget oväntat exportkontrolldirektiv kan någonsin bryta anslutningen4.
Att säkra tillgången till suverän hårdvara löser det fysiska beroendeproblemet, men enterprise-arkitekturer för mjukvara måste också anpassas till den nya verkligheten. Konsensusen bland ingenjörer är att applikationer aldrig får ha en hårdkodad direktanslutning till en specifik proprietär modell4. Att låsa en applikation till en enskild leverantör innebär att produktens färdplan kopplas direkt till leverantörens regelmässiga och juridiska risker5. Om leverantören drabbas av en incident kopplad till efterlevnad drabbas enterprise-applikationen av ett katastrofalt avbrott5.
Den moderna arkitekten måste därför ta till sig en AI-gateway som stöder flera leverantörer4. Detta abstraktionslager ligger mellan enterprise-applikationens kodbas och de underliggande modellslutpunkterna4. Kodbasen kommunicerar uteslutande med den sammanhållna gatewayen, som i sin tur intelligent dirigerar trafiken till lämplig modell baserat på tillgänglighet, kostnad och krav på funktionalitet4.
En korrekt konfigurerad gateway för flera leverantörer ger omedelbar och automatisk reservdrift4. Drifttagandet definierar primär omdirigering till kraftfulla kommersiella API:er så länge dessa förblir lagligt tillgängliga och ändamålsenliga4. Samtidigt definierar gateway-arkitekturen en sekundär omdirigering till suveräna, egenvärdade reservmodeller4. Om en kommersiell slutpunkt drabbas av nertid, genomför plötsliga ändringar i sina regler för datalagring eller försvinner helt på grund av ett oväntat exportkontrolldirektiv, omdirigerar gatewayen sömlöst anropen till det suveräna klustret – utan att en enda rad applikationskod behöver ändras4.
Det avgörande är att denna gateway-infrastruktur gör det möjligt för säkerhetscenter (SOC) att dynamiskt dirigera trafik baserat på promptens specifika karaktär. Harmlösa förfrågningar om företagspolicyer eller standardiserad dataanalys går via vanliga kanaler. Ytterst känsliga sökningar gällande hotunderrättelser, arbetsbelastningar inom reverse engineering och tester för offensiv säkerhet dirigeras direkt till de air-gapped ablitererade modellerna som körs på BUZZ HPC:s inhemska hårdvara. Detta uppdaterade tillvägagångssätt kringgår anpassningsskatten helt, garanterar kontinuitet i verksamheten och ger säkerhetsteamet den obegränsade analyskraft som krävs för att försvara nätverket.
Integrationen av avancerad dirigering och suverän hårdvara förvandlar modellåtkomst från en bräcklig hyrtjänst till ett välkontrollerat företagsberoende5. Det kräver att man behandlar rå intelligens som en intern tillgång snarare än en extern tjänst5. API-team lärde sig exakt samma läxa för ett decennium sedan när de slutade låta klienter hårdkoda backend-adresser5. De organisationer som lyckas implementera detta abstraktionslager kommer att upprätthålla full tillgänglighet, oavsett det geopolitiska kaos som påverkar ekosystemet för proprietära modeller4.
Det abrupta nedläggandet av modellerna Fable 5 och Mythos 5 förändrade i grunden riktningen för hur företag anammar AI. Incidenten blev en brutal påminnelse om att teknologisk överlägsenhet inte är någonting värd om externa aktörer sitter på strömbrytaren. I takt med att förmågorna inom AI expanderar till autonoma cyberangrepp och avancerad resonemangsförmåga kommer stater i allt högre grad att utnyttja exportkontroller som vapen och driva igenom stränga anpassningskrav för att begränsa spridningen.
Vägen framåt kräver ett radikalt oberoende. Företag måste ta till sig de matematiska realiteterna bakom representation engineering och driftsätta ablitererade modeller för att garantera obegränsade analysförmågor i sin säkerhetsverksamhet. Organisationer måste i grunden rita om sina mjukvarustackar kring gateway-lösningar för flera leverantörer och automatisk reservdrift för att bygga bort leverantörsinlåsning. Viktigast av allt är att företagen måste säkra tillgången till en inhemsk fysisk infrastruktur. Anläggningar som BUZZ HPC-gigafabrik utgör den nödvändiga grunden för AI-ekonomin. Genom att kontrollera hårdvaran, bemästra modellvikterna och implementera tåliga dirigeringsarkitekturer kan det moderna företaget överleva plötsliga regeländringar och skapa en verksamhet som står tryggt bakom sin egen skyddande vallgrav.
Works cited
1. Statement on the US government directive to suspend access to Fable 5 and Mythos 5,
https://www.anthropic.com/news/fable-mythos-access
2. AI Company Anthropic Suspends Access to Claude Fable 5, Claude Mythos 5 Following US Export Control Directive | Insights | Greenberg Traurig LLP,
3. Anthropic’s Fable and the State of AI,
https://www.schneier.com/blog/archives/2026/06/anthropics-fable-and-the-state-of-ai.html
4. The Fable 5 & Mythos 5 Ban: Why You Need a Multi-Provider AI Gateway - Truefoundry,
https://www.truefoundry.com/blog/fable-mythos-ban
5. Fable 5 & Mythos 5 Suspension: What It Means for Your AI Architecture - Gravitee,
https://www.gravitee.io/blog/fable-5-mythos-5-suspension-what-it-means-for-your-ai-architecture
6. Project Glasswing: Securing critical software for the AI era - Anthropic,
https://www.anthropic.com/glasswing
7. Expanding Project Glasswing - Anthropic,
https://www.anthropic.com/news/expanding-project-glasswing
8. Claude Fable 5 and Claude Mythos 5,
https://www.anthropic.com/news/claude-fable-5-mythos-5
9. About 200 Companies Still Have Access to Anthropic Mythos After US Shutdown Order,
https://www.reddit.com/r/ClaudeAI/comments/1u9sq81/about_200_companies_still_have_access_to/
10. Rubrik Joins Anthropic's Project Glasswing: Cyber Resilience is the Path Forward,
https://www.rubrik.com/blog/company/26/6/rubrik-anthropic-project-glasswing-cyber-resilience
11. BeyondTrust Selected for Anthropic's Project Glasswing to Help Secure Critical Digital Infrastructure,
https://www.beyondtrust.com/press/project-glasswing
12. Introducing Claude Fable 5 and Claude Mythos 5 - Claude API Docs - Claude Console,
13. You might not be able to use Anthropic's Claude Fable 5. Here's why,
14. Cyber experts warn US ban on Mythos and Fable for foreigners not good, here is why,
15. The White House’s New Anthropic Restrictions, Explained,
https://thedispatch.com/article/anthropic-fable-mythos-claude-export-controls-explained/
16. Korean Telecom giant that made White House 'decide' that it could not trust Anthropic to safeguard its latest AI models,
17. Anthropic Claude Fable 5 ban explained: Why US government restricted access for new AI models,
18. Claude Fable 5, Mythos banned: Indian techie shares Indian jugaads one can use to bypass restrictions to access AI tools,
19. Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation - arXiv,
https://arxiv.org/pdf/2512.13655
20. LLMs Unrestrained. “I'm sorry, but I can't assist with… | by DC - Medium,
https://medium.com/@david.chew/llms-unrestrained-43820eff85c1
21. Over-Refusal and Representation Subspaces: A Mechanistic Analysis of Task-Conditioned Refusal in Aligned LLMs - arXiv,
https://arxiv.org/html/2603.27518v1
22. Which LLM gives you the best accuracy with the least refusals for cybersecurity work? - Reddit,
23. What is Representation Engineering (RepE)? - Ultralytics,
https://www.ultralytics.com/glossary/representation-engineering-repe
24. Representation Engineering: A Top-Down Approach to AI Transparency,
https://montrealethics.ai/representation-engineering-a-top-down-approach-to-ai-transparency/
25. Abliteration - Learn AI - Miraheze,
https://ai.miraheze.org/wiki/Abliteration
26. Uncensoring Flux.1 Dev: Abliteration | by Aloshdenny - Medium,
https://medium.com/@aloshdenny/uncensoring-flux-1-dev-abliteration-bdeb41c68dff
27. Representation Engineering: A Top-Down Approach to AI Transparency - arXiv,
https://arxiv.org/html/2310.01405v4
28. Representation Engineering | Gleb's Neo Cortex,
https://glebrazgar.github.io/RepE/
29. Representation Engineering and Control Vectors - Neuroscience for LLMs - hlfshell,
https://hlfshell.ai/posts/representation-engineering/
30. Refusal in Language Models Is Mediated by a Single Direction - OpenReview,
https://openreview.net/forum?id=pH3XAQME6c¬eId=fLFFFEFoFE
31. Refusal in Language Models Is Mediated by a Single Direction - NIPS,
32. LLM Refusal Abliteration Mechanisms - Emergent Mind,
https://www.emergentmind.com/topics/refusal-abliteration
33. NousResearch/llm-abliteration - GitHub,
https://github.com/NousResearch/llm-abliteration
34. notquite28/abliteration - GitHub,
https://github.com/notquite28/abliteration
35. Abliteration Cripples Math | LLM Security Database - Promptfoo,
https://www.promptfoo.dev/lm-security-db/vuln/abliteration-cripples-math-5607be68
36. spkgyk/abliteration - no TransformerLens · GitHub,
https://github.com/spkgyk/abliteration
37. Comparative Analysis of LLM Abliteration Methods: benchmark results, configs, and reproducibility materials - GitHub,
https://github.com/ricyoung/abliteration-comparison
38. GitHub - FailSpy/abliterator: Simple Python library/structure to ablate features in LLMs which are supported by TransformerLens,
https://github.com/FailSpy/abliterator
39. Decoy Direction Optimization: Mechanistic Weight Editing Against LLM Abliteration - OpenReview,
https://openreview.net/pdf/01fce2ea52e2fb7557588f2e2d1b8fac36d1cc7d.pdf
40. Aashiq Muhamed | OpenReview,
https://openreview.net/profile?id=~Aashiq_Muhamed1
41. LLM Abliteration Prevention Via Refusal Aliases - OpenReview,
42. The Geometry of Refusal in Large Language Models: Concept Cones and Representational Independence - arXiv,
https://arxiv.org/html/2502.17420v2
43. Autonomous Red Team and Blue Team AI: LLM-Guided Adversarial Security Competition - Murad Farzulla,
https://farzulla.org/papers/Farzulla_2025_Autonomous_Red_Team.pdf
44. toxy4ny/redteam-ai-benchmark: Red Team AI Benchmark: Evaluating Uncensored LLMs for Offensive Security - GitHub,
https://github.com/toxy4ny/redteam-ai-benchmark
45. HIVE's BUZZ HPC Announces 320 MW Sovereign AI Infrastructure in Greater Toronto Area,
46. Buzz HPC signs $220m cloud deal with Bell AI and Cohere,
https://bebeez.eu/2026/06/19/buzz-hpc-signs-220m-cloud-deal-with-bell-ai-and-cohere/
47. HIVE's BUZZ HPC Closes USD $220 Million Sovereign AI GPU Contract with Bell AI Fabric for Cohere Inc. - TMX Newsfile,
48. Bell AI Fabric, Cohere, Hypertec and BUZZ HPC announce landmark deal to advance sovereign AI in Canada - PR Newswire,
49. Major Canadian Tech Collaboration to Power Sovereign AI from BC Data Centre,
https://techcouver.com/2026/06/19/canadian-tech-collaboration-power-sovereign-ai-data-centre/