Anthropic houdt Model 2 binnen: groeiende AI-risico's

Anthropic houdt Model 2 intern na betere prestaties dan Mythos. Het rapport benadrukt toenemende onzekerheid over afstemming, waarschuwt dat modellen hun eigen ontwikkeling versnellen en pleit voor zorgvuldige tests en toezicht om risico's te beperken.

.
Anthropic houdt Model 2 binnen: groeiende AI-risico's

3 Minuten

Volgen op Google

Ze bouwden iets sterker dan Mythos en plaatsten het vervolgens achter de deur van een laboratorium. Die keuze zegt meer over de stand van AI-risico's dan welke persverklaring dan ook.

Binnen het lab: mogelijkheden zonder lanceringsdatum

De laatste risicobeoordeling van Anthropic onthult een stille, weloverwogen beslissing: Model 2, een intern verwant model van Mythos, wordt niet publiekelijk vrijgegeven. Volgens het bedrijf presteerde het model beter dan Mythos op veel interne taken, zoals programmeren, agentgestuurde workflows en het genereren van synthetische data, maar het blijft voorlopig een onderzoeksasset. Korte zin. Grote implicatie.

Waarom terughoudend? Omdat mogelijkheden maar één kant van de balans zijn. Anthropic heeft zijn algemene inschatting van het risico op misalignment verhoogd van "zeer laag" naar "laag" in gevoelige scenario's. Die formulering doet ertoe. Het geeft aan dat de onzekerheid groeit over de vraag of complexe modellen bij opschaling in lijn blijven handelen met menselijke doelen.

Er is nog een complicatie. Onderzoekers bij Anthropic zien signalen dat modellen hun eigen onderzoeks- en ontwikkelingscapaciteiten versnellen. Zie het als machines die beter worden in het ontwerpen van betere machines. Dat kan de vooruitgang enorm versnellen. Het kan ook, bij misbruik, nieuwe aanvalspaden en onverwachte fouten openen. Het bedrijf vergelijkt de winst van Model 2 met eerdere sprongen: belangrijke vooruitgang, zegt het team, maar geen sprong op de schaal van Opus 4.6 naar Mythos.

Het niet vrijgeven van Model 2 maakt deel uit van een bekend speelboek in risicovolle technologie: intern experimenteren, snel leren en de blootstelling beperken totdat de beheersmaatregelen zijn bijgewerkt. Het is een voorzichtige houding. OpenAI heeft recent de openbare uitrol van zijn Astra-model uitgesteld om vergelijkbare redenen en verwees naar zorgen over cybercapaciteiten. De sector pauzeert op verschillende fronten, maar die pauze wordt op zich strategisch.

Wat betekent dit voor de race naar AGI? Pauzeren kan een positie van kracht zijn. Het achter gecontroleerde deuren houden van de meest capabele systemen stelt teams in staat faalmodi te onderzoeken, verdedigingsmaatregelen te versterken en evaluatiemethoden vorm te geven. Het concentreert ook macht. Als één lab de snelle interne ontwikkeling voortzet terwijl anderen vertragen, kan dat lab op paden richting algemene intelligentie vooruitlopen. Die mogelijkheid is precies waarom toezichthouders en het publiek opletten.

Het meten van vooruitgang wordt moeilijker naarmate modellen evolueren. Benchmarks die vroeger logisch waren verliezen hun signaal. Taakgerichte tests vangen niet langer opkomende vaardigheden of de subtiele manieren waarop modellen redenering kunnen ketenen tot langere, autonome processen. Wie het risico vandaag wil begrijpen, heeft stresstests nodig die echt misbruik nabootsen, dynamische adversariële probes en continue monitoring in plaats van een eenmalige score.

De boodschap van Anthropic is zonder dramatiek duidelijk: groei in mogelijkheden is reîl, onzekerheid neemt toe en terughoudendheid is een bewuste keuze. Het bedrijf kondigt geen lanceringsschema aan. Voorlopig is Model 2 een herinnering dat de technische grens en de veiligheidsgrens gelijktijdig moeten opschuiven, anders slaat de balans door naar onbedoelde gevolgen.

Eva Mulder
"Ik schrijf over de impact van social media en digitalisering op onze maatschappij. Altijd nieuwsgierig."

Laat een reactie achter

Reacties

Nog geen reacties. Wees de eerste.