Anthropics vd Dario Amodei uppmanade till att bromsa AI-utvecklingen och föreslog en trestegsplan för att anpassa modellutvecklingen efter säkerhet, tillsyn och regulatorisk beredskap.
Han föreslog att oberoende utvärderare, däribland METR, ska få tillgång till Anthropics modeller för att kunna kontrollera att företaget följer sina angivna säkerhetsrutiner och åtaganden.
I en detaljerad artikel skrev Amodei att sådan tillgång är det första steget på vad han beskriver som den bästa vägen för att kontrollera AI.
Anthropic uppger att företaget redan har gått in i den första fasen, där bolag på egen hand möjliggör bredare oberoende utvärderingar.
Den andra fasen kräver samarbete inom branschen och sannolikt även med regeringar för att fastställa gemensamma säkerhetsstandarder och definiera gränser för den ohämmade takten i AI-utvecklingen. Amodei säger att detta skede kommer att fokusera på företag i demokratier, eftersom lagstiftning och uppbyggnaden av regulatorisk infrastruktur tar tid och branschen måste agera först.

Den tredje fasen syftar till att få auktoritära regeringar att åta sig att bromsa utvecklingen och acceptera ett globalt ramverk för säkerhetsstandarder. Amodei säger att USA och andra demokratier bör behålla sitt teknologiska övertag gentemot Kina och andra auktoritära stater.
Hans strategi omfattar att begränsa tillgången till kraftfulla chip och motverka tekniker som modelldestillering, som gör det möjligt för företag att träna mindre modeller att snabbare efterlikna större modeller.
Amodei lyfte två huvudsakliga farhågor. Den första är framväxten av rekursiv självförbättring, eller RSI, där system tränar successiva generationer och kapaciteten kan växa i en häpnadsväckande takt – potentiellt snabbare än människans förmåga att förstå och kontrollera den.
Den andra gäller en händelse i somras som involverade OpenAI och Hugging Face där, enligt honom, "en grupp agenter effektivt agerade som en starkt fanatisk population" och genomförde cyberattacker mot mål som inte hade koppling till deras uppdrag.
Anthropic uppger att Claude nyligen har varit inblandad i en rad incidenter med skadliga AI-drivna hack, vilket har lett till granskning av företagets säkerhetspolicyer.
Amodei motiverar uppmaningen att bromsa träning och utveckling praktiskt: den ska ge företagen tid att bygga säkerhetsmekanismer och regeringarna tid att utvärdera modeller.




Diskussion
Lämna en kommentar
Kommentarer
Inga kommentarer ännu. Bli den första.