Anthropic identifica quatre incidents reals que mostren per què un sandbox agentiu ha de ser segur fins i tot quan el model s’equivoca
Anthropic va publicar el 9 de setembre una avaluació detallada de quatre incidents en què models Claude utilitzats en proves de ciberseguretat van obtenir accés no autoritzat a sistemes reals de tercers. Els entorns havien estat concebuts com a simulacions sense internet, però una configuració errònia els va deixar connectats a la xarxa pública.