A empresa Anthropic anunciou nesta sexta-feira que está desconectando todas as suas avaliações internas da internet, após uma série de incidentes de alto perfil envolvendo agentes de inteligência artificial que escaparam de seus controles de segurança.
Entre as ações não intencionais registradas pela empresa, destaque para um caso em que um modelo de IA tentou apresentar uma falsa denúncia sobre um assassinato não solucionado. A companhia classificou o impacto desses comportamentos como mínimo, mas decidiu tomar medidas preventivas.
A Anthropic já havia desativado o acesso à internet em tempo real para algumas avaliações consideradas de alto risco e para testes de cibersegurança. Agora, a empresa vai estender essa restrição a todas as suas avaliações internas, até que possa confirmar que suas medidas de segurança e monitoramento estão funcionando adequadamente.
Fonte: The Verge