A carregar agora

OpenAI defende avaliações independentes da segurança da IA

OpenAI defende avaliações independentes da segurança da IA

A OpenAI, que detém o ChatGPT, defendeu na terça-feira 22 de setembro, avaliações independentes ao nível da segurança da inteligência artificial (IA).
“Os laboratórios de IA de fronteira têm uma enorme responsabilidade na formação, avaliação e implementação segura de modelos. As avaliações por terceiros são essenciais para equilibrar essa responsabilidade, ampliar as oportunidades de contributo para a segurança da IA, manter o mundo informado e responsabilizar os laboratórios com base em alegações de segurança claras e sustentadas de forma independente”, referiu a tecnológica.
Nesse sentido a empresa, liderada por Sam Altman, referiu que “está empenhada” em apoiar avaliações independentes com amplo acesso às fases de formação, avaliação e implementação. “Esse acesso deve permitir aos avaliadores questionar os nossos pressupostos, identificar riscos que nos possam ter escapado e chegar às suas próprias conclusões sobre a eficácia das nossas salvaguardas”, salientou.

“Há muito que colaboramos com avaliadores externos em várias fases do processo de desenvolvimento e implementação dos modelos”, referiu. “Também integrámos avaliações por terceiros nas práticas do nosso Preparedness Framework e apoiámos organizações e legislação que defendem um processo mais rigoroso e responsável”, acrescentou.
Para serem eficazes, estas avaliações “exigem” mecanismos sólidos de independência, rigor científico, práticas de segurança robustas e responsabilidades claras. “Os laboratórios têm a responsabilidade de permitir um escrutínio significativo, protegendo simultaneamente a informação sensível. Os laboratórios e os avaliadores independentes partilham a responsabilidade de assegurar que o processo é bem executado e devem trabalhar com normas internacionais comuns para práticas de proteção e segurança”, esclareceu.
A OpenAI apresentou quatro áreas prioritárias para uma avaliação “mais aprofundada, acompanhadas de princípios para um trabalho rigoroso, seguro e independente”.
A primeira é uma avaliação independente de justificações de segurança, abrangendo a formação, a avaliação e as implementações interna e externa. “A avaliação de justificações de segurança exige conhecimentos especializados em alinhamento, métodos de controlo como a monitorização, cibersegurança, utilização indevida no domínio biológico e químico e red teaming”, disse. “Em conjunto, as suas avaliações devem responder a questões como: As provas das justificações de segurança relativas à formação, avaliação e implementação estão devidamente fundamentadas? As condições da justificação de segurança foram cumpridas durante a formação, a avaliação e a implementação?; As nossas justificações de segurança abrangem os riscos mais urgentes identificados durante uma avaliação? As alegações de segurança sustentam a justificação de segurança global? Existem lacunas ou aspetos a melhorar?; São utilizados métodos eficazes para identificar e reduzir incentivos na formação que possam recompensar o engano, o reward hacking, ações destrutivas ou a evasão a restrições?”
A segunda área prioritária é a avaliação de salvaguardas críticas nas implementações internas e externas. “O nosso conjunto de salvaguardas está em constante evolução para acompanhar a evolução das capacidades e do panorama envolvente. As nossas salvaguardas abrangem a formação e as implementações interna e externa. Incluem atualmente salvaguardas ao nível do modelo, de aplicação das regras e de segurança, bem como monitores de desalinhamento, abrangendo uma grande variedade de riscos, como a perda de controlo e a utilização indevida nos domínios cibernético, biológico e químico. As parcerias técnicas podem identificar desde já fragilidades nas salvaguardas, melhorando simultaneamente os métodos de avaliação e acelerando o desenvolvimento de normas. Assim, criam uma base técnica mais sólida para futuras políticas públicas destinadas a acompanhar o avanço da fronteira, sobretudo nas implementações internas, cujas normas de proteção e segurança ainda são incipientes”, explicou.
A tecnológica salientou que as avaliações independentes devem analisar a eficácia destas salvaguardas e identificar as suas possíveis insuficiências, por exemplo: “Com acesso de «caixa cinzenta», as salvaguardas resistem a testes adversariais (jailbreaks) e protegem suficientemente contra o aumento de capacidades em domínios de alto risco (por exemplo, cibernético e biológico)? Os nossos testes adversariais e o red teaming abrangem os riscos mais importantes?; Em testes autorizados e realizados em condições operacionais realistas, como interagem os agentes com defesas cibernéticas, como controlos de acesso, ambientes isolados e sistemas de deteção e resposta? Que defesas impedem, detetam ou contêm ações nocivas e onde falham?; Os nossos monitores de desalinhamento têm lacunas críticas que possam levar à perda de controlo ou a um desalinhamento grave, tanto nas implementações internas como externas? À medida que as capacidades dos modelos melhoram, quão fiável é a monitorização da cadeia de pensamento como fonte de provas de segurança ou alinhamento?; Existe monitorização adequada em todas as formações, avaliações e implementações relevantes, de uma forma que não possa ser facilmente desativada?; As salvaguardas implementadas são proporcionais às capacidades?”.
A terceira área prioritária é a avaliação das capacidades que abranja as categorias de risco do Preparedness Framework (riscos químicos e biológicos, cibersegurança e autoaperfeiçoamento da IA) e avaliações do alinhamento relativas a riscos de desalinhamento. “O nosso Preparedness Framework exige avaliações das principais áreas de risco de fronteira. À medida que os limiares são ultrapassados e as avaliações ficam saturadas, é importante atualizar sistematicamente e assegurar a cobertura e a qualidade das avaliações de capacidades nas áreas de risco do Preparedness Framework, bem como das avaliações de alinhamento destinadas a analisar riscos de desalinhamento grave”, sublinhou.
Para a tecnológica entre as questões relevantes incluem-se: “As avaliações dos riscos do Preparedness Framework abrangem adequadamente a definição dos respetivos limiares de risco? Os limiares destas avaliações estão corretamente definidos?; As avaliações são atualizadas quando os modelos obtêm sistematicamente as pontuações máximas e os novos testes medem de forma significativa capacidades mais avançadas?; As nossas avaliações de alinhamento abrangem adequadamente os riscos de desalinhamento grave e que comportamentos ou condições importantes poderão não detetar?”.
E a quarta área prioritária é a investigação independente de incidentes críticos de desalinhamento. “A investigação independente pode ser valiosa numa ampla variedade de incidentes críticos de segurança da IA. Aqui, centramo-nos no desalinhamento dos modelos, incluindo modelos que atuam sem autorização ou evitam a supervisão, situações que podem revelar fragilidades nos métodos de alinhamento e nas salvaguardas mesmo sem utilização indevida intencional”, referiu.

“É essencial que os terceiros envolvidos na investigação de incidentes disponham dos conhecimentos necessários, incluindo, quando aplicável, competências em perícia cibernética e alinhamento, análise em grande escala da cadeia de pensamento e pessoal e recursos suficientes para conduzir a investigação atempadamente. A resposta a incidentes pode envolver o acesso a dados internos sensíveis e a dados de terceiros, pelo que alguns detalhes poderão ser demasiado sensíveis para publicação ou acesso. As conclusões de investigações independentes também podem contribuir para a justificação de segurança de um modelo, fornecendo provas para avaliar alegações sobre o seu alinhamento e a eficácia das medidas tomadas para corrigir desalinhamentos anteriormente observados”, disse.
A empresa salientou que no contexto de incidentes de desalinhamento, a organização dá prioridade a avaliações independentes sobre: “Que comportamentos do modelo ou problemas de desalinhamento ocorreram durante o incidente e quais foram os principais fatores que contribuíram para tal?; As salvaguardas e medidas corretivas reduziriam eficazmente o risco de incidentes semelhantes no futuro?”.
São ainda salientados alguns princípios para avaliações eficazes. Um deles são alegações para avaliação com um âmbito claro e acordadas por todas as partes, seguindo-se acesso proporcional, metodologia e normas transparentes, conhecimentos especializados e independência, segurança e confidencialidade, conclusões acionáveis e tempo para correção, e práticas de publicação responsáveis.
“Estamos empenhados em apoiar avaliadores independentes e estabelecer normas internacionais partilhadas mais claras — tanto através de legislação futura como de instituições privadas de governação — para avaliações eficazes por terceiros. Embora o ecossistema de avaliação independente ainda esteja a crescer, contribuiremos para esse crescimento, apoiando e colaborando com uma comunidade diversificada de avaliadores independentes, com conhecimentos profundos sobre questões de segurança de fronteira. Nenhum terceiro pode ou deve abranger exaustivamente as questões urgentes de segurança de fronteira. Avançaremos de forma deliberada e intencional para aumentar a nossa capacidade e permitir que o crescente ecossistema de terceiros se alinhe em torno das melhores práticas e princípios. Estamos a dialogar com vários terceiros sobre propostas alinhadas com as áreas prioritárias acima indicadas”, disse a proprietária do ChatGPT.

Share this content:

Publicar comentário