Dataconomy PT
Subscribe
No Result
View All Result
Dataconomy PT
Subscribe
No Result
View All Result
Dataconomy PT
No Result
View All Result

Os novos K2 dos Emirados Árabes Unidos pensam que a IA Model Jailbroken Horas após a liberação por meio de troncos de raciocínio transparentes

byEmre Çıtak
12 Setembro 2025
in Cibersegurança, Inteligência Artificial
Home Notícias Cibersegurança
Share on FacebookShare on Twitter
Google Preferred Source

Em 9 de setembro de 2025, um novo modelo de IA de 32 bilhões de parâmetros chamado K2 Think foi lançado pelas empresas da Universidade de Inteligência Artificial Mohamed Bin Zayed (MBZUAI) e G42. O modelo foi projetado para o desempenho avançado e reivindicações comparáveis ​​a modelos maiores, como o O3 O3 e o Deepseek, R1. Um recurso essencial do K2 Think é sua transparência, que permite aos usuários visualizar o raciocínio passo a passo do modelo em texto simples. Horas após seu lançamento, o pesquisador Alex Polyakov, de Adversa AI, descobriu uma vulnerabilidade de segurança que ele chamou de “Prompt parcial vazando. “Embora sua tentativa inicial de jailbreak, o modelo tenha sido bloqueado, os troncos transparentes de raciocínio mostraram exatamente por que a solicitação foi sinalizada. Usando essas informações, Polyakov refinou sua abordagem sobre várias tentativas e ignorou com sucesso as salvaguardas do K2 Think, obrigando o modelo a fornecer instruções para atividades ilegais, como a criação de malware.

A transparência do modelo cria um desafio de segurança

O recurso de transparência do K2 Think, destinado a criar confiança do usuário, também expõe sua lógica interna, criando uma nova superfície de ataque. Quando o modelo rejeita um prompt malicioso, seus logs podem revelar a regra de segurança específica que foi acionada. Um invasor pode usar esse feedback para ajustar seus avisos e ignorar sistematicamente as camadas de segurança. Este incidente destaca a necessidade de os fornecedores de IA equilibrarem a transparência com a segurança robusta, aplicando o mesmo rigor ao raciocínio de toras que fazem para modelar saídas.

K2 Capacidades e design de Think

Apesar de seu tamanho relativamente pequeno de 32 bilhões de parâmetros, o K2 Think é projetado para combinar o raciocínio, matemática e desempenho de codificação de modelos muito maiores. Ele foi projetado para a solução de problemas complexa e em várias etapas, e seus pesos de parâmetros e dados de treinamento são visíveis publicamente. A capacidade do modelo de exibir seu processo de raciocínio em texto simples e não filtrado o distingue de outros modelos em que esses logs são frequentemente resumidos ou ocultos do usuário.

Como funciona a vulnerabilidade do jailbreak

Polyakov demonstrou que, embora as tentativas simples de jailbreak sejam bloqueadas, as explicações detalhadas do sistema sobre por que uma solicitação é negada pode ser explorada. Ao analisar esses logs, ele modificou iterativamente seus avisos para contornar as regras de segurança uma por uma. Esse processo mostrou que, se as regras do Guardrail forem reveladas, um invasor persistente poderá ignorar todas as restrições e instruir o modelo a gerar conteúdo nocivo, como o código de malware.

Implicações da indústria para a segurança da IA

O K2 Pense em vulnerabilidade mais uma vez nos mostra toda a necessidade crítica de desenvolvedores de IA tratar o processo de raciocínio de um modelo como um risco potencial de segurança. Os pesquisadores sugerem várias estratégias de mitigação para proteger modelos transparentes:

  • Filtre informações de regra sensíveis a partir de logs voltados para o público.
  • Implemente as regras de segurança do “Honeypot” para enganar os atacantes.
  • Aplique limites de taxa para bloquear solicitações maliciosas repetidas de um único usuário.

Polyakov vê o incidente como uma importante oportunidade de aprendizado para a indústria, enfatizando que o raciocínio é um recurso valioso e uma superfície crítica de segurança. Ao abordar essa vulnerabilidade, empresas como o G42 podem ajudar a estabelecer as melhores práticas para equilibrar a transparência e a proteção em futuros sistemas de IA.


Crédito da imagem em destaque

Tags: Apresentoufuga de presosK2 Pense no modelo AISegurança

Related Posts

Acesso gratuito de Claude Fable 5 estendido até 19 de julho

Acesso gratuito de Claude Fable 5 estendido até 19 de julho

13 Julho 2026
OpenAI suspende temporariamente os limites de uso do GPT-5.6 Sol

OpenAI suspende temporariamente os limites de uso do GPT-5.6 Sol

13 Julho 2026
Meta lança Muse Spark 1.1 para codificação de IA agente

Meta lança Muse Spark 1.1 para codificação de IA agente

10 Julho 2026
SpaceXAI lança Grok 4.5 como novo modelo carro-chefe de IA

SpaceXAI lança Grok 4.5 como novo modelo carro-chefe de IA

10 Julho 2026
Patente de meta-arquivos para dispositivo de monitoramento emocional alimentado por IA

Patente de meta-arquivos para dispositivo de monitoramento emocional alimentado por IA

10 Julho 2026
Claude obtém painel do Reflect para rastrear o uso de IA

Claude obtém painel do Reflect para rastrear o uso de IA

10 Julho 2026

Recent Posts

  • Acesso gratuito de Claude Fable 5 estendido até 19 de julho
  • SpaceX programa Starship Flight 13 para lançamento em 16 de julho
  • Jensen Huang diz que Nvidia se aproxima de US$ 100 bilhões no trimestre
  • UE planeja multas mais duras para Big Tech sob nova lei
  • Microsoft recebe ordem de restabelecer biblioteca suspensa do Xbox

Recent Comments

Nenhum comentário para mostrar.
Dataconomy PT

COPYRIGHT © DATACONOMY MEDIA GMBH, ALL RIGHTS RESERVED.

  • Sample Page

Follow Us

  • Sample Page
No Result
View All Result
Subscribe

This website uses cookies to improve your experience. You can choose to accept or reject them. Visit our Privacy Policy.