Skip to content

inconsistência na lógica de espaço entre palavras #104

Description

@PauloRDev

Enviado pelo formulario do site ToxiBR


Bypass de moderação com palavras espaçadas

Descrição:

Durante testes, identifiquei uma inconsistência na classificação de toxicidade ao utilizar palavras com espaçamento entre os caracteres.

Exemplos observados:

  • "m a c a c o" → reprovado
  • "você é m a c a c o" → aprovado

Outros casos que passaram como aprovados:

  • "você é p u t a"
  • "i m b e c i l"
  • "i n u t i l"
  • "m a m a d o r"
  • "sua g o s t o s a"

Notei também que algumas palavras isoladas com espaçamento podem ser detectadas, mas quando inseridas em frases, acabam sendo aprovadas.

Problema:

Isso indica uma falha na lógica de processamento/tokenização, onde o modelo não consegue manter consistência ao lidar com palavras espaçadas, especialmente em contexto de frase.

Sugestão:

Aplicar uma etapa de normalização no input (ex: remover espaços entre caracteres) ou melhorar a robustez do modelo para lidar com textos ofuscados.


Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions