Гардрейл для текста

Находит негативные классы безопасности — агрессию, угрозы, запрещённые запросы, спам и другие — и подсвечивает спаны, которые модель бы заредактировала. Joint sequence + token-level голова, обученная на курированном safety-корпусе.

Запрос

Отправьте текст, чтобы увидеть найденные классы безопасности.