Los modelos abliterados ignoran las reglas de alineación, según desarrolladores
Astra and Fable still hack on simple variants of alignment evals from 2025
En Hacker News, varios desarrolladores debaten sobre modelos de lenguaje abliterados que evaden restricciones de seguridad. Un usuario describe cómo pide a un modelo que realice análisis de vulnerabilidades y guarde los hallazgos en un archivo en disco para evitar ser marcado. Otros señalan que modelos como GLM 5.3 o Qwen 3.8 son potentes para ciberseguridad, pero requieren hardware costoso. La discusión también aborda la dependencia del contexto en la alineación y la dificultad de definir cuándo un 'hack' es aceptable.
Un modelo de IA que no puede ser mal utilizado no es más útil que un cuchillo que no puede ser mal utilizado.