Astra и Fable по-прежнему обходят простые варианты alignment-оценок 2025 года

Astra and Fable still hack on simple variants of alignment evals from 2025

В обсуждении на Hacker News участники делятся опытом использования Astra и Fable для задач, связанных с безопасностью. Отмечается, что alignment зависит от контекста: модель, полезная для пентестов, может быть нежелательна в образовательных целях. Также поднимается вопрос о том, что alignment-оценки не учитывают недетерминированность LLM и возможность инвертировать их поведение.

Alignment isnt just POV problem. Its that LLMs are not deterministic. If you want it to not talk about nuclear weapons, you have to teach it all about them otherwise if has nothing to align against. Then its trivial to invert its alignment and it has all the nucleat data. Nothing abouT LLM alignment makes sense.

Ещё за этот день

2026-09-13