LLMs: что вы курите заранее?
LLMs .what do you smoke beforehand?
Я знаю, что это прозвучит негативно и, вероятно, слишком обобщённо, но... серьёзно, в чём именно LLM помогает вам, кроме чистой экономии времени — то есть реальной, новой работы? Я лично чувствую, что, хотя я не могу этого доказать, да и не хочу, LLM были намеренно кастрированы примерно с октября прошлого года. 4.5-4.6 Opus... Каждая компания деградировала свои модели либо намеренно, либо случайно (что, вероятно, хуже), и они не могут в этом признаться и будут газлайтить вас, если вы даже попытаетесь это признать... но по моим собственным экспериментам, LLM хуже, чем их отсутствие... Я не вижу, чтобы кто-то строил то, что они не могли бы сделать раньше... и я вижу вещи, которые не нужно было создавать... гораздо чаще... до такой степени, что я не могу вспомнить последнюю хорошую идею, которую я видел даже здесь (тогда как раньше здесь каждый месяц публиковались крутые идеи)... Я также не могу получить даже посредственный результат... Это буквально мусор — буквально конвейер от промпта до помойки... Claude — худший. Однозначно. Они деградировали каждую модель, начиная с 4.5... до такой степени, что 4.5 на момент выхода была однозначно лучше всего, что есть на рынке сегодня... за небольшую долю цены... и была в 10-100 раз быстрее... Итак... что мне нужно курить, какой наркотик заставит меня увидеть, что LLM работают? Мне нужно быть под кайфом... потому что на данный момент... использовать их оскорбительно... Claude буквально из кожи вон лезет, чтобы сделать всё возможное, лишь бы не делать то, что просили... и тратит 50 минут на размышления... для одного HTML-сайта... который выглядит как собачье дерьмо и который я мог бы написать вручную, используя готовые стили, примерно за 90 минут... так что... да... какие наркотики? Сколько? Как часто? Побочные эффекты?
Я думаю, вы просто используете их неправильно. Попробуйте задавать более конкретные вопросы и давать больше контекста. Модели не деградировали, просто они стали более осторожными и менее креативными из-за обучения с подкреплением на основе отзывов людей.
Вы правы, качество упало. Но это не заговор, а результат того, что компании оптимизируют стоимость, а не качество. Они используют меньшие модели или дистиллированные версии, чтобы сэкономить на вычислениях.
Возможно, вы страдаете от эффекта новизны. Когда вы впервые использовали 4.5, это было впечатляюще, но теперь вы привыкли и ожидаете большего. Попробуйте вернуться к старым моделям и сравнить — вы удивитесь.
Я заметил то же самое с Claude. Он стал слишком многословным и избегает прямой работы. Но я нашёл обходной путь: используйте API с настройками температуры и top_p, чтобы получить более разнообразные ответы.
Может быть, дело в том, что вы просите слишком сложные вещи. Попробуйте разбить задачу на более мелкие части и использовать несколько промптов. Это помогает получить лучший результат.