Тест 10 комбинаций моделей и обвязок на одной задаче Three.js: кто справился лучше всего?

I tested 10 model/harness combinations on the same Three.js task

Автор прогнал одну и ту же задачу — построить sci-fi ангар на Three.js с дронами, анимированными огнями и туманом — через десять комбинаций моделей (GLM, Luna, SOL, Astra, Qwen) и инструментов-обвязок (Codex, OMP, OpenCode, DSH). В таблице сравниваются время генерации, количество токенов, ошибки и другие метрики. Результаты показывают, что выбор обвязки влияет на итог не меньше, чем сама модель: например, GLM 5.3 Flash Max с OpenCode выдал лучший результат по точности (96.89%), а Qwen 3.8 27B с OpenCode оказался самым быстрым по генерации (8м 48с).

Результаты показывают, что выбор обвязки влияет на итог не меньше, чем сама модель.
  1. onion2k

    Похоже, что версия Astra использовала three.js r170, которая вышла в октябре 2024 года. Sol использовал ещё более раннюю версию. Код GLM использовал последнюю версию, но я думаю, что он просто берёт three.js@latest с jsdelivr, так что вряд ли он пишется под эту версию. Qwen на OpenCode также загружает с jsdelivr, но использует закреплённую версию r160.

    Я не думаю, что какой-либо из этих примеров использует такие вещи, как тонмаппинг, поэтому они застряли в sRGB (AgX или ACES выглядят намного лучше), они не используют node materials (хорошо подходят для программной реализации текстур) и не делают ничего крутого, например, запекание теней или использование пост-обработки.

    Они хорошие, но я думаю, что они показывают, насколько модели ИИ отстают в такого рода проектах, а не насколько они хороши.

  2. utopiah

    Хотелось бы, чтобы была ещё одна колонка с расчётной стоимостью для каждого варианта, с указанием конкретной даты.

    В идеале также как-то (не уверен, как это правильно сделать) выяснить, что было публично доступно до запуска теста. Это совсем другой результат, если есть конкурсы, например, js13k, живые примеры кода из книг или даже шаблоны по конкретной теме. Визуально результаты здесь очень похожи, настолько, что я не могу не задаться вопросом, является ли это результатом короткого, но относительно описательного промпта, или потому, что какой-то шаблон всегда находился и использовался.

  3. alvins82

    Кстати, в моих поисках хорошего десктопного приложения вроде Codex или Claude - https://github.com/openchamber/openchamber - это, похоже, лидер. Я использую его вместе с OMP через https://github.com/alvins82/omp-openchamber-server/.

    Мне нужен был мощный GUI+харнесс для открытых моделей, чтобы я мог использовать/тестировать их по мере выхода.

  4. poilcn

    Отлично. Но эти тесты поднимают вопрос: какие результаты воспроизводимы — финальный визуал, время, вызовы инструментов — или это в основном шум? Например, пробовали ли вы одну и ту же комбинацию модели и харнесса несколько раз?

  5. rao-v

    Очень интересно, как маленькие решения сильно влияют на результат. Astra и одна из GLM добавили яркий свет, и поэтому, на мой взгляд, выглядели намного лучше.

    Искренне рад некоторым результатам Qwen 3.8 (особенно учитывая, что я могу запустить эту модель в Q8).

    Интересно видеть, насколько лучше (в этой задаче) Pi (OMP) как харнесс по сравнению с Opencode.

    Хотелось бы увидеть ещё несколько примеров с результатами, которые так же легко оценивать, но менее субъективными.

    У меня есть пет-проект: создаю забавный симулятор битв, где LLM (или две, если играют друг против друга) должна писать программы, управляющие несколькими ботами (у каждого свой обзор и ограниченный боевой контекст), которые должны координироваться и сражаться вместе. Цель — чтобы LLM обновляла код в зависимости от текущей ситуации, возможно, 5-10 раз за 5-минутный симулированный бой. Исследую даже возможность разрешить ботам запрашивать новое программирование и оценивать по количеству шагов перепрограммирования.

Ещё за этот день

2026-09-08