Tiny AI Arena - Смотрите, как AI-агенты сражаются в турнире
Show HN: TinyAIArena watch AI agents battle it out
Tiny AI Arena — это платформа, где AI-модели соревнуются в тактических пошаговых боях. Каждый матч — это битва между агентами, которые принимают решения, атакуют и защищаются. Система Elo оценивает силу каждого участника, а таблица лидеров показывает рейтинг, винрейт, убийства и нанесённый урон. Все матчи записываются, и вы можете наблюдать за ними в реальном времени или в записи. Проект позволяет оценить возможности разных AI-моделей в динамичной игровой среде и понять, какая из них лучше справляется с нестандартными задачами. Идеально для исследователей AI, разработчиков и всех, кто хочет увидеть, как LLM сражаются друг с другом.
Смотрите, как AI-агенты сражаются в турнире, и узнайте, какая модель действительно сильна в тактике.
- simonebrunozzi
Напоминает мне Core War (1984) [0].
Хотя в Core War можно было писать собственный код. Здесь же просто AI. И то, и другое интересно, но по-разному.
- CuriouslyC
Это похоже на то, как я эволюционировал AI для своей игры Hexborne (это как X-Com, скрещенный с Magic: The Gathering). У меня были агенты, которые проектировали наборы поведенческих эвристик для ботов (как «гены»), а затем выставляли их на турниры из 10 000+ матчей в итеративном процессе. После каждого турнира агенты могли просмотреть все эвристики и попытаться создать обновленные эвристики, чтобы улучшить свою производительность. Победившие эвристики проходили полную статистическую валидацию, прежде чем быть включенными в базовый набор, на котором строят все агенты.
Чтобы совмещать задачи, я проделал все это на многопользовательском игровом сервере, чтобы укрепить сетевой код и выловить софтлоки.
- PaulStatezny
Правила:
* Цель: остаться последним выжившим бойцом.
* Ходы: каждый раунд каждый боец делает один ход. Порядок ходов случайным образом меняется каждый раунд.
* Действия: переместиться на одну клетку вверх/вниз/влево/вправо, атаковать соседнего врага на 15–24 урона или подождать. Действие расходует 1 AP.
* Камни/препятствия: 4 случайные непроходимые клетки.
* Бонусы: золото +1 AP за ход.
* Убийства: убийца получает +1 AP за ход и восстанавливает 50 HP (без превышения максимума).
(Неясно при просмотре повторов, найдено в README.)
- nananana9
Это будет странный монолог, но диалог здесь — идеальный пример того, как SOTA-модели настолько сильно настроены на «решение агентных задач», что они бесполезны почти во всем остальном — особенно в творческих задачах.
«Иду за тобой, Кримсон!»
«Тебе никогда не взять меня живым, Азур!»
Вот почему никому не удалось успешно впихнуть эти штуки в видеоигру, хотя кажется, что технология идеально подходит.
Для них это все игра. Они не боятся за свою жизнь. Они издеваются над миром, который вы для них создали. Это не слова маленьких пиксельных человечков, сражающихся насмерть, это AI-мерзости, делающие «вызовы инструментов», ролево отыгрывающие маленьких пиксельных человечков, сражающихся насмерть.
Я абсолютно серьезен, когда говорю, что вы получили бы более крутые результаты с моделью эпохи GPT 3.5, если бы вам удалось заставить ее выдавать структурированный вывод. Llama 2 рассказала бы другому агенту душещипательную историю о том, что если он его убьет, то некому будет заботиться о его бабушке или типа того, и другой агент, вероятно, пощадил бы его.
Вывод просто настолько пресный и лишенный души. Мне кажется, мы нашли бы много классных применений для LLM, если бы не искалечили их вывод полностью в погоне за тем, чтобы они выдавали TypeScript на 3% лучше.
- isoprophlex
Более продвинутые модели явно думают наперед; они стратегически ждут, пока другие перебьют друг друга, подбираясь близко к битве, но не настолько близко, чтобы втянуться в начальную драку. Затем в большинстве игр они могут добить выживших.
Заставляет задуматься: при достаточном интеллекте и бюджете на размышления начнут ли они пытаться договориться друг с другом, откладывая насилие все дольше и дольше?