GLM 5.3 Flash Max, Codex 조합이 Three.js 작업에서 96.89% 성공률 기록
I tested 10 model/harness combinations on the same Three.js task
한 개발자가 동일한 Three.js Sci-Fi 격납고 생성 프롬프트로 10가지 모델·하네스 조합을 테스트했다. GLM 5.3 Flash Max를 OpenCode 하네스와 함께 쓴 경우가 96.89%의 성공률로 가장 좋았고, Luna 5.6 Max와 Codex 조합은 92.76%로 그 뒤를 이었다. 반면 Astra 6.0 Max와 Codex 조합은 37분 이상 걸리며 가장 느렸다. 테스트는 각 조합의 성공률, 실행 시간, 토큰 사용량 등을 비교했으며, 결과는 GitHub Pages에서 직접 확인할 수 있다.
GLM 5.3 Flash Max와 OpenCode 조합이 96.89%의 성공률로 가장 좋은 결과를 보였고, Luna 5.6 Max와 Codex 조합이 92.76%로 그 뒤를 이었다.
HN 토론
51- onion2k
Astra 버전은 2024년 10월의 three.js r170을 사용한 것 같습니다. Sol은 더 이른 버전을 사용했습니다. GLM의 코드는 최신 버전을 사용했지만, jsdelivr에서 three.js@latest를 가져오는 것뿐이라 그 버전에 맞춰 코드를 작성했을 가능성은 낮아 보입니다. OpenCode의 Qwen도 jsdelivr에서 가져오지만 r160으로 고정된 버전을 사용합니다.
이 예제들 중 어느 것도 톤 매핑 같은 것을 사용하지 않아서 sRGB에 머물러 있고(AgX나 ACES가 훨씬 좋아 보이는데), 노드 머티리얼(프로그래매틱 텍스처 구현에 좋음)을 사용하지 않으며, 섀도우 환경 베이킹이나 포스트 프로세싱 효과 같은 멋진 작업도 하지 않습니다.
보기에는 좋지만, 이런 종류의 프로젝트에서 AI 모델이 얼마나 뒤처져 있는지 보여주는 것이지, 얼마나 잘하는지를 보여주는 것은 아니라고 생각합니다.
- utopiah
각 항목에 대해 특정 날짜와 함께 예상 비용을 나타내는 또 다른 열이 있었으면 좋겠습니다.
이상적으로는 테스트를 실행하기 전에 공개적으로 이용 가능한 것이 무엇인지(어떤 방법이 적절할지 확실하지 않지만) 어떻게든 찾아내는 것도 좋겠습니다. 특정 주제에 대해 js13k 같은 대회나 책의 라이브 코드 예제, 심지어 템플릿이 있다면 결과는 상당히 달라질 수 있습니다. 시각적으로 여기 결과들은 매우 비슷해 보여서, 이것이 짧지만 비교적 설명적인 프롬프트의 결과인지, 아니면 어떤 템플릿이 항상 발견되어 의존되었기 때문인지 궁금할 수밖에 없습니다.
- alvins82
참고로, 데스크톱용 codex/claude 같은 앱을 찾는 과정에서 - https://github.com/openchamber/openchamber - 이것이 선두주자인 것 같습니다. 저는 이것을 https://github.com/alvins82/omp-openchamber-server/를 통해 OMP와 함께 사용합니다.
오픈 모델을 위한 강력한 GUI+하네스 설정을 원했기 때문에, 새로운 모델이 나올 때마다 사용하고 테스트할 수 있었습니다.
- poilcn
좋네요. 하지만 이러한 테스트는 어떤 결과가 재현 가능한지, 최종 비주얼, 시간, 도구 호출인지 아니면 대부분 노이즈인지에 대한 의문을 제기합니다. 예를 들어, 같은 조합이나 모델과 하네스를 여러 번 시도해 보셨나요?
- rao-v
작은 선택들이 결과를 더 좋게 또는 나쁘게 만드는 방식이 정말 흥미롭습니다. Astra와 GLM 중 하나는 밝은 조명을 추가해서 제 눈에는 훨씬 좋아 보였습니다.
Qwen 3.8 결과 중 일부는 진심으로 만족스럽습니다(특히 Q8로 그 모델을 실행할 수 있기 때문에).
이 작업에서 하네스로서 Opencode보다 Pi(OMP)가 얼마나 더 나은지 보는 것도 흥미롭습니다.
판단하기 쉽고 덜 주관적인 결과를 가진 예제가 몇 개 더 있었으면 좋겠습니다.
저는 재미있는 전투 시뮬레이터를 만들기 위한 토이 프로젝트를 진행 중입니다. LLM(대전 모드에서는 두 개)이 여러 봇(각각 자신의 시야와 제한된 전투 컨텍스트를 가짐)을 제어하는 프로그램을 작성해야 하고, 봇들은 서로 협력하고 나란히 싸워야 합니다. 목표는 LLM이 현재 상황에 따라 코드를 5분 시뮬레이션 전투에서 5-10회 업데이트하도록 하는 것입니다. 봇이 새로운 프로그래밍을 요청할 수 있게 하고 재프로그래밍 단계 수에 따라 점수를 매기는 것도 탐구 중입니다.