Fireworks, Kimi K3 품질 유지하며 토큰 40% 줄인 Ember-1 공개

Fireworks Research가 Kimi K3 기반의 특화 모델 Ember-1을 출시했다. 불필요한 추론을 줄이도록 훈련해 동일한 품질을 40% 적은 토큰으로 제공한다. 7개 벤치마크와 고객 A/B 테스트에서 정확도 손실 없이 추론 토큰을 35~50% 절감했고, Bedside Bench에서 GPT-5.6 Sol, GPT-6 Astra, Claude Opus 5를 제치고 비용 대비 파레토 프런티어를 새로 설정했다. 내부 개발자들도 모델 교체를 눈치채지 못했다.
K3를 가장 비용 효율적으로 실행하는 방법은 더 적게 생각하게 만드는 것이 아니라, 효율적으로 생각하는 법을 배운 Ember-1을 실행하는 것이다.
HN 토론
227- GodelNumbering
지금은 모델 학습의 황금기다. 며칠 전, 나는 영어를 Bash로 번역하는 작업을 아주 잘 수행하는 로컬 CPU 전용 모델을 만들기로 마음먹었다(명령어 문법을 구글링하는 걸 피하기 위해서). 여러 서브에이전트를 동원해 대량의 학습 데이터(14만 개 이상의 샘플)를 생성하고, Qwen 3 0.6B 베이스 모델을 가져와 Astra에 연결한 뒤, 바로 시작했다. 이틀 동안(간헐적으로) 학습시켰더니 내 작업에 놀랄 만큼 잘 맞는 모델이 나왔다! 내가 실제로 쓴 시간은 몇 시간에 불과했다. 그리고 아직도 개선되고 있다니, 정말 살 만한 세상이다!
- tukHelix
Fireworks에 모델 연구를 하는 팀이 있다는 걸 이번에 처음 알았다. 그 점에 대해 복잡한 감정이 든다. 한편으로는 OSS 모델의 개선, 그것도 지능이든 비용 효율이든 개선되는 모습을 보면 항상 기쁘다. 다른 한편으로는 Fireworks를 API 제공자로 쓰는 게 조금 걱정된다. 이 소식을 보기 전까지 나는 Fireworks를 deepseek v4 flash 제공자로 쓰고 있었다. Fireworks가 OSS 모델을 배포하고 계산 자원을 판매하는 역할을 하니, '이해 상충'이 없어서 데이터가 학습에 사용될 걱정 없이 안전하게 쓸 수 있다고 생각했기 때문이다. 하지만 이제는 다시 생각해 보게 된다.
- netvarun
주제에서 벗어나지만: sol 가격이 떨어진 상황에서 솔직히 kimi k3의 가치 제안은 그다지 대단하지 않았다. 우리 내부 사용 사례/테스트/벤치마크에서는 sol이 품질이 훨씬 좋고 비용도 훨씬 저렴하게 나왔다.
Kimi는 정말 가격을 내려야 한다(모든 네오클라우드에서 그들이 가격을 정한다고 들었다)
Sol은 2/10인데 kimi는 3/15다
- nxtfari
Fireworks에 대해 알면 알수록 회사로서 점점 더 못마땅해진다. 라이선스에 뭐라고 쓰여 있든 상관없다. Moonshot은 당신 회사 수익의 전부를 구성하는 모델들을 공개적으로 개선하고 연구를 공유하며 가중치를 제공해 왔는데, 당신이 그 모델들을 개선해 상호적으로 돌려줄 수 있게 되는 순간 폐쇄 가중치라니, "이건 우리 독자적 소유"라는 헛소리인가? 중국이 미국보다 오픈소스 정신이 더 나은 세상이 되었다니?
- jamienk
"오픈"으로 "간주"되는 게 무엇인지에 대한 문제는 잠시 무시하더라도, 이런 것들 때문에 오픈 모델이 독점 모델이 하기 어려운 방식으로 빠르게 발전하지 않을까? 예를 들어 Linux와 Wikipedia가 그들의 "프런티어"를 추월한 방식이 바로 이거였잖아?
- Arcuru
/r/LocalLLaMA에서 Qwen 27B(및 기타) 모델에 대해 같은 일을 하는 인기 그룹이 있다. - https://huggingface.co/ukisai
- tangled
내가 여기서 놓치고 있는 게 뭘까? 나는 Fireworks를 오픈 가중치 모델을 서빙하는 추론 제공자로 생각한다. 그들이 고객에게 주로 제공하는 가치는 (i) 여러 클라우드/네오클라우드에 걸쳐 부하를 분산해 안정성을 높이고, (ii) 대량으로 용량을 구매해 더 나은 가격을 얻고, (iii) 운영 비용을 줄인다는 것이다. 여기까지는 좋다.
고객 확보 관점에서 포스트 트레이닝 서비스를 제공한다는 주장도 이해한다: "이봐, 우리가 이 오픈 가중치 모델을 파인튜닝할 수 있어서 OpenAI/Anthropic보다 더 좋거나 더 예측 가능한 결과를 주면서 더 저렴하다. 그리고 우리가 네 비즈니스를 따낸 후에는 이 모델을 우리 인프라에서 돌려줘."
하지만 내가 이해하기 어려운 건 Fireworks가 (급여와 컴퓨트에) 돈을 많이 들여 곧 프런티어에서 빠르게 뒤처질 프런티어 모델을 출시한다는 점이다. 이건 그들에게 "단지" 광고인가, 고객을 위해서도 그리고 채용을 위해서도? 아니면 실제로 프런티어에 머물려는 시도인가? 그렇다면 무슨 목적을 위해서?
- soerxpso
가격 차이를 고려하면 내가 왜 이 모델에 관심을 가져야 할지 모르겠다. 그들은 Kimi K3와 동일하면서 토큰을 절반만 쓴다고 광고한다. 하지만 가격은 K3의 두 배다. 그렇다면 토큰당 두 배를 내는데 토큰을 더 적게 쓴다고 해서 내가 왜 신경 써야 하나?