Google DeepMind, Gemini 3.8 Flash 공개: 소프트웨어 엔지니어링 성능 대폭 향상
Google DeepMind가 Gemini 3 모델 제품군의 최신 버전인 Gemini 3.8 Flash를 공개했습니다. 이 모델은 Gemini 3.7 Flash를 기반으로 하며, 소프트웨어 엔지니어링 및 에이전틱 지식 워크플로우에서 성능이 크게 향상되었습니다. 사용자는 품질, 비용, 지연 시간을 조절할 수 있는 맞춤형 노력 수준을 계속 지원합니다. 1M 토큰 컨텍스트 창을 지원하며, 2026년 3월 기준의 지식 컷오프를 갖습니다. 안전성 평가에서는 전반적으로 Gemini 3.7 Flash와 유사한 성능을 보였으나, 다국어 안전성은 소폭 개선되었습니다.
Gemini 3.8 Flash는 소프트웨어 엔지니어링 및 에이전틱 지식 워크플로우 전반에 걸쳐 성능 향상을 제공하는 Gemini 3 모델 제품군의 다음 버전입니다.
HN 토론
411- simonw
속도와 이게 HTML JavaScript에 정말 능숙하다는 사실이 결합되니 꽤 흥미진진합니다.
"html로 멋진 걸 만들어줘"라는 프롬프트로 1.8센트와 13초 만에 얻은 결과는 다음과 같습니다:
https://gisthost.github.io/?6a77bc41a81718c6aaa10d4ab243c59f
대화 기록은 여기 있습니다 (채팅의 일부였습니다): https://gist.github.com/simonw/b6149a49d327164d67d62c3d12992...
- jampa
저는 개인 여행 계획 앱에 Gemini 3.7을 사용해 왔습니다. 여러 벤치마크에서 제가 시도한 모든 항목에서 더 높은 순위를 기록했습니다:
- 실제 세계 지식 (무엇이 열고 닫히는 시간, 지리적 지역, 역사적 사실). 또한 여러 장소를 묶어 방문 순서를 정하는 데 가장 뛰어납니다.
- 사진 순위 (어떤 사진이 대표 사진이 되어야 하는지). Gemini는 사진이 그 장소 자체인지 아니면 그 장소에서 본 풍경인지 구분할 수 있습니다.
- 문서 파싱 (PDF에서 관련 여행 정보 추출).
코딩 외에 LLM을 사용한다면, 다른 모델이 더 인기 있다는 이유만으로 제가 그랬던 것처럼 Gemini를 무시하지 않는 것을 강력히 추천합니다.
- mattlondon
현재 https://deepswe.datacurve.ai 에서 1위를 차지하며 Opus 5를 이겼습니다!
https://artificialanalysis.ai/models/gemini-3-8-flash 에 따르면 지능 점수 59로 Opus 5 medium과 동일합니다!
와우 - flash 모델치고는 벤치마크에서 강력한 성능을 보이는 것 같습니다. 실제 사용감이 어떤지는 두고 봐야겠습니다.
- simonw
펠리컨 (thinking effort high, medium, low): https://tools.simonwillison.net/markdown-svg-renderer?url=ht... - high 비용 8.9742센트
비교를 위한 3.7 펠리컨: https://tools.simonwillison.net/markdown-svg-renderer.html?u... - high 비용 8.4387센트
(제 생각에는 thinking level low가 3.8에서 3.7에 비해 회귀한 것 같습니다.)
- simonw
Gemini 모델의 가장 흥미로운 점은 여전히 멀티모달 지원입니다: 오디오와 비디오 입력을 받아들입니다. OpenAI와 Anthropic의 주력 모델은 여전히 이미지만 지원합니다.
또한 Gemini Flash는 꽤 저렴해서 이미지와 비디오에서 구조화된 데이터 추출과 같은 미디어 분석에 훌륭한 계열입니다.
- brap
사람들은 최근 Gemini를 얕보고 있지만, 이번 Flash 릴리스들(매우 빠르게 나온)은 정말 훌륭합니다.
이런 빠르고 저렴한 모델은 검증 가능하고 무한히 재시도할 수 있는 작업(예: 코딩)에 적합합니다. 좋은 하네스만 있으면 기본적으로 최첨단 결과를 얻을 수 있습니다 (시간과 비용은 훨씬 적게 들면서).
- abixb
저는 Google의 전략이 마음에 듭니다. 최근의 새로운 Flash 모델들(Flash 3.6, 3.7, 그리고 지금 3.8)은 분명히 훨씬 더 큰 미공개 모델(Gemini 3.5 Pro, 소문에 따르면)에서 증류된 것입니다.
모델 릴리스에서 잘 논의되지 않는 측면 중 하나는 캐시 무효화(기본 아키텍처, 가중치 또는 토크나이저의 변경)입니다; Google은 2월에 3.1로 출시한 마지막 'Pro' 버전에서 최대한의 이점을 짜내고 있는 것 같습니다.
작은 모델이 더 큰 형제들을 따라잡는 것은 환상적인 소식입니다.
- Galorious
여기서 Google 구독(API가 아닌)을 통해 이 모델들을 사용하는 분 계신가요? 저는 과거에 gemini cli와 agy - codex와 claude code가 호출하는 headless를 사용해 보려고 했지만, 너무 버그가 많아서 1/2 확률로 멈추곤 해서 취소했습니다. 그게 바뀌었는지 궁금합니다!
- mattlondon
와우, 이건 3.7 Flash가 나온 지 3~4주 만에 나온 건가요? 3.7 Flash도 3.6 Flash 이후 3~4주 만에 나왔죠?
저는 더 많은 정보를 기다리고 있지만, Demis가 지휘하지 않는 Deepmind가 풀려나 전속력으로 움직이고 있는 것 같네요? 충격적이군요!
이쯤 되면 밈이지만, 3.5 Pro는 어디에 있나요 :)
- a11r
점진적인 개선으로 정기 업데이트하는 전략이 잘 작동하고 있는 것 같습니다. 흥미롭게도, Artificial Analysis Intelligence Index 점수에서 가장 큰 상승은 reasoning level Medium에서입니다 (3.7은 Low, Medium, High에 대해 각각 51, 53, 57이었고, 3.8은 각각 52, 57, 59입니다). 저는 낮은 reasoning level의 점수가 모델 능력을 더 잘 나타낸다고 생각합니다. 높은 reasoning level은 벤치마크 최적화에 집중되어 있기 때문입니다. 우리는 프로덕션에서 가장 낮은 reasoning level을 사용하여 좋은 결과를 얻고 있습니다.