블라인드 테스트에서 학생들이 AI 에세이로 ChatGPT와 Claude보다 Gemini를 선호

Students prefer Gemini over ChatGPT and Claude for AI essays in blind tests

블라인드 테스트에서 학생들이 AI 에세이로 ChatGPT와 Claude보다 Gemini를 선호

StudyArena가 6,851명의 학생 블라인드 투표를 분석한 결과, 에세이 작성 작업에서 Gemini가 39.6%의 선택률로 1위를 차지했습니다. Claude는 31.8%, ChatGPT/OpenAI는 29.2%를 기록했습니다. 모델 이름을 숨긴 상태에서 진행된 테스트에서 Gemini가 승리한 이유는 균형 잡힌 응답 때문으로 분석됩니다. 또한, 더 긴 답변이 선호되었고, 높은 추론 설정이 반드시 더 나은 글쓰기로 이어지지는 않았습니다. 각 제공업체는 피드백(Gemini), 과제 계획(Claude), 연구(ChatGPT) 등 특화된 분야가 있으며, 최종 편집은 사용자의 몫입니다.

모델 이름이 숨겨진 상태에서 판단이 이루어졌기 때문에, 아무도 Gemini를 이미 결제했거나 Google을 좋아하거나 Claude가 더 잘 쓴다는 소문을 들었기 때문에 선택할 수 없었습니다. 답변은 페이지에서 이겨야 했습니다.
  1. Aurornis

    헤드라인에서 생각했던 것만큼 차이가 크지는 않네요. 제가 예상했던 것보다 거의 동전 던지기 수준에 가깝습니다.

    응답 길이가 큰 요인입니다:

    > 학생들은 더 긴 응답을 선호하는 경향이 있었습니다. 선택된 답변은 평균적으로 대안보다 37% 더 길었습니다. 가장 긴 응답은 결정적인 비교의 47.7%에서 승리했습니다. 가장 짧은 응답도 여전히 25.0%에서 승리했습니다.

    그래서 점수는 부분적으로 가장 긴 응답을 대리하는 것입니다.

    리뷰어들이 실제로 텍스트를 얼마나 읽었는지 궁금해집니다. 게으른 평가자들이 텍스트를 모두 읽지 않고 가장 길어 보이거나 가장 구조화된 텍스트를 골랐던 것은 아닐까요?

  2. demibabs

    작성자, 그렇다고 해서 기사를 쓰기 위해 Gemini를 사용해야 한다는 뜻은 아닙니다.

  3. avaer

    > 대학 에세이에 Gemini를 사용하는 방법

    대학 학위를 위한 가장 일반적인 방법이 점점 이렇게 되어 가고 있다는 점을 고려할 때, 대학은 커리큘럼과 세상에서의 위치를 재고해야 합니다. 아니면 적어도 에세이를 없애야 합니다.

    그렇지 않으면 학생과 교사 AI가 지불하고 승리하는 사회적 추론 비디오 게임을 하는 곳이 될 것입니다.

  4. John7878781

    제 경험상 Gemini는 새로운 개념을 명확하고 직관적으로 설명하는 데 탁월합니다. 다른 모델들보다 훨씬 더 그렇습니다.

  5. gherkinnn

    현재의 Claude 모델들보다는 무엇이든 낫습니다. 그 산문은 정말 읽기 힘들어졌습니다.

이 날의 다른 글

2026-08-26