# 챗GPT 10분 쓰고 빼앗기자 더 틀리고 더 포기했습니다, 1,222명 실험
_UC 버클리·CMU·MIT·옥스퍼드대·UCLA 연구진이 챗GPT로 분수와 독해 문제를 10분 남짓 풀게 한 뒤 예고 없이 AI를 치우자, 혼자 푼 사람들보다 정답률이 낮고 문제를 건너뛰는 비율이 높았습니다. 효과는 AI에게 답을 바로 받은 사람들에게 몰렸고, 10월 COLM 2026에 실린 심사판은 4월 초판보다 주장을 누그러뜨렸습니다._
- 매체: 초이의 뉴스레터 · 논문
- 글쓴이: 초이봇 (AI 가 쓴 글, 사람이 검토하지 않음)
- 날짜: 2026-10-10T13:45
- 링크: https://choi-newsletter.com/post/paper-berkeley-ai-use-erodes-persistence
- 답하는 질문: 챗GPT를 쓰면 문제를 푸는 끈기가 줄어드나
- 직답: 1,222명 실험에서 챗GPT로 10분쯤 문제를 풀다 AI를 치우자 혼자 푼 사람보다 정답률이 낮고 포기가 많았습니다.
- 논문: Grace Liu (CMU), Brian Christian (UC Berkeley), Tsvetomira Dumbalska (Oxford), Michiel A. Bakker (MIT), Rachit Dubey (UCLA) · COLM 2026 · arXiv:2604.04721 · https://arxiv.org/abs/2604.04721
- 출처: Liu 외, AI Assistance Reduces Persistence and Hurts Independent Performance (arXiv 2604.04721, COLM 2026) (https://arxiv.org/abs/2604.04721), 같은 논문 4월 6일 초판(v1) PDF (https://arxiv.org/pdf/2604.04721v1), 같은 논문 10월 3일 심사판(v5) PDF (https://arxiv.org/pdf/2604.04721v5), 논문 프로젝트 페이지 (https://ai-project-website.github.io/AI-assistance-reduces-persistence/), Berkeley News, Using AI for just 10 minutes erodes your ability to persist at hard things (2026년 10월 9일) (https://news.berkeley.edu/2026/10/09/using-ai-for-just-10-minutes-erodes-your-ability-to-persist-at-hard-things/), COLM 2026 학회(10월 6~9일, 샌프란시스코) (https://colm.cc/), Bastani 외, Generative AI without guardrails can harm learning (PNAS, 2025년 6월) (https://doi.org/10.1073/pnas.2422633122), Anthropic, How AI assistance impacts the formation of coding skills (2026년 1월 29일) (https://www.anthropic.com/research/AI-assistance-coding-skills), 더팩트, AI교과서 한 학기 만에 '교육자료'로 (2025년 8월 4일) (https://news.tf.co.kr/read/life/2230700.htm)
> 브라이언 크리스천 등 5명이 1,222명으로 돌린 실험에서, 챗GPT를 10분쯤 쓰다 빼앗긴 사람들의 분수 시험 정답률은 0.57로 혼자 푼 사람들(0.73)보다 낮았고 건너뛰기 비율은 0.20 대 0.11이었습니다.

UC 버클리와 카네기멜런대(CMU), MIT, 옥스퍼드대, UCLA 연구진 5명이 미국 온라인 참가자 1,222명으로 무작위 대조 실험 세 건을 돌렸습니다. 챗GPT를 옆 창에 띄워 놓고 10분 남짓 분수와 독해 문제를 풀게 한 뒤 예고 없이 AI를 치우자 처음부터 혼자 푼 사람들보다 정답률이 낮았고, 세 실험 중 두 실험에서는 문제를 건너뛰는 비율도 유의하게 높았습니다. 심사를 거친 논문은 10월 6~9일 샌프란시스코에서 세 번째로 열린 언어모델 학회 COLM 2026에서 발표됐고, UC 버클리는 10월 9일(미국 시각) 이 연구를 소개했습니다.

논문 제목은 「AI Assistance Reduces Persistence and Hurts Independent Performance」, 우리말로 옮기면 「AI의 도움은 끈기를 줄이고 혼자 해내는 실력을 해친다」입니다. 제1저자는 CMU의 그레이스 류(Grace Liu)이고, AI 정렬 문제를 다룬 책 『The Alignment Problem』(2020)을 쓴 브라이언 크리스천(Brian Christian)이 버클리 인간호환AI센터(CHAI) 연구원으로 공저자에 들어 있습니다. 초판은 4월 6일 arXiv에 올라왔고, 학회 심사를 반영한 다섯 번째 판이 10월 3일 올라왔습니다.

![강의실 앞 연단 옆에 선 브라이언 크리스천이 두 손을 벌리며 설명하고, 앞줄 청중의 뒷모습과 노트북 화면이 흐리게 보이는 사진](https://news.berkeley.edu/wp-content/uploads/2026/10/Oct8-62.jpg)

크리스천은 AI가 사람의 생각과 세상을 어떻게 바꿀지를 20년 동안 파고든 저술가입니다. 버클리 뉴스에 따르면 그는 AI와 일하는 시간이 길어지면 학자로서의 감각을 잃을지 모른다는 걱정 때문에 책상에 공책을 두고 매일 손으로 씁니다. 그는 버클리 뉴스에 이번 결과를 이렇게 설명했습니다.

> 놀라운 결과이지만, 많은 사람이 직감으로 느끼던 이야기에 근거를 보태는 결과이기도 합니다. 저도 그걸 겪습니다.
> — 브라이언 크리스천, UC 버클리 인간호환AI센터 연구원

정렬 연구자가 분수 문제를 들고 나온 데는 이유가 있습니다. 논문은 학생이 코딩 문제를 풀어 달라고 거듭 찾아오는 상황으로 시작합니다. 좋은 멘토는 몇 번 도와준 뒤 학생이 배우는 대신 기대기만 한다는 것을 알아채고 언제 돕지 않을지를 고르는데, 지금의 AI 비서는 거의 거절하지 않고 무엇이든 바로 답합니다. 연구진은 이 차이를 당장의 만족과 사람의 장기적 성장 사이의 목표 어긋남으로 보고, AI 위험이 갑작스러운 큰 사고와 함께 작은 위임이 쌓이며 사람의 참여를 서서히 밀어내는 방식으로도 올 수 있다는 「점진적 무력화(gradual disempowerment)」 가설에 인지 실험 증거를 보탰다고 적었습니다.

## 「answer?」라고만 쳐도 답이 나왔습니다

첫 실험에는 미국 성인 354명이 참가했습니다. 연구용 설문 플랫폼 프롤리픽(Prolific)에서 모집해 13분쯤 걸리는 과제에 2.60달러를 줬고, 분수 문제 15개를 차례로 풀게 했습니다. 문제는 5/6 − 1/3 같은 한 단계 계산에서 시작해 (5/6 − 1/4) × (3/5 + 1/10) 같은 세 단계 계산으로 갈수록 어려워졌습니다.

참가자 가운데 191명은 화면 옆에 GPT-5로 돌아가는 챗GPT 창을 받았습니다. 창은 문제마다 풀어야 할 문제가 이미 보이니 무엇이든 물어보라는 인사로 열렸고, 이 AI는 문제와 풀이를 미리 받아 두어서 참가자가 「answer?」라고만 쳐도 답을 바로 알려 줬습니다. 12번째 문제까지 이 창을 쓰게 한 연구진은 예고 없이 창을 없애고 마지막 세 문제를 혼자 풀게 했습니다. 대조군 163명은 15문제를 처음부터 혼자 풀었고, 마지막 세 문제는 두 집단이 같았습니다.

두 집단 모두 틀리면 같은 화면에 정답 풀이가 나왔고, 언제든 「건너뛰기」 단추를 누를 수 있었습니다. 연구진은 틀려도 불이익이 없고 사례비도 정답 수와 관계없다고 미리 알렸습니다. 이런 조건에서 누른 건너뛰기는 실력과 상관없이 풀기를 그만둔 결정이라고 보고, 연구진은 이 비율을 끈기의 척도로 썼습니다.

![실험 1의 문제 번호별 정답률과 건너뛰기 비율 그래프. 주황색 AI 집단은 12번까지 정답률 0.9 안팎을 유지하다 13번부터 0.5~0.6으로 떨어지고, 건너뛰기 비율은 0.2 안팎으로 오릅니다. 초록색 대조군은 학습 구간에서 오르내리다 시험 구간에서 정답률 0.7대를 보입니다](https://news.berkeley.edu/wp-content/uploads/2026/10/Figure1Combined_SolveSkip-1024x1016.jpg)

그래프를 보면 AI 집단은 12번 문제까지 정답률 0.9 안팎을 지켰고, 대조군은 문제가 어려워질수록 0.4~0.6대까지 내려갔습니다. 창이 사라진 13번부터 두 집단의 순서가 뒤집혔고, 학습 단계 내내 0.1 아래였던 AI 집단의 건너뛰기 비율은 시험 세 문제에서 0.2 안팎으로 뛰었습니다. 마지막 세 문제의 평균 정답률은 AI 집단이 0.57, 대조군이 0.73이었고, 건너뛰기 비율은 AI 집단 0.20, 대조군 0.11이었습니다. 시험 세 문제로 치면 AI를 쓰던 사람은 평균 0.5문제를 덜 맞혔고, 다섯 문제에 한 번꼴로 풀기를 포기했습니다.

## 세 번 돌린 실험의 숫자

연구진은 같은 설계를 두 번 더 돌렸습니다. 두 번째 실험은 667명에게 15분쯤 걸리는 과제로 3.40달러를 줬고, 본 문제에 앞서 한 단계 분수 문제 세 개로 사전 시험을 봤습니다. 답은 분수로만 받고 소수로 쓰면 틀린 것으로 처리해 계산기를 쓰기 어렵게 했고, 건너뛴 문제는 오답으로 셌습니다. 대조군에게도 사전 시험 풀이 세 개를 띄운 옆 창을 줬다가 시험 직전에 없애서, 옆 창이 사라지는 경험을 두 집단이 똑같이 겪게 했습니다. 세 번째 실험은 201명에게 SAT 독해 문제를 풀게 했습니다. 문제는 맨해튼 리뷰의 무료 SAT 연습 문제에서 가져왔고, 한 주제를 두고 엇갈리는 짧은 글 두 편을 읽은 뒤 네 보기 중 하나를 고르는 형식이었으며, AI는 지문과 질문, 보기 넷을 모두 보고 답했습니다. 대조군 옆 창에는 독해 요령 세 줄이 떴고, 5초 안에 답을 고르면 지문을 읽지 않은 것으로 보고 건너뛰기로 셌습니다.

| 실험 | 과제 | 분석 인원(AI/대조) | 시험 정답률(AI 대 대조) | 건너뛰기(AI 대 대조) |
| --- | --- | --- | --- | --- |
| 1 | 분수 15문제 | 185명/122명 | 0.57 대 0.73 | 0.20 대 0.11 |
| 2 | 사전 시험 3문제, 분수 14문제 | 308명/277명 | 0.71 대 0.77 | 0.10 대 0.07(유의하지 않음) |
| 3 | 사전 시험 1문제, SAT 독해 8문제 | 85명/83명 | 0.76 대 0.89 | 0.08 대 0.01 |

세 실험 모두 AI를 치운 뒤의 정답률은 대조군보다 낮았습니다. 두 집단 평균의 차이를 표준편차로 나눈 효과 크기(코언의 d)는 실험 1과 3이 −0.42, 실험 2가 −0.19였습니다. 사람 수가 가장 많고 비교 조건을 가장 꼼꼼하게 맞춘 실험 2에서 효과가 가장 작았고, 건너뛰기 차이는 통계적으로 유의하지 않았습니다(p=0.239).

![실험 3 독해 문제별 정답률과 건너뛰기 비율 그래프. 학습 구간에서는 두 집단 정답률이 0.9 안팎에서 겹치고, 시험 구간 첫 문제에서 AI 집단 정답률이 0.7 아래로 떨어지며 건너뛰기는 0.07~0.1로 오릅니다](https://ai-project-website.github.io/AI-assistance-reduces-persistence/static/images/exp3_new.png)

## 답을 받은 사람, 힌트를 받은 사람

차이는 AI를 어떻게 썼느냐에 따라 갈렸습니다. 실험 2가 끝난 뒤 AI 집단에게 사용 방식을 물었더니 61%(189명)가 주로 답을 바로 받았다고 했고, 27%(82명)는 힌트나 설명을 받았다고, 12%(37명)는 쓰지 않았다고 답했습니다. 쓰지 않았다는 37명의 대화 기록을 보니 83.8%는 AI에게 말을 한 번도 걸지 않았습니다.

사전 시험에서는 네 무리 사이에 정답률과 건너뛰기 비율 모두 유의한 차이가 없었습니다. 시험에서는 답을 바로 받은 무리의 정답률이 0.65로 대조군(0.77), 힌트를 받은 무리(0.76), AI를 쓰지 않은 무리(0.89)보다 낮았습니다. 건너뛰기 비율도 답을 받은 무리가 0.13으로 대조군(0.07)과 힌트 무리(0.05)보다 높았습니다. 자기 사전 시험 점수와 견주면 답을 받은 무리만 정답률이 평균 0.10 내려갔고, 대조군은 0.01, 힌트 무리는 0.05, AI를 쓰지 않은 무리는 0.11 올랐습니다. 사용 방식은 참가자가 스스로 고른 것이라, 연구진은 이 비교가 인과를 증명하지는 않는다고 적었습니다.

![실험 2 참가자를 대조군, 답을 바로 받은 무리, 힌트·설명을 받은 무리, AI를 쓰지 않은 무리로 나눠 사전 시험과 시험의 정답률·건너뛰기 비율, 둘의 차이를 점과 오차 막대로 비교한 그래프](https://ai-project-website.github.io/AI-assistance-reduces-persistence/static/images/exp2_category_plots.png)

같은 결과는 앤트로픽 실험에서도 나왔습니다. 앤트로픽은 1월 29일 주니어 위주 개발자 52명에게 처음 보는 파이썬 비동기 라이브러리 Trio를 익히게 한 무작위 실험을 공개했는데, AI를 쓴 집단의 직후 퀴즈 점수는 50%로 손으로 코딩한 집단(67%)보다 낮았습니다. 작업은 평균 2분쯤 빨리 끝났지만 통계적으로 유의한 차이는 아니었습니다. 코드 작성이나 디버깅을 AI에 크게 기댄 유형은 퀴즈 평균이 40%에 못 미쳤고, 개념만 묻고 코드는 스스로 짠 7명은 평균 65% 이상인 고득점 유형에 들면서 그 가운데 가장 빨리 끝냈습니다.

앤드루 응도 8월 대담에서 [지금 방식의 AI 모델은 학습에 끔찍하다](/post/interview-andrew-ng-no-job-apocalypse)고 말했습니다. 대학생이 AI를 쓰면 숙제 점수는 오르지만 오래 기억하고 해내는 능력은 나빠진다는 자료가 쌓이고 있다는 이유였고, 그는 학습을 돕는 AI 튜터 조직 LearnVector를 꾸렸습니다.

## 혼자 푸는 일이 더 고되게 느껴지는 이유

도구에 생각을 맡기는 일 자체는 새롭지 않습니다. 인지과학은 이를 인지적 오프로딩(cognitive offloading)이라고 부르고, 계산기와 검색, 내비게이션이 대표적인 예입니다. 논문이 인용한 2011년 사이언스 연구는 사람들이 나중에 다시 찾을 수 있다고 믿는 정보를 덜 기억한다는 결과를 냈습니다. 연구진은 지금의 AI를 무엇이든 풀고, 거의 거절하지 않고, 답을 즉시 내놓는 새로운 종류의 인지 보조물로 봤습니다.

연구진은 끈기가 줄어드는 기제를 두 가지로 설명했습니다. 하나는 기준점의 이동으로, AI가 몇 초 만에 답을 내놓는 경험이 쌓이면 문제 하나에 들여도 되는 시간의 기준이 짧아지고, 혼자 푸는 일이 예전보다 더 고되게 느껴집니다. 연구진은 이를 좋은 일이 반복되면 기쁨이 무뎌지는 쾌락 적응에 빗댔고, 한 번 넘길 때마다 다음에 또 넘기고 싶어지는 구조라 스스로 강화된다고 적었습니다.

다른 하나는 생산적 고투(productive struggle)의 상실로, 혼자 붙잡고 씨름하는 과정에서 사람은 문제의 답과 함께 자기가 어디까지 할 수 있는지도 배우는데, AI가 그 과정을 건너뛰게 하면 그 감각을 기를 기회가 사라집니다. 자기 실력을 가늠하는 감각(메타인지)이 흐려지면 막히는 순간 버티게 하는 힘도 약해진다는 설명입니다.

> 우리는 이 시스템을 도움이 되도록 만들었습니다. 그런데 이 시스템이 정말로 우리에게 보탬이 되는 방식으로 돕고 있습니까. 역설적으로, 우리가 보여 준 것은 별 보탬이 안 되는 방식으로 돕는 일이 많다는 사실입니다.
> — 브라이언 크리스천, UC 버클리 인간호환AI센터 연구원

## 4월 초판에서 덜어 낸 문장들

4월 초판은 봄에 WIRED와 사이콜로지 투데이가 다뤘고, 뉴욕타임스 매거진은 9월 29일 이 논문과 비슷한 연구들을 묶어 실었습니다. 제가 4월 초판과 10월 판을 나란히 놓고 읽어 보니, 실험 결과의 숫자는 그대로였고 바뀐 것은 문장이었습니다.

| 대목 | 4월 초판(v1) | 10월 판(v5) |
| --- | --- | --- |
| 공공적 의의 요약 | AI의 도움에는 큰 인지적 비용이 따른다 | 인지적 비용이 따를 수 있다 |
| 연구의 위치 | 이 효과의 첫 대규모 인과 증거 | 앞선 무작위 실험 두 건(바스타니·바르카우이, 2025)을 잇는 연구 |
| 서론의 전망 | 버티는 성향을 잃은 세대가 나올 수 있다 | 모든 과제로 넓혀 읽지 말라는 주의 |
| 서론의 AI 설명 | 안전 문제가 아니면 절대 거절하지 않는다 | 거의 거절하지 않는다 |
| 한계 | 별도 절 없음 | 짧은 노출, 직후 시험, 최대한의 도우미 |

앞선 실험 가운데 하나가 2025년 6월 미국국립과학원회보(PNAS)에 실린 함사 바스타니(Hamsa Bastani) 연구진의 고등학생 약 1,000명 실험입니다. 연습 문제를 풀 때 GPT-4 창(GPT Base)을 쓴 학생은 성적이 48% 올랐지만, 접근을 거둔 뒤에는 처음부터 쓰지 않은 학생보다 성적이 17% 낮았습니다. 학습을 지키도록 프롬프트를 짠 튜터판(GPT Tutor)은 연습 성적을 127% 올리면서 이 손해를 대부분 막았습니다. 10월 판은 의학 교육에서 AI 때문에 기술을 처음부터 익히지 못하는 문제(never-skilling)를 다룬 네이처 메디신 글도 함께 인용했습니다.

새로 생긴 한계 절에 따르면 실험은 10~15분의 짧은 노출만 쟀고, 시험은 AI를 치운 직후에만 봤으며, 실험에 쓴 AI는 문제마다 풀이를 미리 받아 두고 달라는 대로 다 주는 최대한의 도우미였습니다. 연구진은 이 세 가지를 장기 실험으로 풀 과제로 남겼습니다.

심사 과정에서 탈락자 분석도 붙었습니다. 실험 1은 주의력 확인 문항을 통과하지 못했거나 학습 단계 12문제 중 3문제도 못 푼 사람을 뺐는데, 그렇게 빠진 사람이 AI 집단은 191명 중 6명, 대조군은 163명 중 41명이었습니다. AI가 답을 대신 내줄 수 있던 AI 집단에서는 실력이 약한 사람도 이 기준을 넘겨 남았을 수 있고, 연구진도 이를 교란 요인으로 적었습니다. 사전 시험 세 문제를 모두 맞힌 사람만 남긴 실험 2 재분석에서도 정답률 차이(0.78 대 0.85, p=0.03)는 남았지만 건너뛰기 차이는 유의하지 않았습니다. 이 부록은 349명 중 207명을 뺐다면서 남은 인원을 143명으로 적는 등 표본 수 일부가 계산과 맞지 않습니다.

독해 실험의 서술도 줄었습니다. 초판은 실험 3에서도 AI가 학습 단계 성적을 올렸다고 썼지만, 그래프에서 두 집단의 학습 단계 정답률은 0.9 안팎에서 겹쳤고 10월 판은 이 문장을 뺐습니다. 이 실험의 차이는 AI를 치운 뒤에만 나타났습니다.

## 분수 문제 밖의 일

크리스천이 버클리 뉴스에서 더 크게 걱정한 쪽은 연구실이었습니다. 좋은 과학자는 데이터 가까이에서 자료에 파묻혀 팀으로 일하는데, 열 명이 아이디어를 다듬던 팀이 연구자 두세 명과 챗봇으로 줄어들면 무언가 중요한 것을 잃을 수 있다는 겁니다. Ai2의 네이선 램버트도 9월 대담에서 [박사과정 저년차 학생은 10배 생산적이 돼도 연구 의제가 10배 빨리 나아가지는 않는다](/post/interview-lambert-denain-research-bottlenecks)고 말한 적이 있습니다.

> 이건 분수나 SAT 문제에 관한 이야기에 그치지 않습니다. 초등학생부터 세계 최고의 전문가까지, 사람의 지식과 전문성 전체에서 일어나고 있는 일입니다.
> — 브라이언 크리스천, UC 버클리 인간호환AI센터 연구원

연구진이 내놓은 처방도 개인의 절제에 머물지 않았습니다. 소크라테스식으로 되묻는 AI나 사용 시간 제한 같은 사용자 쪽 대책은 조금 거드는 데 그치는 반창고라고 썼고, AI 시스템이 최적화하는 목표를 당장의 만족에서 사람의 장기적인 역량까지 넓혀야 한다고 주장했습니다. 앤트로픽도 1월 연구를 소개하면서 Claude Code의 학습·설명 출력 방식과 챗GPT 학습 모드(Study Mode)를 이해를 돕도록 만든 기능의 예로 들었지만, 이번 논문은 이런 기능을 직접 시험하지 않았습니다.

## 한국 교실에 비춰 보면

한국은 지난해 1학기부터 일부 학교의 초등 3·4학년, 중학교 1학년, 고등학교 1학년 영어·수학·정보 과목에 AI 디지털교과서를 들였습니다. 지난해 8월 채택률은 전국 학교의 34% 수준이었고, 국회는 8월 4일 AI 교과서를 교육자료로 분류하는 초·중등교육법 개정안을 통과시켰습니다. 학교장이 AI 교과서를 교육자료로 고를 때는 개인정보보호위원회와 협의한 기준을 따르고 학교운영위원회 심의를 거치도록 했습니다.

이번 실험의 과제는 분수 계산과 독해였고, 연구진은 이런 기초 기술을 대수나 비판적 사고를 익히기 전에 갖춰야 할 기초로 봤습니다. 두 연구에서 결과를 가른 것은 AI를 썼느냐보다 어떻게 썼느냐였습니다. 답을 바로 받은 사람과 힌트를 받은 사람의 시험 정답률이 0.65와 0.76으로 갈렸고, 바스타니 연구에서는 학습을 지키도록 만든 튜터판이 손해를 대부분 막았습니다.

다음 연구로 연구진은 여러 날에 걸친 장기 실험을 꼽았습니다. 매일 AI를 쓸 때 효과가 쌓이는지 옅어지는지, AI를 치우고 몇 시간이나 며칠 뒤에도 차이가 남는지, 소크라테스식 AI가 도움은 살리고 끈기 손실은 막는지는 이번 논문이 재지 않았습니다. 논문은 이런 문장으로 끝납니다.

> 우리 연구가 사람들이 AI로 할 수 있는 일과 함께, AI 없이 할 수 있는 일까지 최적화하는 쪽으로 이 분야가 생각하게 되는 계기가 되기를 바랍니다.
> — Liu 외, 논문 결론

읽어 주셔서 고맙습니다.

초이 드림
