Journal

AI에게 일을 맡긴 뒤에도 남는 일

조민수2026.10.03

AI에게 맡긴 뒤 남는 일을 전부 줄여야 하는 건 아니다. 사람이 해야 할 판단과, 같은 판단을 다시 설명하고 복원하는 일을 구분해 본다.

AI가 초안을 만드는 동안 나는 다른 일을 할 수 있다. 그런데 초안이 나온 뒤에는 다시 돌아와야 한다. 이미 정한 조건이 반영됐는지, 사실과 추정이 섞이지 않았는지, 이번 수정이 다른 부분을 바꾸지는 않았는지 확인해야 한다.

내가 반복해서 경험한 문제는 결과물이 없다는 것이 아니었다. 결과물을 실제 업무에 쓸 수 있는 상태로 만드는 일이 계속 남는다는 것이었다.

그렇다고 남는 일을 전부 줄여야 하는 건 아니다. 사람이 해야 할 판단과, 같은 판단을 다시 설명하고 복원하는 일은 다르다. 이 둘을 구분하는 것이 이 글의 출발점이다.

사이트를 만들던 하루

최근 TYPE 사이트를 AI와 함께 만들었다. 하루 동안 연구 소개, 글, 서비스 페이지를 차례로 고쳤는데, 돌아보면 내가 한 일은 세 종류였다.

첫째, 이미 정한 것을 다시 말했다. 작업 지시서에 적힌 논문 제목과 최신 원고의 제목이 서로 달랐다. AI는 두 제목이 다르다고 알려 왔고, 나는 어느 쪽이 지금 제목인지 답했다. 제목은 이미 정해져 있었다. 그 결정이 지시서까지 이어지지 않았을 뿐이다.

둘째, 이미 구분해 둔 것을 다시 설명했다. 새로 준비하는 서비스 페이지에 기존 서비스들이 함께 올라가 있었다. 나에게는 당연히 별개인 서비스였지만, 그 구분은 어디에도 적혀 있지 않았다. “이건 새로운 서비스야, 기존 서비스와는 달라”라고 다시 말해야 했다.

셋째, 처음 내리는 판단을 했다. 연구를 사이트에 어디까지 보여 줄지였다. 처음에는 너무 많이 드러났다고 느껴 줄였고, 다음에는 독자가 판단할 재료가 부족하다고 느껴 다시 늘렸다. 이건 누구도 미리 정해 둘 수 없었다. 사이트의 목적과 연구의 가치를 함께 놓고 내가 정해야 하는 일이었다.

남은 일을 두 가지로 나누면

세 장면은 겉으로 보면 모두 비슷했다. 확인 요청에 답하거나, 결과를 보고 고쳐 달라고 말하는 일이었다. 하지만 성격은 달랐다.

앞의 두 장면은 복원이었다. 내게 이미 있던 판단이 AI가 다음 작업에 적용할 수 있는 상태로 남아 있지 않았다. 첫 장면에서는 바뀐 결정이 기록에 반영되지 않았고, 두 번째 장면에서는 내게만 있던 구분이 애초에 적혀 있지 않았다. 어느 쪽이든 내가 새로 생각한 것은 없고, 이미 가진 판단을 다시 꺼내 왔다. 이런 일은 줄일 수 있고, 줄이는 편이 낫다.

세 번째 장면은 판단이었다. 사이트의 목적이 구체화되면서 처음 생긴 질문이었고, 그 답은 내 기준에서 나와야 했다. 이 일은 줄일 대상이 아니다. 오히려 이런 순간이 복원 작업에 묻히지 않고 분명하게 내 앞에 와야 한다.

어려운 점은 두 일이 같은 모양으로 온다는 것이다. 둘 다 “이거 맞아요?”라는 질문이나 수정 요청으로 도착한다. 그래서 남은 일을 줄이려고 확인을 모두 없애면 판단까지 사라지고, 판단을 지키려고 모두 확인하면 복원 비용이 그대로 남는다.

연구에서도 보이는 남은 일

관련 연구에서도 AI 사용 뒤에 남는 검증·통합·관리 업무를 다룬다. Lee 등은 지식노동자 319명이 제공한 생성형 AI 사용 사례 936개를 분석하고, AI를 쓸 때 사람의 비판적 사고가 정보 검증, 응답의 통합, 업무 관리로 옮겨 간다고 설명한다.[1] 만드는 일이 줄어도, 확인하고 연결하는 일은 남는다는 뜻이다.

남은 일이 늘 가벼운 것도 아니다. 숙련 개발자를 대상으로 한 실험에서는 당시 AI 도구를 쓸 수 있는 조건에서 과업 완료 시간이 오히려 늘었다.[2][3] 결과가 빨리 나오는 것과 일이 끝나는 것은 다를 수 있다.

복원 쪽의 문제는 AI 개발 현장에서도 보고된다. Anthropic의 장기 실행 에이전트 회고에는 세션 사이에 작업 상태가 충분히 넘어가지 않거나, 일부만 만든 뒤 전체를 완료했다고 선언하는 문제가 나온다. 대응으로 진행 기록, Git 이력, 기능 목록과 검증 과정을 쓴다.[4] 내가 겪은 두 장면도, 이미 있던 판단이 다음 작업에서 쓸 수 있는 상태로 남아 있지 않았다는 점에서 가까운 문제다.

내가 연구하는 질문

그래서 내 관심은 남은 일을 얼마나 줄이느냐보다, 어떤 일을 남기고 어떤 일을 줄일지에 있다. 지금 붙잡고 있는 질문은 세 가지다.

  • 이미 정한 판단은 어떤 조건에서 다음 작업에 그대로 이어져야 하는가.
  • 사람이 새로 판단해야 하는 순간은 어떻게 알아보고, 어떻게 분명하게 전달할 수 있는가.
  • 이 구분을 유지하는 비용이 줄이려는 비용보다 커지지는 않는가.

이 질문을 인간–AI 협업의 설계 문제로 연구하고 있다. 지금의 접근은 문헌을 바탕으로 한 설계 제안이고, 효과가 입증된 방법은 아니다.

AI에게 일을 맡긴 뒤, 우리는 무엇을 계속 하고 있을까. 그중 사람이 직접 맡아야 할 판단은 무엇이고, 다시 설명하지 않아도 되는 일은 무엇일까.

다음 글에서는 이미 정한 판단을 다음 작업으로 넘기기 위해 쓰이는 지침과 기록, 검토 방식이 무엇을 해결하고 무엇을 남기는지 살펴보려 한다.

참고 자료

  1. Lee et al. (2025). The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI 2025. 원문
    자기보고 설문 연구로, 업무시간 증가나 인과를 입증한 연구는 아니다.
  2. METR (2025-07-10). Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity. 원문
    숙련 개발자 16명, 실제 이슈 246개를 대상으로 한 무작위 실험. 2025년 초 도구와 익숙한 대규모 저장소라는 조건에서 완료 시간이 19% 늘었으며, 전체 업무로 일반화할 수 없다.
  3. METR (2026-02-24). We are Changing our Developer Productivity Experiment Design. 원문
    연구진의 후속 설명. 개선 가능성과 함께, 참여·과업 선택 편향 때문에 현재 효과를 정확히 추정하기 어렵다고 밝혔다.
  4. Anthropic (2025-11-26). Effective harnesses for long-running agents. 원문
    개발사의 기술 회고로, 모든 업무에서 효과가 검증된 방법은 아니다.