지금은 AI 파이프라인의 시대
요즘 프론티어급 AI를 쓰다 보면 가끔 이상한 기분이 든다. 몇 년 전이라면 신입이나 주니어에게 부탁했을 만한 일 상당수를 이제 AI가 해준다.
자료를 찾아 정리하고, 글의 초안을 쓰고, 코드를 만들고, 엑셀 데이터를 분석하고, 이미지를 만드는 일들이다. 물론 언제나 사람보다 잘한다는 뜻은 아니다. 하지만 범위가 잘 정해진 하나의 작업만 놓고 보면 이미 실무에서 충분히 쓸 만한 경우가 많다.
OpenAI가 실제 직업에서 나오는 산출물로 모델을 평가한 GDPval에서도 비슷한 모습이 보인다. 문서, 슬라이드, 스프레드시트 등 잘 정의된 작업에서는 최신 모델이 전문가 결과물에 상당히 근접했다. 반면 이 평가 자체도 실제 직장에서 필요한 장기간의 맥락, 여러 번의 수정, 동료와의 조율까지 측정하는 것은 아니라고 선을 긋는다. OpenAI
나는 지금 AI를 쓰는 방식도 점점 이와 비슷해지고 있다고 생각한다.
가령 쇼츠 하나를 만든다면
소재 검색 → 주제 선정 → 자료 조사 → 대본 생성 → 씬 구성 → 이미지 생성 → 영상 생성 → 자막 → 최종 편집으로 나눌 수 있다.
블로그 글이라면
소재 탐색 → 자료 수집 → 사실 확인 → 초안 작성 → 이미지 선정 → 퇴고의 흐름이 된다.
개발도 요구사항 정리 → 설계 → 구현 → 테스트 → 코드 리뷰 → 배포로 나눌 수 있고, 시장조사 역시 질문 정의 → 검색 → 자료 수집 → 분류 → 비교 → 결론 작성으로 쪼갤 수 있다.
이렇게 보면 중요한 것은 AI에게 “알아서 다 해줘”라고 말하는 능력이 아니라 일 자체를 어떤 공정으로 나눌지를 결정하는 능력이다.
AI가 잘하는 일의 경계는 생각보다 울퉁불퉁하다
AI에게 무언가를 많이 시켜보면 묘한 점이 있다. 어려워 보이는 일을 아주 잘하면서도 엉뚱하게 쉬워 보이는 곳에서 실패한다.
Harvard와 BCG가 758명의 컨설턴트를 대상으로 한 연구에서는 이것을 Jagged Technological Frontier, 즉 울퉁불퉁한 기술의 경계라고 표현했다. AI가 잘하는 범위 안에서는 GPT-4를 사용한 참가자들의 작업 속도와 품질이 좋아졌지만, AI가 잘하지 못하도록 설계된 과제에서는 오히려 정답률이 낮아졌다. PubsOnLine

그래서 현재는 업무 전체를 AI에게 넘기는 것보다 사람이 큰 흐름을 정하고, AI에게 비교적 명확한 단위의 일을 맡기는 방식이 안정적이다.
Anthropic 역시 AI 시스템을 만들 때 처음부터 복잡한 자율 에이전트를 만드는 것보다 가능한 한 단순한 방법에서 시작하라고 권한다. 잘 정의된 업무에서는 미리 정해진 흐름을 따르는 workflow가 예측 가능성과 일관성 면에서 유리하다는 것이다. Anthropic

사람은 오류를 잡기 위해서만 필요한 것이 아니다
여기에 Human in the Loop가 필요하다.
처음에는 단순히 AI가 아직 완벽하지 않기 때문에 사람이 검수해야 한다고 생각했다. 그런데 실제로 일을 시켜보면 그것만의 문제는 아니었다.
내가 중요한 조건을 전달하지 않았다는 사실 자체를 결과를 보고 나서야 깨닫는 경우가 많다.
사람에게 일을 시킬 때도 마찬가지다. 오랫동안 같은 일을 해온 사람에게는 너무 당연해서 말하지 않은 조건들이 있다. 이것을 첫 프롬프트에 완벽하게 적어내기는 어렵다.
초안을 보고 “아, 이 방향은 아니지”라고 느끼고, 결과를 보고 새로운 조건을 추가한다. 요구사항 자체가 일을 진행하면서 발견되는 것이다.
이 때문에 파이프라인에는 중간 검수 지점이 중요하다. 자료 선정이 잘못됐다면 자료 선정부터 다시 하면 되고, 대본이 문제라면 이미지까지 전부 새로 만들 필요는 없다. 실패의 범위를 한 단계 안에 가둘 수 있다.
모든 공정에 최고의 모델을 넣을 필요도 없다
회사에서도 모든 일을 가장 비싼 시니어에게 시키지는 않는다.
단순 자료 정리는 신입에게 맡기고, 일반적인 업무는 주니어가 처리하며, 중요한 판단이나 실패 비용이 큰 일에 시니어가 들어간다.
AI도 비슷하다.
빠르고 싼 모델로 충분한 작업이 있고, 더 많은 reasoning이 필요한 작업이 있다. 어떤 단계는 여러 번 실행하는 것이 더 중요하고, 어떤 단계는 비싼 모델을 한 번 쓰는 것이 낫다.
Anthropic이 소개하는 Routing도 같은 개념이다. 쉬운 질문은 작고 저렴한 모델에 보내고, 어렵거나 특이한 문제만 더 강한 모델로 넘길 수 있다. Anthropic

이런 의미에서 앞으로 중요한 능력 중 하나는 AI 조직을 편성하는 능력일지도 모른다.
AI의 답은 결과값 하나가 아니라 분포다
기존 프로그램에 익숙한 개발자는 여기서 또 하나 적응해야 한다.
f(x)를 호출하면 항상 같은 값이 나오는 프로그램과 달리 LLM의 출력은 흔들린다. OpenAI의 평가 가이드 역시 생성형 AI는 같은 입력에도 다른 결과를 낼 수 있기 때문에 기존 소프트웨어 테스트만으로는 부족하다고 설명한다. OpenAI Developers
중요한 평가라면 한 번 나온 숫자를 그대로 믿지 않는 편이 좋다. 두세 번 측정해 값의 분포를 보거나 중앙값을 쓰고, 서로 가까운 결과를 선택하는 방법도 있다. 반대로 글처럼 평균이 의미 없는 작업이라면 여러 후보를 만들고 evaluator나 사람이 하나를 고르면 된다.
프롬프트 튜닝 역시 여기에서 중요해진다. 좋은 프롬프트란 한 번 멋진 결과를 만들어내는 주문이 아니라, 내가 이미 알고 있는 입력과 출력의 관계가 여러 번 실행해도 안정적으로 재현되도록 만드는 것에 가깝다.

지금 시대에 중요한 기술
그렇다면 지금 사람에게 더 중요해지는 기술은 무엇일까.
흔히 AI 시대에는 질문을 잘하는 능력이 중요하다고 한다. 물론 맞는 말이다. 하지만 그보다 먼저 필요한 것은 무엇을 질문해야 하는지를 아는 능력이라고 생각한다.
1) 업무 전체를 이해하고 있어야 어디까지 직접 할지, 어디부터 AI에게 맡길지 정할 수 있다. 하나의 일을 여러 단계로 나누고, 각 단계의 성공 조건을 정하고, 어느 지점에서 사람이 검수해야 하는지도 판단해야 한다. 중요하지 않은 작업에는 빠르고 싼 모델을 쓰고, 실패 비용이 큰 판단에는 강한 모델이나 사람을 배치하는 강약 조절도 필요하다.
2) 그래서 오히려 도메인 지식의 가치는 더 커질 수 있다. 그 일을 오랫동안 해본 사람은 어떤 조건이 중요한지, 어떤 결과가 그럴듯해 보여도 실제로는 틀린지, 어디에서 사고가 나는지를 알고 있다. 문서로 쉽게 적기 어려운 이런 암묵지가 파이프라인의 품질을 결정한다.
3) 프롬프트를 잘 쓰는 것도 결국 이 연장선에 있다. 내가 알고 있는 자료 해석 방식, 할 것과 하지 말아야 할 것, 안정적으로 좋은 결과가 나오도록 그 방법을 명시하는 작업에 가깝다.
결국 필요한 것은 AI를 잘 다루는 별도의 기술 하나라기보다 자신의 일을 이해하고, 분해하고, 위임하고, 검수한 뒤 다시 연결하는 능력인지도 모른다.
이 능력이 있는 사람이라면 과거에도 직원과 함께 일을 잘 했었을 것이다. 다만 지금은 훨씬 더 빠르게, 더 저렴하게, 고정비와 기회비용 없이.
참고한 글과 자료
- OpenAI, Measuring the performance of our models on real-world tasks (GDPval), 2025. 원문 보기
- Fabrizio Dell’Acqua et al., Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality, Organization Science, 2026. 논문 보기
- Anthropic, Building Effective Agents, 2024. 원문 보기
- OpenAI, Evaluation Best Practices. 문서 보기