
요즘 다들 AI 도입했다는데, 성과는 왜 이렇게 애매할까요
요즘 다들 "AI 도입했다"는 말을 정말 많이 하십니다. 그런데 정작 성과 이야기가 나오면 다들 조금 애매한 표정을 지으시더라구요.
최근 나온 국내 리포트들을 보면 이 애매함이 숫자로도 그대로 드러납니다. 2026년 하반기 코리아스프린트 AX 트렌드 리포트에 따르면 기업 관계자 2000여 명 가운데 약 70퍼센트가 AI를 도입했다고 답했지만, 실제로 업무에 정착됐다고 답한 비율은 12.5퍼센트에 그쳤습니다.
캐럿글로벌이 국내 기업 HRD 담당자 300여 곳을 조사한 2026년 자료도 비슷합니다. 생성형 AI를 도입했다는 답변은 61퍼센트가 넘었지만, 조직 전체의 표준 업무 체계로 자리 잡았다는 답변은 6.7퍼센트에 불과했습니다.
AI 에이전트(사람의 개입 없이 스스로 판단해서 업무를 처리하는 AI 프로그램)로 넘어가면 격차는 더 벌어집니다. 전사 차원에서 AI 에이전트를 완전히 내재화했다는 기업은 여전히 4퍼센트도 되지 않습니다.
다들 AI를 쓰고는 있는데, 왜 성과로 이어지는 곳은 이렇게 적을까요.
저는 최근 이 질문에 답이 될 만한 글 두 편을 함께 읽었습니다. 하나는 실리콘밸리 대표 벤처캐피털 a16z의 시마 앰블이 쓴 버티컬 AI(특정 산업이나 업무에 특화된 인공지능) 전략 글이고, 다른 하나는 개발자 사이먼 그린이 쓴 AI 과잉생산에 관한 글입니다.
두 글의 결론이 놀랍도록 닮아 있더라구요.
한 줄 정리, AI 도입률과 실제 성과 사이의 격차는 국내외를 가리지 않고 데이터로 확인되고 있습니다.
버티컬 AI가 뭔지 먼저 짚고 갈게요
버티컬 AI는 모든 걸 다 하는 범용 AI가 아니라, 법률이나 의료, 보험처럼 특정 산업 하나에 깊게 특화된 AI를 말합니다.
챗GPT나 클로드 같은 범용 AI가 넓고 얕게 답한다면, 버티컬 AI는 좁고 깊게 판단하는 쪽이에요.
베세머(미국 벤처캐피털)는 버티컬 AI 시장이 기존 SaaS(구독형 소프트웨어 서비스) 시장의 열 배 규모로 커질 거라고 내다봤습니다.
투자 흐름도 이미 이쪽으로 옮겨가고 있습니다. 2025년 2분기 한 조사에 따르면 수직형 AI 스타트업에 몰린 투자가 174억 달러로, 전체 벤처캐피털 거래량의 57퍼센트를 차지했다고 합니다. 범용 AI가 화제성을 가져가는 사이, 실제 돈은 의료나 법무처럼 좁은 영역에서 움직이고 있다는 뜻이죠.
리걸테크(법률 기술) 스타트업 하비는 이미 기업가치 백억 달러를 훌쩍 넘겼습니다. 2026년 9월 기준으로는 5억 5천만 달러를 추가로 조달하며 기업가치 156억 달러를 인정받았다는 소식까지 나왔더라구요. 반년도 안 되는 사이 기업가치가 또 뛴 셈입니다.
한 줄 정리, 버티컬 AI는 넓게 다 하는 AI가 아니라 한 산업의 일을 끝까지 판단하는 AI입니다.
많이 만들면 이긴다는 착각, 워크슬롭이 증명하고 있어요
워크슬롭(Workslop, 그럴듯해 보이지만 실제로는 쓸모없는 AI 생성 업무 결과물)이라는 말, 들어보셨나요.
하버드비즈니스리뷰와 스탠퍼드대 소셜미디어연구소, 베터업랩스가 미국 정규직 1150명을 조사했더니 40퍼센트가 한 달 안에 이런 AI발 업무 오류를 경험했다고 답했습니다. 2025년 국내 매체에서도 이 조사를 다루며 다시 확인하고 고치는 데 평균 3.4시간이 걸리고, 1만 명 규모 조직으로 환산하면 생산성 손실이 819만 달러, 우리 돈으로 백억 원이 훌쩍 넘는다는 계산을 소개했더라구요.
국내 조사도 크게 다르지 않습니다. 팀뷰어 조사에 따르면 매일 AI를 쓴다는 직장인이 74퍼센트나 되지만, 그중 55퍼센트는 AI 결과물을 활용하기 전에 직접 검증하고 있고 여기에 주당 평균 2시간을 쓰고 있습니다.
미국 소프트웨어 개발팀을 대상으로 한 파로스(Faros AI)의 분석도 흥미롭습니다. AI를 많이 쓰는 팀은 작업 완료율이 21퍼센트, 코드 병합량이 98퍼센트 늘었지만, 코드 리뷰 시간은 91퍼센트, 오류는 9퍼센트 함께 늘었습니다. 정작 회사 전체 성과와 AI 도입 수준 사이에는 뚜렷한 상관관계가 나타나지 않았습니다.
생산은 빨라졌는데, 흡수는 그만큼 빨라지지 않은 셈이에요.
한 줄 정리, 얼마나 많이 만들었는지는 활동의 지표일 뿐 가치의 지표가 아닙니다.
AI는 만드는 비용은 공짜로 만들었지만, 관리 비용은 그대로예요
사이먼 그린은 개발자 스티브 예기의 사례를 소개합니다.
예기는 30년째 만들고 있는 게임을 위해 에이전트 50에서 60개로 이뤄진 자동화 조직을 운영합니다. 이 조직은 하루 평균 270번의 커밋(코드 변경 저장)을 만들어내며 열 주 만에 게임을 세 개 플랫폼 출시 직전까지 끌고 갔습니다.
문제는 그다음이었습니다. 이 자동화 조직 자체의 코드와 문서량이 60만 줄까지 불어났는데, 정작 게임 본체보다 두 배 가까이 커졌습니다. 법률 문서 같은 내부 규정도 450건이 만들어졌고, 이를 관리할 규정의 규정을 관리하는 역할까지 새로 생겼습니다.
예기 본인도 이 조직을 유지하는 데 전체 작업 시간의 20에서 25퍼센트를 쓴다고 밝혔더라구요.
AI는 코드도, 문서도, 규정도 만드는 비용을 거의 공짜로 만들었습니다. 하지만 그걸 이해하고, 서로 안 맞는 부분을 찾아내고, 여섯 달 뒤에도 왜 이 규칙이 있는지 설명하는 비용은 하나도 줄지 않았습니다.
만드는 건 공짜가 됐지만, 소유하고 관리하는 건 여전히 비쌉니다.
한 줄 정리, AI는 산출물을 공짜로 만들었지만 그걸 이해하고 관리하는 비용까지 없애주지는 않습니다.
시스템에 범용 AI만 얹으면 충분할까요
여기서 시마 앰블의 이야기로 넘어가 볼게요.
기업들이 오래 써온 세일즈포스 같은 시스템 오브 레코드(고객 정보나 거래 내역 같은 핵심 데이터를 저장하고 관리하는 기준 시스템)에 클로드 같은 범용 AI 에이전트를 연결하면 일이 다 해결될 것 같잖아요.
실제로 앤트로픽과 세일즈포스가 함께 내놓은 클로드포스는 세일즈포스를 직접 열지 않고도 클로드 안에서 CRM(고객관계관리) 업무를 처리하게 해줍니다.
문제는 진짜 업무는 한 시스템 안에서 끝나지 않는다는 점입니다. 계약서 한 장이 곧 법률 사건 전체가 아니고, 티켓 하나가 곧 고객 문제 해결 전체가 아니에요. 여러 회사, 여러 부서, 여러 사람이 서로 다른 정보를 들고 있고, 원하는 결론도 제각각입니다.
범용 AI가 여러 시스템에 접근할 수는 있어도, 접근 자체가 그 업무를 잘 해낸다는 뜻은 아닙니다. 같은 고객이라도 시스템마다 이름과 형식이 다르게 저장돼 있고, 회사 밖 상대방의 정보까지 손쉽게 가져오기는 어렵습니다.
서비스나우가 쏘트랩과 함께 19개국 임원 4500명을 조사한 2026년 엔터프라이즈 AI 성숙도 지수를 보면, 국내 기업의 AI 지출은 전년 대비 120퍼센트나 늘었는데도 국내 임원 열 명 중 일곱 명은 여전히 데이터의 정확성과 접근성, 관리 수준 부족을 AI 도입의 가장 큰 과제로 꼽았습니다. 시스템은 갖췄는데 판단의 재료는 정리되지 않은 상태인 거죠.
한 줄 정리, 시스템 오브 레코드와 범용 에이전트를 합쳐도 그 경계를 넘나드는 판단까지 자동으로 생기지는 않습니다.
진짜 이기는 기업은 판단력을 쌓습니다, 하비의 사례
그럼 버티컬 AI 스타트업은 어떻게 이 틈을 파고들까요.
리걸테크 기업 하비는 고객 데이터가 하나도 없는 상태에서 시작했습니다. 대신 실제 변호사가 맡을 법한 사건 1750개를 직접 설계해서 모델을 학습시켰습니다. 과제 하나마다 평균 50개의 채점 기준을 만들어, 무엇이 잘한 결과물이고 무엇이 아닌지를 정교하게 정의했습니다.
몇 년치 고객 데이터가 쌓이기를 기다리는 대신, 커리큘럼을 직접 만들어버린 셈이에요. 이렇게 만든 전문성 학습에 이후 실제 고객사의 양식과 판단 기준을 더해 그 회사만의 일 처리 방식까지 학습시킵니다.
기억하는 것과 배우는 것은 다릅니다. 범용 AI의 메모리는 지난주에 뭘 했는지 기억할 수는 있어도, 그 결과가 좋았는지 나빴는지, 전문가가 왜 고쳤는지는 알려주지 않아요. 같은 일을 반복해서 보고, 전문가의 교정을 계속 학습에 반영하는 조직만이 이 판단력을 쌓아갈 수 있습니다.
한 줄 정리, 데이터가 쌓이길 기다리지 않고 커리큘럼을 직접 설계한 것이 하비가 판단력을 먼저 확보한 이유입니다.
그래서 지금, 무엇을 해야 할까요
두 글을 같이 읽고 나니 결론이 하나로 모이더라구요.
AI 시대의 경쟁력은 얼마나 많이, 얼마나 빨리 만들어내느냐가 아닙니다. 조직 안에서는 만든 것마다 이게 존재할 가치가 있는지를 스스로 물어야 해요.
규칙 하나, 문서 하나, 자동화 하나를 늘릴 때마다 그걸 없앨 때 무엇이 나빠지는지 설명할 수 없다면, 일단 없어도 되는 것으로 봐야 합니다.
시장에서는 시스템과 범용 AI만으로는 못 채우는 틈, 즉 여러 시스템과 사람을 가로지르는 판단의 영역을 먼저 파고드는 쪽이 이깁니다. 이 판단력이야말로 AI가 가장 늦게, 가장 어렵게 따라올 수 있는 자산이에요.
공장은 이미 우리가 쓸 수 있는 것보다 훨씬 많이 만들어낼 준비가 되어 있습니다. 이제 필요한 건 더 많이 만드는 능력이 아니라, 무엇을 만들지 판단하는 능력입니다.
한 줄 정리, 지금 필요한 경쟁력은 생산 속도가 아니라 판단력입니다.
마무리
AI는 코드도, 문서도, 심지어 새로운 제품 아이디어도 값싸게 만들어주는 시대를 열었습니다. 하지만 그 산출물을 이해하고, 관리하고, 정말 필요한지 판단하는 비용은 하나도 줄어들지 않았어요.
조직 안에서는 존재 가치가 없는 규칙과 문서를 계속 걸러내야 하고, 시장에서는 시스템과 범용 AI가 채우지 못하는 판단의 틈을 먼저 차지해야 합니다.
많이 만드는 조직이 아니라 무엇을 만들지 아는 조직이, 결국 이깁니다. 지금 우리 조직이 AI로 무엇을 만들고 있는지보다, 그중 무엇을 남길지 먼저 점검해 보시면 좋겠습니다.
'IT > AI' 카테고리의 다른 글
| 에이전틱 AI 도입 실패, 모델이 아니라 데이터가 문제인 이유 (0) | 2026.09.27 |
|---|---|
| AI 에이전트 YOLO 모드, 승인 없이 움직여도 안전한 이유 (0) | 2026.09.27 |
| GPT-6 아스트라, AI가 똑똑해질수록 속을 못 보는 이유 (0) | 2026.09.26 |
| AI 에이전트 경영, 마크다운 파일 하나가 직원이 되는 이유 (0) | 2026.09.26 |
| AI 코딩 비용 절감, 토큰을 줄일수록 오히려 늘어나는 이유 (1) | 2026.09.25 |