핵심 주장
기업의 AI 운영에는 두 극단이 있다. 하나는 100x 엔지니어를 지향하며 가능한 한 많은 모델 호출과 에이전트를 사용하게 하는 접근이다. 다른 하나는 비용을 최소화하기 위해 사용량을 강하게 제한하는 접근이다.
실용적인 해법은 둘 중 하나를 택하는 것이 아니다. 사용자와 업무 채택은 넓히되, 문맥·모델·호출·재시도·캐시를 시스템적으로 최적화하고, 최종 평가는 토큰이 아니라 완료된 업무의 가치로 하는 것이다.
Uber의 최근 변화는 이 중간 지점을 보여주는 사례다.
1. 문제 제기: AI를 많이 쓰는 것이 생산성인가
Uber는 2026년 초 개발자들의 Claude Code 등 에이전트 사용을 빠르게 확대했다. 그 결과 연간 AI 코딩 예산을 1분기 말부터 약 4개월 안에 소진했다는 보도가 나왔다.
중요한 점은 AI 도입이 실패해서 비용이 발생한 것이 아니라는 점이다. 사용자가 빠르게 늘고, 에이전트가 여러 작업을 병렬로 수행하면서 사용량이 예상을 넘어섰다. 다시 말해 성공적인 채택이 비용 문제를 일으킨 사례에 가깝다.
그러나 높은 토큰 사용량이 곧 고객 가치나 제품 출시 증가를 의미하지는 않는다. 따라서 질문은 “AI를 얼마나 많이 사용하는가?”에서 다음으로 바뀌어야 한다.
AI가 실제로 완료한 업무 하나의 비용은 얼마인가?
2. 최근 트렌드: 무제한 사용과 무조건 제한 사이
극단 1: 100x 엔지니어와 token-maxxing
고성능 모델과 다중 에이전트를 최대한 사용하면 개인의 처리량을 크게 높일 수 있다. 탐색, 프로토타이핑, 대규모 마이그레이션처럼 실패 비용이 낮거나 속도가 중요한 업무에는 이 접근이 합리적일 수 있다.
하지만 다음 문제가 생긴다.
- 에이전트가 같은 문맥을 반복해서 읽음
- 단순 업무에도 프런티어 모델을 사용함
- 병렬 에이전트가 중복 결과를 만듦
- 긴 추론과 재시도가 비용을 키움
- AI가 만든 코드·테스트·리뷰를 사람이 다시 검토해야 함
극단 2: 사용량 제한 중심의 비용 통제
사용자별 월 한도나 고정 예산은 급격한 비용 폭증을 막는 데 유용하다. 하지만 한도 자체가 목표가 되면 중요한 작업까지 막고, 비용은 줄어도 생산성·학습·실험 기회를 잃을 수 있다.
현실적인 중간 지점
실용적인 운영은 채택은 확대하고, 낭비만 줄이는 것이다.
- 사용자는 자유롭게 AI를 활용
- 시스템은 업무별로 적절한 모델을 선택
- 문맥과 도구 호출을 최소화
- 세션 비용을 사용자에게 공개
- 결과 품질과 완료 업무를 함께 측정
3. Uber의 비용 방정식
Uber는 에이전트 세션 비용을 다음처럼 분해한다.
사용자 수 × 사용자당 세션 수 × 세션당 턴 수 × 턴당 요청 수 × 요청당 토큰 수 × 토큰 가격
이 식의 해석은 중요하다.
확대해야 하는 항목
- 사용자 수
- 사용자당 유효 세션 수
AI가 조직에 실제로 확산되려면 이 두 항목은 반드시 커져야 한다. Uber도 2026년 2월부터 8월 사이 주간 활성 사용자가 7배, 주간 에이전트 요청이 9.4배 증가했다고 설명한다.
최적화해야 하는 항목
- 세션당 턴 수
- 턴당 요청 수
- 요청당 입력·출력 토큰
- 토큰 가격
이 항목들은 사용자의 AI 접근을 막지 않고도 줄일 수 있다. Uber는 같은 모델을 고정해 비교했을 때 요청 1,000건당 비용을 약 34%, 세션당 비용을 약 52% 낮췄다고 밝혔다.
4. Uber가 최적화한 것
4.1 불필요한 대화 재전송
에이전트는 매 턴마다 대화 이력, 프로젝트 컨텍스트, 도구 결과를 다시 입력으로 보낼 수 있다. 세션이 길어질수록 같은 정보가 반복 청구된다.
Uber는 자동 압축 기준을 40만 토큰으로 설정하고, 100만 토큰 컨텍스트를 지원하는 모델이라도 무조건 끝까지 문맥을 유지하지 않는다. 긴 문맥이 항상 높은 품질을 보장하지 않는다는 판단이다.
4.2 MCP 도구와 컨텍스트 최적화
Uber는 1,000개 이상의 MCP 서버를 단일 게이트웨이로 관리한다. 모든 도구의 스키마를 매 세션에 미리 넣으면 초기 프롬프트에 약 5만~7만 토큰이 추가될 수 있다.
대응 방식은 다음과 같다.
- 필요한 도구만 검색해 동적으로 로딩
- MCP 호출을 CLI 방식으로 지연 실행
- 여러 도구 호출을 코드 모드에서 묶어 처리
- 중간 polling 결과를 모델 문맥에 계속 넣지 않음
핵심은 MCP 서버를 줄이는 것이 아니라 모든 MCP 서버의 설명을 모든 세션에 싣지 않는 것이다.
4.3 프롬프트 캐시의 운영
반복되는 긴 문맥은 캐시하면 입력 비용과 지연 시간을 줄일 수 있다. Uber는 개발자가 세션을 5분 이상 중단하는 경우가 많다는 관찰에 따라 대화형 세션의 캐시 유지 시간을 5분에서 1시간으로 바꿨다.
반면 짧게 끝나는 하위 에이전트에는 짧은 캐시 시간을 적용한다. 즉, 캐시도 일괄 설정이 아니라 세션의 수명과 작업 패턴에 맞춰 운영한다.
4.4 적절한 모델 배치
모든 작업에 가장 비싼 모델을 쓰지 않는다.
- 계획 수립·복잡한 판단: 고성능 모델
- 분류·검색·반복 실행: 저비용 모델
- 특화 업무: 오픈웨이트 모델
- 하위 에이전트: 주 모델보다 저렴한 모델
Uber는 실제 업무로 자체 벤치마크를 만들고, 모델별 비용·정확도·신뢰성의 Pareto frontier를 비교한다. 단순히 “가장 싼 모델”이 아니라 완료된 업무의 비용과 품질이 함께 좋은 모델을 고르는 방식이다.
4.5 비용을 사용자에게 보이기
개발자 터미널에 세션 비용을 표시하고, 대시보드가 다음과 같은 낭비 패턴을 알려준다.
- 단순 업무에 고성능 모델 사용
- 긴 MCP 응답을 계속 문맥에 유지
- 캐시 만료 후 세션 재개
- 과도한 시스템 지침과 도구 정의 사전 로딩
비용 관리는 재무팀만의 업무가 아니라, 개발자의 일상적인 설계 선택이 된다.
5. 다른 사례: 비용 최적화가 제품 기능으로 들어가는 중
Uber만의 특수한 대응은 아니다.
GitHub Copilot: 하니스가 모델만큼 중요해짐
GitHub는 같은 모델과 같은 작업을 고정해 비교했을 때, Copilot의 에이전트 하니스가 다른 하니스보다 적은 토큰으로 비슷한 작업 완료율을 달성한다고 발표했다. 이는 비용 경쟁의 단위가 모델 자체에서 모델을 운용하는 하니스와 오케스트레이션 계층으로 확장되고 있다는 신호다. GitHub 공식 글
VS Code: 캐시 적중률을 핵심 효율 지표로 관리
VS Code 팀도 반복되는 프롬프트 접두부를 재사용하면 비용과 지연 시간을 함께 줄일 수 있다고 설명한다. 대화형 코딩 도구의 성능은 모델 품질뿐 아니라 컨텍스트를 얼마나 잘 재사용하는지에 좌우된다. VS Code 공식 글
Snowflake: 동적 모델 라우팅을 게이트웨이화
Snowflake는 품질과 비용을 기준으로 작업별 모델을 자동 선택하는 Cortex AI Gateway를 내세우고 있다. 복잡한 작업은 프런티어 모델로, 반복·저난도 작업은 더 효율적인 모델로 보내는 방식이다. Snowflake의 내부 평가에서는 프런티어 모델 단일 경로보다 최대 3배 높은 토큰 효율을 보고했다. 다만 이는 Snowflake 내부 테스트이므로 일반적인 ROI로 확대 해석해서는 안 된다. 이는 기업의 모델 선택이 개인의 프롬프트 습관이 아니라 중앙화된 라우팅 정책으로 이동하는 사례다. Snowflake 공식 글
이 사례들은 Uber의 방향과 같은 축에 있다. 사용량을 단순히 억제하는 것이 아니라, 하니스·캐시·게이트웨이·모델 라우팅을 통해 같은 업무를 더 적은 비용으로 수행한다.
6. 살펴봐야 할 부분: 비용 효율이 ROI인가
Uber의 요청당 비용과 세션당 비용이 낮아졌다는 사실은 좋은 신호지만, 그것만으로 사업 ROI가 증명되지는 않는다.
반드시 함께 봐야 할 지표는 다음과 같다.
- 병합된 PR당 AI 비용
- 실제 출시된 기능당 AI 비용
- AI 생성 코드의 되돌림률과 장애율
- 사람의 검토·수정 시간
- 버그 해결 시간과 MTTR
- 고객 지원·매출·운영비에 미친 영향
- AI 사용이 없었을 때와 비교한 순수한 시간 절감
특히 비용/요청은 좋아졌지만 비용/고객 가치는 그대로일 수 있다. 요청 수가 늘면서 단위 비용이 내려가는 규모의 경제와, 실제 가치가 증가하는 생산성 향상은 구분해야 한다.
7. 우리가 배울 수 있는 운영 원칙
- AI 사용을 무조건 제한하지 말고, 먼저 비용의 발생 구조를 분해한다.
- 모델 가격보다 문맥 중복·재시도·도구 로딩·캐시 만료를 점검한다.
- 단순 작업과 복잡한 작업에 같은 모델을 배치하지 않는다.
- 실제 업무에서 만든 평가 세트로 비용과 품질을 함께 비교한다.
- 사용자·세션 비용을 숨기지 않고 실시간으로 보여준다.
- 토큰당 비용에서 완료된 업무당 비용으로 측정 단위를 바꾼다.
- 비용 절감 결과가 고객 가치와 연결되는지 별도 검증한다.
결론
AI 운영의 목표는 최대 사용량도, 최소 비용도 아니다. 조직이 필요한 만큼 충분히 사용하면서, 낭비되는 토큰과 낮은 가치의 호출을 줄이고, 결과 단위의 성과를 높이는 것이다.
Uber 사례가 보여주는 변화는 다음과 같다.
1단계: AI를 조직에 확산한다.
2단계: 사용량의 비용 구조를 이해한다.
3단계: 업무 단위의 품질과 ROI를 최적화한다.
따라서 앞으로의 AI 경쟁력은 “누가 가장 강한 모델을 쓰는가”보다 누가 같은 모델 호출로 더 많은 유효 업무를 완료하는가에 가까워질 가능성이 높다.
참고 자료 및 근거 상태
- Uber, Running a Software Factory Efficiently at Uber Scale — 1차 자료. 비용 방정식, 모델 라우팅, MCP·캐시·문맥 최적화, 결과 단위 지표.
- Axios, Exclusive: Uber cuts AI costs even as usage jumps — 보도 자료. 예산 소진 이후 사용량과 비용 변화 요약.
- Uber Q2 2026 Prepared Remarks — 1차 자료. 저비용·오픈웨이트 모델 전환과 토큰 비용 안정화에 대한 경영진 설명.
- GitHub, Evaluating performance and efficiency of the Copilot agentic harness — 1차 자료. 하니스와 토큰 효율 비교.
- VS Code, Improving token efficiency in GitHub Copilot — 1차 자료. 프롬프트 캐싱과 토큰 효율.
- Snowflake, Dynamic Model Routing & Open Models in Snowflake Cortex AI — 1차 자료. 동적 모델 라우팅과 오픈 모델을 통한 outcome당 비용 최적화.
작성 메모
초기 보도에서 Uber의 연간 AI 예산 소진 시점은 “1분기”와 “약 4개월”로 혼용된다. 본문에서는 단정 대신 “1분기 말부터 약 4개월 내”로 표현하는 것이 안전하다.
