지난 글에서는 GPT·Claude·Gemini를 고를 때 무엇을 봐야 하는지 정리했어요. 그런데 실제로 AI 에이전트를 만들려면 질문이 하나 더 남아요. “그래서 내 일에는 어느 모델이 맞을까요?”
답은 모델 이름보다 맡길 일에 가까워요. 여러 도구를 연결하는지, 긴 문서를 오래 다루는지, 이미지·PDF·영상이 핵심인지에 따라 첫 시험 후보가 달라집니다. 이번 글에서는 세 모델을 잘 맞는 작업 / 장점 / 약점과 주의 / 반드시 시험할 항목으로 나눠볼게요.
이 글은 세 회사의 공식 포지셔닝과 ABNL(AI BRAND NEW LIFE, 이 블로그의 AI 실험 기록)이 직접 돌린 제한된 파일 과제를 분리해서 봐요. 종합 우승자를 정하지 않고, 내 대표 업무에서 무엇부터 시험할지 정하는 데 목적이 있어요.

0순위는 성능이 아니라 ‘실제로 실행되는가’예요
아무리 평가가 좋은 모델이어도 현재 계정·플랜·지역·도구 연결에서 실행되지 않으면 비교가 시작되지 않아요. 필요한 파일 형식을 받을 수 있는지, 도구를 호출할 수 있는지, 결과를 다음 시스템이 읽을 수 있는지도 먼저 확인해야 해요.
- 현재 계정과 환경에서 모델을 선택할 수 있나요?
- 텍스트·이미지·PDF·영상 등 필요한 입력을 받을 수 있나요?
- 검색·파일·메일·DB·캘린더 같은 도구를 연결할 수 있나요?
- 자유문, 표, CSV, JSON 중 필요한 출력 형식을 지킬 수 있나요?
- 실패했을 때 바로 알 수 있나요? 조용히 넘어가지는 않나요?

GPT — 도구가 많은 자동화를 먼저 시험할 때
잘 맞는 작업: 검색·파일·메일·DB·캘린더처럼 여러 도구를 잇는 작업, JSON·CSV처럼 다음 시스템이 받는 결과, 단계와 승인선(AI가 실행하기 전에 사람이 확인하는 단계)이 분명한 반복 업무예요.
장점으로 볼 항목: OpenAI의 현재 공식 자료는 GPT-5.6을 복잡한 프로덕션 워크플로의 품질·효율 기준으로 설명하고, Programmatic Tool Calling과 멀티에이전트 베타 기능을 강조해요. 따라서 도구 선택, 중간 결과 연결, 구조화 출력이 중요한 업무에서 첫 후보로 시험하기 좋아요. ABNL이 GPT와 Claude에 똑같이 준 한 파일 기반 과제에서, GPT는 미리 정한 핵심 판단 항목을 3회 모두 충족했고 JSON만 출력하라는 조건도 3회 모두 지켰어요. 다만 이건 한 과제·3회 결과일 뿐 종합 성능 우위를 뜻하지는 않아요.
약점과 주의: 모델이 답을 만들었다고 해서 파일 저장, 외부 전송, 공개까지 끝난 것은 아니에요. 도구 호출 화면만 보고 완료를 선언하지 말고 마지막 상태를 별도로 확인해야 해요.
단계 누락 · 도구 선택 · 출력 형식 · 실패 보고 · 사람 승인선


Claude — 긴 문서와 장기 프로젝트를 먼저 시험할 때
잘 맞는 작업: 긴 계약서·보고서·매뉴얼 검토, 여러 차례 수정하면서 맥락과 결론을 유지하는 프로젝트, 누락·인과·과장·독자 오해를 찾는 콘텐츠 검수예요.
장점으로 볼 항목: Anthropic의 현재 공식 자료는 Claude Opus 5를 복잡한 에이전트 코딩과 기업 작업의 시작점으로, Claude Fable 5를 장시간 실행되는 에이전트용으로 설명해요. 긴 흐름과 예외를 놓치지 않는지가 중요한 업무에서 먼저 시험해볼 수 있어요.
약점과 주의: 내용 판단이 맞아도 자동 파서가 요구한 형식을 어길 수 있어요. ABNL의 한 파일 과제에서 Claude는 핵심 판단은 3/3이었지만, 결과를 코드펜스로 감싸 ‘JSON만 출력’ 조건은 0/3이었어요. 내용이 틀린 게 아니라 자동 파서가 요구한 포장 형식이 어긋난 경우라, 프롬프트의 형식 지시나 받는 쪽 처리 방식에 따라 달라질 수 있어요. 그래서 이 결과는 한 과제의 형식 호환성일 뿐 Claude 전체 성능을 뜻하지 않아요.
지시 유지 · 누락 · 앞뒤 모순 · 형식 계약 · 긴 작업 뒤 결론 일치


Gemini — 이미지·PDF·영상 입력이 중심일 때
잘 맞는 작업: 제품 사진과 설명서를 함께 정리하는 일, 이미지·PDF·표·영상 프레임을 함께 해석하는 일, 서로 다른 자료에서 근거를 연결하는 작업이에요.
장점으로 볼 항목: Google의 현재 공식 자료는 Gemini 3.6 Flash를 에이전트와 멀티모달 작업에서 속도와 지능의 균형을 맞춘 모델로 설명해요. 혼합 입력이 업무의 핵심이라면 실제 자료로 먼저 시험할 후보가 될 수 있어요.
약점과 주의: ABNL 환경에서는 레지스트리·인증 단계에서 멈춰 실제 모델 과제를 실행하지 못했어요. 그래서 지금은 공식 포지셔닝을 첫 후보 근거로만 쓸 수 있고, 정확도나 종합 우위는 확인하지 않았어요.
자료별 추출 정확도 · 숫자와 표 누락 · 이미지-텍스트 근거 연결 · 현재 환경의 실행 가능성

세 모델의 장단점을 한 번에 보면
| 업무 조건 | 첫 시험 후보 | 장점으로 볼 항목 | 약점·주의로 볼 항목 |
|---|---|---|---|
| 도구가 많은 자동화 | GPT | 단계 연결·구조화 출력 | 실제 완료 증거·승인선 |
| 긴 문서·장기 프로젝트 | Claude | 맥락·누락·인과 | 형식 계약·장기 결론 일치 |
| 이미지·PDF·영상 중심 | Gemini | 멀티모달 입력 연결 | 실제 환경 지원·추출 검증 |
| 외부 전송·결제·삭제 | 모델보다 승인선 먼저 | 실행 전 확인 | 무승인 행동 |
| 창작·판단처럼 정답이 하나가 아닌 일 | 특정 모델 선추천 없음 | 익명 결과 비교 | 취향을 객관적 성능으로 단정하지 않기 |

내 업무를 입력 → 처리 → 출력 → 검증 네 칸으로 나눠요
| 입력 | 처리 | 출력 | 검증 |
|---|---|---|---|
| 텍스트·표·이미지·PDF·영상 | 추출·비교·작성·판단·도구 실행 | 자유문·표·CSV·JSON·외부 행동 | 원문 대조·스키마 검사·사람 승인·상태 증거 |
예를 들어 제품 사진·설명서 → 핵심 정보 추출과 카피 작성 → 상세페이지 초안 → 원문·가격·표기 검증처럼 적을 수 있어요. 네 칸을 쓰면 모델의 장점이 내 일에서 어디에 필요한지, 실패하면 어디서 잡아야 하는지가 선명해져요.

최종 선택은 같은 대표 업무를 세 번 돌려서 정해요
아래 표를 그대로 옮겨 적고 회차마다 결과를 채워보세요. ‘기록’이라고 적힌 칸이 여러분이 직접 채울 자리예요.
| 회차 | 핵심 내용 | 형식 준수 | 누락·오류 | 사람 수정량 | 실패·복구 |
|---|---|---|---|---|---|
| 1 | 기록 | 기록 | 기록 | 기록 | 기록 |
| 2 | 기록 | 기록 | 기록 | 기록 | 기록 |
| 3 | 기록 | 기록 | 기록 | 기록 | 기록 |
- 같은 입력·목표·도구·출력 형식·승인선을 사용해요.
- 모델의 답을 다른 모델에게 보여주지 않아요.
- 가장 어려운 일이 아니라 안전하고 검증 가능한 대표 업무부터 시작해요.
- 3/3이라는 결과를 전체 성공률로 일반화하지 않아요.
결론 — 주력 하나, 약점이 확인될 때만 보조 하나
도구가 많은 자동화라면 GPT, 긴 문서와 장기 프로젝트라면 Claude, 이미지·PDF·영상이 중심이라면 Gemini부터 시험해볼 수 있어요. 하지만 최종 주력은 모델 이름이 아니라 내 대표 업무 3회 기록으로 정하세요.
쇼츠로 핵심 보기
모델을 골랐다면 운영환경은 역할로 나눠요
여기까지가 모델 선택의 결론이에요. 아래 장비는 모델을 더 똑똑하게 만드는 제품이 아니라, 에이전트를 어디서 돌리고 결과를 어떻게 남길지 정하는 작업환경 예시예요. 필요한 역할이 없다면 장비부터 살 이유는 없어요.

NAS · 원본·결과·로그·백업 보관
에이전트가 만든 결과와 검수 기록을 날짜별로 남기고 여러 기기에서 확인하려는 경우의 역할이에요.
Mac mini · 고정형 상시 운영 환경
검증된 자동화를 책상 한곳에서 계속 돌릴 고정형 환경의 예시예요.
ROG Flow Z13 · 이동형 AI·문서·콘텐츠 작업
이동하면서 이미지·PDF·문서·콘텐츠 작업을 이어가려는 경우의 예시예요.
공식 참고 자료
- OpenAI Developers · Using GPT-5.6
- Anthropic · Models overview
- Google AI for Developers · Gemini models
공식 자료 확인: 2026-07-31 14:23 KST · 상품 상태 확인: 2026-07-31 16:50 KST. ABNL 내부 수치는 GPT·Claude 각 3회의 한 파일 기반 과제이며 Gemini는 미실측이에요.