엑셀 견적서 자동 비교 파이썬 RPA 구축 실비용 및 PDF 파싱 오류 실패 사례
사내 구매팀의 업무 효율을 높이기 위해 하도급 업체의 견적서를 엑셀로 자동 취합하는 파이썬 기반 RPA(로봇 프로세스 자동화)를 만들었던 적이 있습니다. 실무진은 매번 수십 곳의 협력사가 이메일로 보내오는 PDF 견적서를 열어보고, 품목과 단가를 복사해 하나의 엑셀 시트에 옮겨 적느라 많은 시간을 소요하고 있었습니다.
단순 반복 업무를 코드로 자동화하여 리드타임을 크게 줄이겠다는 의도는 좋았지만, 완성하여 시스템을 배포한 지 단 일주일 만에 사고가 터졌습니다. 가장 큰 문제는 협력사마다 견적서를 작성하는 양식이 완전히 다르다는 점이었습니다.
어떤 업체는 '단가'와 '공급가액'을 하나의 셀에 병합하여 표기했고, 어떤 업체는 품목명을 두 줄로 나누어 적어 보냈습니다. 사전에 짜둔 파이썬 파싱(Parsing, 데이터를 분해하여 추출하는 기술) 규칙은 셀 병합이나 줄바꿈이 조금만 달라져도 엉뚱한 값을 긁어왔습니다. 만 원짜리 부품의 단가에서 PDF 파싱 또는 OCR 과정에서 쉼표(,), 소수점(.), 자릿수가 잘못 해석되는 오류가 발생한 것입니다.
스크립트가 내뱉은 결과물만 믿고 그대로 기안을 올렸다가, 실제 발주 금액이 15% 이상 부풀려지는 과오납 발주 리스크가 현실화될 뻔했습니다. 눈에 보이지 않는 코드가 사람의 실수를 줄여줄 것이라 맹신했지만, 정형화되지 않은 데이터를 다루는 환경에서는 오히려 더 발견하기 어려운 데이터 오류를 만들어냈습니다.
결국 구매팀 실무자들은 자동화 시스템을 불신하게 되었고, 파이썬이 추출한 엑셀 파일과 원본 PDF를 모니터 양쪽에 띄워두고 육안으로 대조하는 최악의 이중 작업에 시달려야 했습니다.
비정형 견적서를 자동화할 때는 먼저 PDF가 문자 정보를 가진 디지털 문서인지, 스캔 이미지인지부터 구분해야 합니다. 텍스트 기반 PDF는 PyMuPDF·pdfplumber·Camelot 같은 라이브러리로 표와 셀 구조를 직접 추출할 수 있지만, 스캔본이나 복잡한 레이아웃에서는 OCR 또는 Document AI 계열의 구조화 문서 인식 서비스를 함께 사용하는 것이 효과적입니다.
다만 어떤 방식도 100% 정확도를 보장하지 않으므로 금액·수량처럼 재무적으로 중요한 필드는 별도의 검증 로직이 필요합니다. 여기에 더해, 협력사가 새로운 양식의 견적서를 보내올 때마다 개발자가 파이썬 파싱 규칙·정규표현식·매핑 로직을 수정해 주어야 하는 숨은 인건비가 지속적으로 발생합니다.
이처럼 비정형 견적 양식 전처리 로직을 유지보수하는 데 투입되는 개발자 공수는 기업 입장에서 지속적인 운영비 부담으로 작용합니다. 따라서 자체적으로 사내망에 서버를 두고 파이썬 RPA를 짤 것인지, 아니면 B2B SaaS 구독 모델을 도입할 것인지 총소유비용을 비교해야 합니다.
실제 월간 1,000건의 하도급 견적서를 처리하는 중견기업을 기준으로, 사내망 자체 구축과 전문 B2B 견적 비교 SaaS 도입 시의 비용 구조를 해체해 보았습니다. 초기 파이썬 파싱과 엑셀 대조 매크로의 외주 개발비를 가정하면 자체 구축이 저렴해 보일 수 있으나, 시스템이 노후화되고 벤더사가 늘어날수록 누적되는 유지보수 비용의 격차를 아래 표에서 명확히 확인하시기 바랍니다.
| 비용 산출 항목 | 사내 애플리케이션 + 외부 OCR/Document AI API 연동 | 구매 특화 B2B SaaS 솔루션 구독 |
|---|---|---|
| 초기 시스템 구축비 (CAPEX) | 약 850만 원 (파이썬 파싱 및 매크로 외주 개발 시뮬레이션) | 가상 0원 적용 (실제 초기 도입·연동비는 공급사별 상이) |
| 월간 클라우드/API 요금 (OPEX) | 가상 월 15만 원 적용 (실제 비용은 OCR·Layout·Form Parser 등 선택 기능과 페이지·API 호출량에 따라 별도 산정) | 약 120만 원 (엔터프라이즈 플랜 고정 구독료 가상) |
| 월간 유지보수 기회비용 | 가상 내부 인력 기회비용 150만 원/월 (주 10시간 투입 가정) | 기본 구독료에 포함 가정 (신규 템플릿·연동·커스텀 개발은 별도 비용 발생 가능) |
| 1년 누적 총소유비용(TCO) | 약 2,830만 원 (구축비 + 연간 유지/운영비용 합산) | 약 1,440만 원 (가상 시나리오 기준) |
※ 월 견적서 1,000건·평균 10페이지, 총 1만 페이지 처리 가정. 자체 구축비·내부 인력비·SaaS 구독료는 사업성 비교를 위한 사례·가정값이며, OCR/Document AI 비용은 선택 모델과 처리 방식에 따라 크게 달라질 수 있습니다. (데이터 기준 시점: 2026년 9월 2일)
비용 구조를 확인했다면 다음으로 점검해야 할 것은 데이터의 '의미적 불일치' 문제입니다. 예를 들어, A 업체는 ‘Double A A4 80g 500매×5권’이라고 적고, B 업체는 ‘더블에이 복사용지 A4 80gsm 2,500매’라고 기재할 수 있습니다. 사람이 보면 동일한 규격과 포장단위인지 확인해 매칭할 수 있지만, 단순 문자열 비교 프로그램은 서로 다른 품목으로 분류할 수 있습니다.
견적서 자동 비교의 성공 여부는 화려한 인공지능 기술에 있는 것이 아니라, 협력사들이 보내오는 난잡한 품목명을 사내 표준 마스터 데이터(MDM) 코드와 일치시키는 데이터 매핑 전처리 기술력에 달려 있습니다. 이 전처리 규칙을 견고하게 세우지 않은 채 무작정 외주 개발사에 파이썬 코드 몇 줄을 짜 달라고 맡기는 것은 예산 낭비입니다.
자사의 구매팀에 자동화 솔루션을 도입할 것인지 판단하는 기준은 거래의 볼륨과 공급사의 협상력에 있습니다. 만약 회사가 매월 수만 개의 규격화된 전자 부품을 고정된 대형 벤더사로부터 납품받고 있어 데이터 형식이 어느 정도 엑셀로 통일되어 있다면, 전담 개발 인력을 투입한 자체 사내망 RPA 구축이 유리합니다. 처리시간 절감 규모가 충분하다면 투자비 회수기간을 단축할 수 있습니다.
반대로 매번 다른 영세 하도급 업체와 거래하여 스캔 화질이 낮고 협력사별 양식 편차가 큰 환경이라면, 처음부터 100% 무인 자동화를 목표로 해서는 안 됩니다. OCR·문서 파싱 결과에 신뢰도 임계값을 두고, 단가·수량·공급가액이 기준을 벗어나거나 인식 신뢰도가 낮은 견적서만 사람이 확인하는 Human-in-the-loop 구조가 현실적입니다. 동시에 신규 협력사부터 표준 엑셀·웹폼 제출을 유도해 비정형 문서 비중 자체를 점차 줄이는 프로세스 혁신을 병행해야 합니다.
작성자: 테크 도슨트
자료 확인일 : 2026년 09월 02일
참고자료 및 출처 :
Google Cloud Document AI 공식 가격 안내
Google Cloud Document AI 보안 및 데이터 처리 정책
Google Cloud Document AI 데이터 처리 지역 안내
NAVER Cloud Platform CLOVA OCR 공식 요금 안내
NAVER Cloud Platform CLOVA OCR 보안 및 데이터 처리 안내
PyMuPDF 공식 Table Extraction 문서
pdfplumber 공식 Table Extraction 문서
Camelot 공식 PDF Table Extraction 문서
Camelot 이미지·스캔 PDF 처리 안내
※ PDF 견적서 자동화의 정확도와 총소유비용은 문서 유형, 표 구조, 월 처리량, OCR·Document AI 방식, 내부 유지보수 비용과 공급사 데이터 표준화 수준에 따라 크게 달라지므로 실제 견적서 샘플을 이용한 PoC에서 정확도·예외율·사람 검수시간을 함께 측정한 뒤 도입방식을 결정하는 것이 적절합니다.
댓글
댓글 쓰기