프로젝트 데이터에 자연어로 묻는 두 가지 방식, 자유 SQL 생성과 검증 질의

발주처와 시공사 양쪽에서 프로젝트 데이터에 자연어로 질문하고 답을 받겠다는 요구가 늘고 있다. 구현 방법은 두 가지다. 모델이 데이터베이스 스키마를 읽고 SQL을 직접 작성하게 하는 방식과, 미리 검증해 둔 질의와 지표 정의에 질문을 연결하는 방식이다. 앞의 방식은 실제 기업 데이터웨어하우스를 대상으로 성적이 측정돼 있다. BEAVER 벤치마크 2026년 5월 개정판에서 가장 성적이 좋은 조합이 11.4%였다.
현장에서 반복되는 질문
현장에서 실제로 반복되는 질문은 특정 CWP의 잔여 공수, 게이트 미통과 패키지, 이번 주 마감 펀치, 서브시스템 진척률 같은 종류로 좁다. 어떤 질문이든 받는 시스템을 목표로 하면 스키마 전체를 모델에 맡겨야 하고, 반복되는 질문에 답하는 시스템을 목표로 하면 그 질문에 대한 질의를 먼저 정의해 둘 수 있다.
자유 SQL 생성은 공개 벤치마크와 기업 데이터에서 성적이 다르다
자연어를 SQL로 바꾸는 과제를 text-to-SQL이라 부른다. 공개 벤치마크 성적은 높다. BIRD 리더보드는 2026년 9월 기준 테스트 세트 최고 실행 정확도가 82.95%이고, 데이터 엔지니어와 DB 전공 학생이 같은 문제를 푼 성적은 92.96%다.
실제 기업 데이터웨어하우스를 대상으로 만든 BEAVER 벤치마크(arXiv 2409.02038, 2026년 5월 3판)에서는 숫자가 다르다. 논문은 GPT-5.2를 쓴 에이전트 방식의 정확도를 10.8%로 요약했다. 측정한 조합 가운데 가장 높은 것은 ReFoRCE 프레임워크에 Claude Sonnet 4.5를 쓴 11.4%였다. 두 벤치마크의 조건 차이는 다음과 같다.
| 항목 | 공개 벤치마크(BIRD) | 실제 기업 DW(BEAVER) |
|---|---|---|
| DB당 평균 테이블 수 | 6.8개 | 101.5개 |
| DB당 평균 컬럼 수 | 72.5개 | 869.4개 |
| 정답 SQL 평균 길이 | 37.3 토큰 | 316.7 토큰 |
| 테이블당 조인 차수 | 2.5 | 9.8 |
출처: BEAVER 논문 3판(2026.5)의 벤치마크 비교표.
같은 시험 안에서 모델에 주는 정보만 바꿔도 숫자가 움직인다. 관련 테이블, 조인 키, 컬럼 매핑을 힌트로 주면 ReFoRCE의 정확도가 18.9%로 오르고, 모든 중간 단계 정보를 주면 25.9%가 된다. 모델을 바꿨을 때보다 구조 정보를 넣었을 때 움직인 폭이 컸다.
BEAVER의 데이터는 대학 IT 부서, 연구소 인프라팀, 주거시설 관리 소프트웨어의 DW에서 왔고 EPC나 조선 도메인은 없다. 다만 Unifier의 BP 테이블, P6의 액티비티 구조, ERP의 원가 계정을 합치면 테이블 수백 개에 업무 약어 컬럼이 이어지고, 시스템 간 연결은 외래키 없이 프로젝트번호·WBS·CWP 같은 업무 코드로 이어진다. 테이블 수와 조인 경로 면에서 BEAVER가 재현한 조건에 가깝다.
의미 계층을 거치면 정확도와 오답 방식이 달라진다
미리 정의한 질의·지표 계층(시맨틱 레이어)을 거치는 방식은 여러 측정에서 개선폭이 보고됐다. 각 측정은 문항과 데이터가 서로 달라 수치를 가로로 비교할 수 없고, 위의 BEAVER 수치와도 다른 시험이다.
Cube 소속 연구자 두 명이 2026년 4월 arXiv에 올린 논문(2604.25149)은 소매 데이터 100문항을 Claude Opus 4.7, Claude Sonnet 4.6, GPT-5.4로 풀게 했다. 스키마 DDL만 준 조건에서 45.5~50.5%였던 정확도가 4KB 분량의 시맨틱 레이어 마크다운 한 장을 더하자 67.7~68.7%로 올랐다. 모델별 개선폭은 17.2~23.2%p이고, 시맨틱 레이어를 넣은 뒤에는 세 모델의 차이가 통계적으로 구분되지 않았다.
Microsoft ISE 팀이 2026년 5월 공개한 측정은 Azure Databricks AI/BI Genie에 LiveSQLBench의 중간 난이도 문항을 풀게 했다. 메타데이터가 없을 때 9.5%, 컬럼 설명과 도메인 지식을 넣은 뒤 69.2%, 피드백으로 SQL 패턴을 저장한 뒤 88.5%였다. 국내 분석 솔루션 업체 HEARTCOUNT가 2026년 4월 공개한 측정은 보험 벤치마크 데이터 43문항을 GPT-5.3으로 5회씩 풀게 했고, 엄격 일치 기준 정확도가 text-to-SQL 35.3%, 시맨틱 레이어 76.3%였다.
정답률과 별도로 확인할 항목이 오답이 나올 때의 동작이다. dbt Labs가 2026년 4월 공개한 벤치마크는 보험 데이터 11문항을 모델별로 20회씩 돌렸다. 시맨틱 레이어 방식은 정의된 범위 안에서 98.2%(Claude Sonnet 4.6)와 100%(GPT-5.3 Codex)를 맞혔고, 범위 밖 질문에는 값을 만들지 않고 오류를 돌려줬다(정답률 0%). 같은 데이터에서 자유 생성 방식은 90.0%와 84.1%를 맞혔지만, 범위라는 개념이 없어 틀릴 때도 그럴듯한 숫자를 돌려준다. 기성 금액이나 게이트 판정에서 틀린 숫자는 그대로 보고서에 올라간다.
답과 함께 근거를 낸다
실사용에서는 답을 검증할 수 있느냐가 또 하나의 조건이다. 답변 항목에서 원본 BP 레코드나 3D 모델 객체로 바로 이동할 수 있어야 하고, 데이터가 답을 뒷받침하지 못할 때는 그 사실을 함께 내야 한다. 서브시스템 태그 160개 중 12개만 IWP에 연결돼 있다면 12개 기준의 진척률과 함께 나머지는 이 경로로 판단할 수 없다는 내용을 같이 내보낸다.
오라클은 2026년 4월 14일 자본 프로젝트용 AI 기능을 발표하면서 에이전트에 데이터 자동화 권한을 주되 감사추적을 남긴다는 점을 발표문에 넣었다. 다만 Primavera Unifier 릴리스 26 공식 문서 기준으로 탑재된 AI 기능은 시각화용 콘텐츠 추천, 기성 청구 레코드 작성 보조, 요약, 태스크 어시스트 네 가지이고 자연어 질의는 없다. 클라우드 전용이며 지원 지역은 미국과 사우디아라비아이고 한국은 목록에 없다. 자연어 질의 계층은 구축사가 따로 만들어야 한다.
얹기 전에 확인할 데이터
먼저 시스템 간 조인 키의 값 일치율을 잰다. Unifier BP의 CWP 번호와 P6 액티비티 코드가 실제로 몇 % 매칭되는지 숫자로 센다. 코드 체계 설계 자체는 마스터코드 표준화 글에서 다뤘다. 다음으로 자주 쓰는 조인 경로를 문서로 남긴다. 외래키가 없는 환경에서는 이 문서가 그대로 시맨틱 레이어의 초안이 된다. 마지막으로 컬럼 약어의 업무 용어 사전을 만든다. 이 작업을 에이전트 구축과 같이 진행하면 정확도가 낮게 나왔을 때 원인이 데이터인지 설계인지 분리되지 않는다.
정확도는 고객 데이터로 잰다
벤더나 구축사가 제시하는 정확도는 그쪽 시연 데이터 기준이고, 위에 인용한 측정도 보험·소매·대학 DW에서 나온 값이다. 착수 때 현업이 실제로 던지는 질문을 목록으로 만들고, 그 목록의 정답률을 고객사 데이터에서 기준선으로 재야 한다. 통과한 범위부터 운영에 올리고 나머지는 범위 밖이라고 답하게 둔다.
정리하면, 스키마 전체를 상대로 SQL을 자유 생성하는 방식은 기업 DW 조건에서 10% 안팎으로 측정돼 있고, 조인 경로와 약어 사전을 먼저 정리해 검증된 질의에 질문을 연결하는 방식이 정확도와 오답 처리 양쪽에서 유리하다.
· Chen 외, BEAVER: An Enterprise Benchmark for Text-to-SQL, arXiv 2409.02038 v3, 2026.5
· BIRD, Text-to-SQL Leaderboard (2026.9 기준)
· Rumiantsau·Fokeev (Cube), Semantic Layers for Reliable LLM-Powered Data Analytics, arXiv 2604.25149, 2026.4
· Cube, Why semantic layers make LLM analytics reliable, 2026.4
· dbt Labs, Semantic Layer vs. Text-to-SQL 벤치마크, 2026.4
· Microsoft ISE, LLM SQL Query Generation 측정, 2026.5
· HEARTCOUNT, 시맨틱 레이어 적용 전후 정확도 측정, 2026.4
· Oracle, Primavera Unifier 26 AI Features 문서
· Oracle, Oracle AI Enables More Connected, Compliant Capital Projects, 2026.4.14