AI의 사실과 의견 구분이 이상할 때는 답변의 문장만 다시 읽지 말고 원문, 계산식, 판단 근거를 분리해 확인해야 합니다. 사람이 직접 승인할 부분과 AI에게 맡겨도 되는 부분을 나누는 실전 점검법을 소개합니다.
AI가 사실과 의견을 섞어 쓰는 이유
생성형 AI는 문장을 자연스럽게 이어 가는 데 강하지만, 문장마다 사실 여부를 판정하는 데이터베이스처럼 작동하지는 않습니다. 학습 과정에서 다음에 올 말을 예측하기 때문에 표현이 매끄럽다는 이유만으로 내용까지 맞다고 볼 수 없습니다.
OpenAI는 그럴듯하지만 사실이 아닌 내용을 자신 있게 만드는 현상을 환각이라고 설명합니다. 특히 질문이 모호하거나 자료가 부족할 때 AI가 빈칸을 “모르겠다”로 남기기보다 문맥상 자연스러운 내용을 채우면서 오류가 생길 수 있습니다. OpenAI의 설명을 읽을 때도 문장의 유창함과 사실성은 별개의 문제라는 점을 먼저 기억해야 합니다.
생성형 AI의 환각은 그럴듯하지만 사실이 아닌 내용을 자신 있게 만들어 내는 현상이며, 최신 모델에서도 완전히 사라지지 않음.
사실과 의견은 같은 방식으로 검사할 수 없습니다. “이 제도가 특정 날짜에 시행됐다”는 문장은 원문 자료와 대조할 수 있지만, “이 변화는 긍정적이다”는 문장은 평가 기준과 관점이 들어간 해석입니다.
따라서 AI의 분류가 이상하게 보이면 처음부터 정답을 맞혔는지 따지기보다 문장을 세 종류로 나누어 보십시오. 확인 가능한 사실, 계산으로 재현할 수 있는 결과, 관점에 따라 달라지는 의견을 구분하면 어디에서 사람이 개입해야 하는지 선명해집니다.
| 문장 유형 | 확인할 질문 | 사람의 처리 |
|---|---|---|
| 사실 주장 | 원문에 같은 내용이 있는가 | 출처 대조 |
| 계산 결과 | 같은 입력과 산식으로 재현되는가 | 독립 재계산 |
| 의견 또는 해석 | 어떤 기준과 전제를 사용했는가 | 근거와 관점 구분 |
| 예측 문장 | 미래를 단정하고 있지 않은가 | 불확실성 표시 |
이 표의 목적은 AI가 내린 분류를 그대로 믿는 것이 아닙니다. AI가 “사실”이라고 표시한 문장도 출처를 확인해야 하고, “의견”이라고 표시한 문장도 통계나 공식 자료를 근거로 삼았다면 그 근거의 정확성을 따로 살펴야 합니다.
사람이 다시 확인할 계산의 구조
계산 검토는 결과 숫자부터 보는 것보다 입력값과 산식을 원문에 연결하는 과정에서 시작합니다. 숫자 하나가 맞더라도 단위, 적용 범위, 기준 시점이 다르면 결론은 달라질 수 있습니다.
먼저 입력값을 그대로 옮겨 적습니다. 금액이라면 원 단위인지 천 원 단위인지, 비율이라면 전체를 기준으로 한 것인지 일부를 기준으로 한 것인지 표시하고, 기간이 붙어 있다면 어느 시점의 값인지 함께 적습니다.
다음으로 산식을 문장과 분리합니다. “전체 비용이 늘었다”라는 표현만 있을 때는 전체 비용이 무엇인지 알 수 없으므로, 항목별 합계인지 단가와 수량의 곱인지 먼저 밝혀야 합니다. 산식이 보이지 않는 계산은 결과가 맞아도 재현하기 어렵습니다.
이때 AI가 할인율을 수량에 먼저 적용했는지, 할인 전 합계에 적용했는지에 따라 결과가 달라집니다. 계산기를 다시 누르는 것만으로는 부족하고, 연산 순서가 원문이 말하는 조건과 일치하는지 확인해야 합니다.
계산 결과를 검증할 때는 같은 식을 그대로 복사해 다시 실행하지 않는 것이 좋습니다. 사람이 입력값을 별도로 정리해 직접 계산하거나 스프레드시트의 셀을 나누어 입력하면 AI가 만든 잘못된 산식을 함께 반복할 가능성을 줄일 수 있습니다.
역산도 유용합니다. 최종 금액에서 할인액을 더했을 때 원래 합계가 돌아오는지, 단가를 수량으로 나누었을 때 원문 단가와 일치하는지 확인하면 결과만 보고 지나치기 쉬운 오류를 찾을 수 있습니다.
반올림은 계산 오류처럼 보이지만 실제로는 적용 위치의 문제일 수 있습니다. 항목별로 반올림한 뒤 합산한 값과 전체 합계를 계산한 뒤 한 번 반올림한 값은 다를 수 있으므로, AI가 어느 단계에서 숫자를 줄였는지 문장에 표시하게 해야 합니다.
사실 판정과 의견 판정의 최종 승인
사실을 승인할 때는 문장과 출처가 일대일로 연결되는지 살펴보십시오. 한 문단 안에 여러 사실이 섞여 있다면 문장을 쪼개고, 각 문장 옆에 원문에서 확인한 범위를 적는 방식이 안전합니다.
NIST의 생성형 AI 프로파일은 출력물을 알려진 정답 데이터와 비교하고 사람의 감독과 자동 평가를 함께 활용하는 방식을 제시합니다. 개인이 글을 검토할 때도 이 원칙을 작게 적용해, 공식 문서나 원자료를 기준점으로 삼고 AI의 답변은 비교 대상에 두는 편이 좋습니다.
생성형 AI 출력은 알려진 정답 데이터와 비교하고, 사람의 검토와 자동 평가를 함께 활용하며, 여러 출처나 출처가 불명확한 정보에는 팩트체크 기법을 적용해야 함.
출처가 여러 곳으로 나뉘어 있을 때는 출처의 개수보다 내용의 역할을 구분해야 합니다. 하나의 문서는 숫자를, 다른 문서는 적용 조건을, 또 다른 문서는 예외를 설명할 수 있으므로 숫자만 맞춰 보고 조건을 빠뜨리면 결론이 달라집니다.
의견을 확인할 때는 참인지 거짓인지 묻기보다 누가 어떤 기준으로 판단했는지 질문해야 합니다. “효율적이다”라는 표현이 나오면 비용, 시간, 품질 중 무엇을 기준으로 한 평가인지 나누고, 그 기준이 원래 질문에 포함되어 있었는지 확인합니다.
AI가 의견을 사실처럼 바꿔 썼다면 표현을 낮추는 것만으로 해결되지 않습니다. “증가했다”와 “증가한 것으로 보인다”, “효과가 있다”와 “효과가 있을 수 있다”는 근거 수준이 다르므로, 실제 자료가 어느 표현까지 뒷받침하는지 다시 판단해야 합니다.
OpenAI Model Spec은 정보가 부족하거나 질문의 의도가 불명확할 때 불확실성을 표현하고 필요한 경우 설명을 요청하는 방향을 제시합니다. Model Spec의 취지를 사람의 검토에 적용하면, 답을 억지로 확정하기보다 “이 결론은 어떤 전제에서만 성립하는가”를 먼저 묻는 방식이 됩니다.
NIST AI 위험관리 프레임워크의 네 기능인 거버넌스, 맵, 측정, 관리는 개인 검토에도 참고가 됩니다. 누가 최종 승인할지 정하고, 어떤 위험이 있는지 분류한 다음, 오류를 측정하고, 허용할 수 없는 결과는 수정하거나 사용하지 않는 흐름입니다. 이 프레임워크는 자발적 사용을 전제로 하므로 법적 승인 절차로 오해해서는 안 됩니다.
마지막으로 최종 문장은 사실과 판단을 분리해 작성합니다. “원자료에는 무엇이 적혀 있는가”, “그 자료로 재현한 계산은 무엇인가”, “그 결과를 어떻게 해석하는가”를 각각 나누면 AI가 만든 결론을 사람이 검토했다는 흔적이 남습니다.
자주 묻는 질문 FAQ
Q1) AI가 사실이라고 분류한 문장은 그대로 사용해도 되나요?
그대로 사용하면 안 됩니다. 사실이라고 분류된 문장도 원문 자료에서 실제로 확인되는지 대조해야 하며, 숫자가 있다면 입력값과 산식을 따로 재현해야 합니다. AI의 분류는 검토 순서를 정하는 보조 수단으로 보고 최종 판단은 사람이 맡는 편이 안전합니다.
Q2) 계산 결과가 맞는데도 다시 계산해야 하나요?
결과가 우연히 맞더라도 입력값의 기준이나 연산 순서가 틀렸을 수 있으므로 다시 확인하는 것이 좋습니다. 특히 단위, 기간, 포함 항목, 반올림 위치가 바뀌면 같은 숫자를 사용해도 결론이 달라집니다. 독립적으로 입력값을 정리해 계산하고 역산까지 해 보면 이런 오류를 찾기 쉽습니다.
Q3) AI에게 자기 답변을 다시 검토해 달라고 하면 충분한가요?
AI에게 재검토를 요청하는 것은 누락을 찾는 보조 방법으로는 쓸 수 있지만 독립적인 검증을 대신하지는 못합니다. 같은 출처와 같은 잘못된 전제를 다시 사용하면 오류를 반복할 수 있기 때문입니다. 원문 대조와 사람의 계산을 별도로 진행한 뒤 AI에는 반대 사례나 빠진 조건을 찾도록 요청하는 방식이 더 유용합니다.