CAPTCHA가 구글 AI를 몰래 학습시키고 있을까? 현재 알려진 사실

작성자
KOMCHAD
작성자KOMCHAD
KOMCHAD นำเสนอข่าวไอที AI สมาร์ตโฟน Gadget คอมพิวเตอร์ ความปลอดภัยไซเบอร์ และนวัตกรรมล่าสุดในภาษาไทย

CAPTCHA가 구글 AI를 몰래 학습시키고 있을까? 현재 알려진 사실

인터넷을 이용하다 보면 한 번쯤은 **CAPTCHA**를 마주하게 됩니다. 웹사이트에 접속하기 전 신호등, 자전거, 버스, 횡단보도가 있는 이미지를 모두 선택하며 “나는 사람이 맞다”는 것을 증명하는 과정입니다.

겉보기에는 단순한 봇 차단 기술처럼 보이지만, 최근 몇 달 사이 이 시스템을 둘러싼 논쟁이 다시 뜨거워지고 있습니다. 많은 이용자가 **”우리가 CAPTCHA를 푸는 과정이 사실은 구글의 AI를 학습시키는 데 사용되는 것이 아니냐”**는 의문을 제기하고 있기 때문입니다.

논란은 Google이 **reCAPTCHA**의 개인정보 처리 정책을 변경하고, 초기 reCAPTCHA의 설계 목적이 다시 주목받으면서 더욱 커졌습니다. Google은 현재 **최신 reCAPTCHA는 사용자의 이미지 선택 결과를 AI 학습에 활용하지 않는다**고 설명하고 있지만, 전문가들은 “기술의 역사는 그보다 훨씬 복잡하다”고 말합니다.

reCAPTCHA는 처음부터 두 가지 목적을 가지고 있었다

2000년대 초 **루이스 폰 안(Luis von Ahn)** 이 개발한 reCAPTCHA는 단순히 자동화 프로그램을 막기 위한 기술만은 아니었습니다.

초기 버전에서는 OCR(광학문자인식)이 읽지 못하는 왜곡된 글자를 사람이 직접 입력하도록 했고, 이용자들은 자신도 모르는 사이 수많은 책과 신문의 디지털화 작업에 기여했습니다.

Google은 2009년 reCAPTCHA를 인수한 뒤 기능을 확장했습니다.

왜곡된 문자를 읽는 대신 사용자는 **버스, 신호등, 자전거, 상점, 횡단보도** 같은 사물을 식별하기 시작했고, 이렇게 축적된 **사람이 직접 라벨링한 이미지 데이터**는 머신러닝과 컴퓨터 비전 연구에서 매우 가치 있는 데이터셋이 됐습니다.

AI에게 사람의 라벨링이 중요한 이유

현대 AI는 막대한 양의 **정확하게 라벨링된 데이터**를 필요로 합니다.

예를 들어 수천 명의 사용자가 같은 이미지를 모두 “버스”나 “신호등”으로 인식한다면, 해당 이미지는 컴퓨터 비전 모델을 학습시키는 신뢰도 높은 데이터가 됩니다.

전문가들은 이러한 데이터가 특히 중요한 이유로 실제 환경의 복잡한 조건을 포함하고 있다는 점을 꼽습니다.

* 비가 오는 환경
* 안개
* 움직임으로 인한 흐림
* 일부가 가려진 사물
* 어두운 조명
* 특이한 촬영 각도

이러한 조건은 자율주행차와 시각 인식 AI가 반드시 학습해야 하는 대표적인 상황입니다.

Google은 실제로 CAPTCHA 데이터를 활용했을까?

결론부터 말하면 **그렇습니다. 다만 주로 초기 reCAPTCHA에서였습니다.**

Google은 오랫동안 CAPTCHA 응답이 머신러닝 시스템 개선에 도움이 된다는 사실을 공개적으로 인정해 왔습니다.

초기 reCAPTCHA 공식 사이트에는 다음과 같은 문구도 있었습니다.

> **”Stop a bot. Build a bot.”**
> (봇을 막고, 더 똑똑한 봇을 만든다.)

이 문구는 현재 삭제된 상태입니다.

Google에 따르면 **2018년 reCAPTCHA v3** 출시 이후 정책이 크게 바뀌었으며, 현재는 **이미지 CAPTCHA 응답을 AI 모델 학습에 사용하지 않고**, 주로 사기 탐지와 웹사이트 보안 강화를 위해 데이터를 처리한다고 설명합니다.

그런데도 전문가들이 의문을 제기하는 이유

Google은 최신 reCAPTCHA가 AI 학습에 사용되지 않는다고 밝히고 있지만, 연구자들은 여전히 몇 가지 의문이 남아 있다고 말합니다.

우선 많은 웹사이트가 아직도 **reCAPTCHA v3 이전 버전**을 사용하고 있습니다.

또한 과거 여러 학술 연구에서는 이미지 선택형 CAPTCHA가 Google의 컴퓨터 비전 연구에 활용할 수 있는 대규모 라벨링 데이터를 제공했다고 분석했습니다.

유럽의 개인정보 보호 규제기관 역시 사용자가 CAPTCHA를 통해 생성되는 데이터가 어떻게 처리되는지 충분히 이해하고 있는지에 대해 문제를 제기해 왔습니다.

Google의 개인정보 정책 변경도 논란을 키웠다

올해 Google은 reCAPTCHA 서비스에서 자신의 역할을 많은 기업 고객을 대상으로 **데이터 관리자(Data Controller)** 에서 **데이터 처리자(Data Processor)** 로 변경했습니다.

이에 따라 reCAPTCHA를 사용하는 웹사이트 운영자가 방문자 데이터 처리에 대한 책임을 더 많이 지게 되었으며, Google은 Google Cloud 계약에 따라 데이터를 처리하는 역할을 맡게 됐습니다.

개인정보 보호 전문가들은 이번 변경이 법적 책임을 명확히 했지만, 동시에 **투명성과 이용자 동의**를 둘러싼 논의를 다시 불러왔다고 평가합니다.

AI 발전으로 CAPTCHA의 역할도 줄어들고 있다

아이러니하게도 AI의 발전은 기존 CAPTCHA의 효과를 떨어뜨리고 있습니다.

최신 대규모 언어 모델과 컴퓨터 비전 시스템은 과거 자동화 프로그램이 어려워했던 이미지 기반 CAPTCHA를 상당한 수준까지 해결할 수 있게 됐습니다.

이에 따라 많은 웹사이트는 이미지를 고르게 하는 방식 대신 다음과 같은 **행동 기반 분석**으로 봇을 식별하는 방향으로 전환하고 있습니다.

* 마우스 움직임
* 브라우저 지문(Browser Fingerprinting)
* 타이핑 패턴
* 기기 신뢰도
* 위험도 점수(Risk Scoring)

사용자가 직접 이미지를 선택하지 않아도 봇 여부를 판단하는 방식이 점차 확산되고 있는 것입니다.

핵심은 CAPTCHA보다 데이터의 가치다

오늘날 CAPTCHA가 실제로 Google AI를 학습시키고 있는지와 별개로 분명한 사실이 하나 있습니다.

**사람이 직접 만든 라벨링 데이터는 현대 AI 발전의 핵심 기반이었다는 점입니다.**

초기의 reCAPTCHA는 머신러닝을 위한 귀중한 데이터셋 구축에 크게 기여했습니다. Google은 이러한 방식이 **reCAPTCHA v3** 이후 변경됐다고 설명하고 있지만, **투명성, 개인정보 보호, 이용자의 사전 동의**를 둘러싼 논의는 지금도 계속되고 있습니다.

AI가 더욱 발전함에 따라 전통적인 CAPTCHA는 점차 역사 속으로 사라질 가능성이 큽니다. 앞으로의 봇 차단 기술은 신호등이나 버스를 고르게 하는 방식보다, 사용자의 행동을 백그라운드에서 분석하는 형태로 진화할 것으로 전망됩니다. 그렇게 된다면 인터넷을 대표했던 CAPTCHA도 새로운 보안 기술에 자리를 내주게 될 것입니다.

이 글 공유
작성자KOMCHAD
Follow:
KOMCHAD นำเสนอข่าวไอที AI สมาร์ตโฟน Gadget คอมพิวเตอร์ ความปลอดภัยไซเบอร์ และนวัตกรรมล่าสุดในภาษาไทย
댓글 남기기