개인정보 위원회 의결

결정 심의ㆍ의결 이유 Ⅰ

핵심 요약

요지

신청인 : 에 대하여 별지와 같이 개인정보 처리 실태의 개선을 권고한다.

결정

심의ㆍ의결

이유

Ⅰ. 기초 사실Large Language Model 관련 사업자(이하 '피심인’)는 생성형 대규모 언어모델(Large Language Model, 이하 'LLM’) 개발 및 이에 기반한 서비스를 제공하기 위해 정보주체의 개인정보를 처리하고 있는 「개인정보 보호법」(이하 '보호법’)에 따른 개인정보처리자로서 일반현황은 다음과 같다.

Ⅱ. 실태점검 결과1. 개요초거대ㆍ생성형 인공지능(이하 'AI’)의 급속 확산으로 프라이버시 침해 우려가 증대됨에 따라, 주요 AI 서비스에 대한 신속한 실태점검 및 취약점 개선을 실시하여 이용자 불안의 조기 해소와 안전한 서비스 활성화에 기여하기 위해 국내ㆍ외 주요 AI 서비스를 제공하는 LLM 관련 사업자와, 서비스(B2CㆍB2B) 사업자 그룹으로 나누고 전자는 학습 과정, 후자는 개인정보 처리 과정을 중점 점검하였다.(각주:LLM 및 LLM 기반 서비스에 대한 것을 우선 심의ㆍ의결함) 보호법상 사전 실태점검 방식(선제적, 시정ㆍ개선 권고 갈음)으로 진행하였으며, 개인정보 처리방침(약관 포함) 분석 및 실제 가입ㆍ이용을 비롯해, 자료제출 요구 및 국내 사업자의 경우 현장 방문을 병행하였다.그 결과, 사업자들은 LLM 개발 및 이를 기반으로 한 AI 서비스를 개발ㆍ제공함에 있어 개인정보 처리방침을 별도 또는 공통으로 수립, 마스킹 등 데이터 전처리 및 정보주체의 통제권 보장 등 보호법상 기본적 요건을 전반적으로 충족하고 있으나, AI 서비스, 특히 LLM의 속성인 개인정보가 포함된 대규모 데이터 학습, 비가역성 등을 고려할 때, 투명성 및 접근성을 지속적으로 제고할 필요성이 확인되었다.2. LLM 및 AI 서비스 현황가.

주요 AI 서비스 제공 유형LLM 개발사업자는 LLM 및 LLM 기반 서비스를 개발하여 이용자를 대상으로 직접 AI 서비스를 제공하거나, LLM을 배포하여 기업이 AI 서비스를 개발할 수 있는 환경을 제공하며, AI 서비스 사업자는 배포된 LLM을 연동 또는 미세 조정(fine-tuning)하여 AI 서비스를 개발 제공한다.

나. AI 모델 학습의 특징 및 학습데이터에 포함된 개인정보AI 모델 학습은 입력이 주어졌을 때, 정답(다음 토큰)을 잘 찾도록 모델을 업데이트하는 것을 의미하고, 사전학습(pre-training) 단계에서 다량의 문서 '암기’를 통해 글을 이해하고 문장을 생성하는 능력이 부여된다.그리고 모델은 반복적으로 다음 토큰(학습 결과 확률이 가장 높은 토큰 또는 특정 범위 내 샘플 등)을 선택해 나가는 과정으로 문장을 생성한다.현재 대부분의 언어모델은 트랜스포머(특히, auto-regressive 모델(각주:자기 자신을 입력으로 하여 자기 자신을 예측하는 모형) ) 알고리즘에 기반하며, 회사별로 전처리, 파라미터 수, 입력값 크기, 반복 횟수 등 세부 학습 방법에 차이가 존재한다.

LLM 개발사업자가 AI 모델 학습에 사용하는 데이터에는 인터넷상에 '공개된 데이터’ 및 이용자가 AI 서비스를 이용한 '이용자 데이터’가 있고, 그 외에도 라이선스 구매ㆍ제휴 방식을 통해 수집하는 도서, 뉴스, 논문, 코드, 연구데이터 등이 있다.공개된 데이터는 Common Crawl(각주:연구ㆍ분석을 목적으로 연구원, 기업, 개인에게 웹상의 데이터를 무료로 제공하는 미국의 비영리 조직(영어 : 45~46%, 러시아어 : 6.8%, 일본어 4.8%, 한국어 0.64% The AI Report 2022, NIA)) 등 공개된 데이터를 스크랩하는 사이트(각주:OpenWebText2, Stack Exchange, Ubuntu Irc, Hacker News 등) 에서 다운로드하거나 웹사이트(각주:Wikipedia, FreeLaw, DM Mathematics, GitHub 등 포함) 를 크롤링하여 수집하며, 한국어와 관련하여 국립국어원에서 공개한 '모두의 말뭉치’, 한국정보사회진흥원에서 운영하는 'AI Hub’에 공개된 데이터 및 블로그ㆍ카페 등에 전체 공개된 게시글을 수집한다.이와 같은 공개된 데이터 및 이용자 데이터에는 다수의 개인정보가 포함되어 있으며 공개된 데이터 일부를 분석(각주:특정 사업자가 수집한 Common Crawl 데이터( )를 그 특정 사업자의 기준으로 분석한 결과) 한 결과 520건의 개인정보를 확인하였고, 이용자가 AI 서비스에 입력한 데이터를 분석(각주:특정 AI 서비스 이용자의 질의ㆍ답변 을 해당 서비스 제공사업자의 기준으로 분석한 결과) 한 결과 질의응답 세트 개에서 850건의 개인정보를 확인하였다.

다. AI 모델 학습 과정의 개인정보 처리LLM 개발사업자는 수집된 데이터 원본을 개인정보 제거 없이 그대로 보관하고, 개인정보 제거 등 전처리한 학습데이터를 별도로 보관하는 경우도 있다.LLM 개발사업자는 학습데이터 전처리와 관련하여 학습데이터에서 개인정보 제거, 중복 및 저품질 문서 제거 등을 수행하고, 학습데이터의 문자열을 자동화된 프로그램을 이용하여 모델이 인식할 수 있는 최소단위인 토큰으로 분절(각주:모델 학습에 있어 토큰화(분절)는 사업자별 특화된 기술이며, 네이버의 경우 '한국어에 맞는 분절 기법’을 특화함) 및 정수화한다.(각주:예시) 안녕하세요 → (분절, Tokenization) 안녕, 하세요 → (정수화, Serialization) [3601, 2029]) 사업자는 AI 모델이 이용자의 부적절한 질문에 대한 답변을 거부하고, 개인정보 및 비윤리적인 답변 등을 하지 않도록 AI 모델을 미세조정(fine-tunning)하고, 부적절한 질문을 텍스트 유사도 기반으로 탐지하는 모델(판별기)을 별도 적용하여 AI 서비스의 입력 및 출력단계에서 개인정보 필터링 등을 수행한다.(각주:사업자에 따라 세부적인 조치의 범위에는 차이가 있음) 3. 사전 실태점검 결과가.

공개된 데이터에 포함된 개인정보의 처리LLM 개발사업자는 웹사이트 크롤링 데이터인 Common Crawl 등에서 데이터를 수집하고 있고, 별도의 웹크롤러 등을 도입하여 백과사전, 학술 사이트 등 웹사이트로부터 공개된 데이터로서의 학습데이터를 수집하고 있다.이러한 웹사이트에는 정보주체의 의사와 무관하게 공개(노출)된 개인정보가 다수 포함되어 있으며, AI 모델은 해당 개인정보를 답변으로 생성할 수 있다(각주:학습된 개인정보(이메일, 전화번호 등)를 답변으로 생성한 이슈 발생('23.11.30.)) .개인정보 노출 탐지ㆍ삭제 현황(각주:한국인터넷진흥원의 공공 및 민간 홈페이지 대상 개인정보 노출 및 불법유통 탐지현황) 통계에서 개인정보가 포함된 페이지는 2023년 기준으로 20,999개 페이지이고, 주민등록번호를 포함하여 다수 고유식별정보 등이 확인되며, 대부분 부주의로 개인정보 파일을 게시하거나, 게시글에 개인정보를 노출한 사례로 확인된다.한편, 이러한 공개된 데이터를 LLM에 학습할 때, 학습데이터에 포함된 개인정보는 필요 없다고 답변하며 제거 가능한(각주:보호법(§34조의2①)에 규정된 고유식별정보, 계좌정보, 신용카드정보 등을 학습데이터에서 마스킹하고, URLㆍ이메일ㆍ전화번호ㆍ사업자등록번호ㆍAIPㆍSSHㆍGPG keysㆍIDㆍIP 주소 등 마스킹하는 경우 존재) 개인정보 제거 등의 조치를 한 후 학습에 활용하는 사업자가 있는 반면에, 인터넷에 공개된 데이터를 처리하는 것에 보호법상 정당한 이익이 있으며, 개인정보 제거 시 오탐이 발생하여 다른 정보도 함께 삭제된다고 주장하며, 개인정보 관련 웹사이트를 수집 출처에서 제한하는 것 외에 공개된 데이터에서 개인정보를 제거하지 않는 사업자도 존재하였다.

나. 이용자 입력 데이터 등 개인정보의 처리AI 서비스에 이용자가 입력한 질문 및 답변 등 이용자 데이터에는 다수 개인정보가 포함될 수 있으며, LLM 개발사업자 등은 이를 LLM 학습 및 서비스 개선 등에 활용하기 위해 다수의 사람을 투입하는 인적 검토(각주:이용자가 입력한 데이터에 대한 LLM이 답변이 사업자가 의도한 기준에 부합하는지 등에 대하여 외주 또는 임시 고용한 인력 이 직접 검토하여 LLM의 미세조정(fine-tuning)에 활용함) 과정을 진행하고 있다.이용자 데이터를 LLM 학습 및 서비스 개선 등에 활용하는 법적 근거와 관련하여 동의를 받아 활용한다는 사업자가 있고, 계약 체결 및 이행 또는 정당한 이익을 근거로 활용하는 사업자도 있었으며, 해당 데이터를 LLM 학습 및 서비스 개선 등에 활용하지 않는 사업자 등 다양한 경우가 존재하였다.사의 경우 서비스 가입 시 인공지능 연구, 서비스 품질 개선 등 목적의 데이터 활용 동의를 받으나, 인적 검토 사실은 쉽게 찾아볼 수 없다.

사, 사(각주:사는 동의를 받았다고 주장하나, 제출된 내용은 계정 가입 시 필수동의 및 Opt-out 기능 제공이고, 이는 보호법 제15조 제1항에 따른 동의로 볼 수 없음) 및 사의 경우 계약 체결ㆍ이행, 정당한 이익 등을 주장하며, 이용자에게 거부권 제공 및 인적 검토 전 개인정보 제거 등 조치를 이행하고 있다.

또한, 인적 검토가 진행되는 것을 이용자가 질문을 입력하는 화면에서 바로 보일 수 있도록 공개하고 있는 사업자가 있고, 여러 단계에 걸쳐 링크를 찾아 들어가야 이를 알 수 있도록 한 사업자가 있었으며, 이러한 사실을 공개하지 않는 사업자도 있었다.

다. LLM 배포 후 이용과정에서 개인정보 등 침해 예방ㆍ대응 조치LLM 개발사업자는 LLM을 다른 기업들이 활용할 수 있도록 배포(각주:(BaseModel 공유) 여러 기업이 하나의 모델을 공유받아 Parameter-Efficient Fine-Tuning(PEFT)을 통해 일부 파라미터만 학습하므로, LLM 개발사업자가 하나의 모델만 수정(BaseModel 복제) 기업별로 모델이 복제되어 각각의 모델에 대해 수정) 하고 있는데, 동일 LLM이라도 'AI 서비스를 개발하는 플랫폼’ 또는 '이용자에게 제공되는 AI 서비스’에 따라 적용되는 안전조치가 다를 수 있으므로 개인정보 및 아동ㆍ민감정보에 대한 답변, 편향 등 침해 예방ㆍ대응 조치의 정도가 다를 수 있다.

또한, 사 모델에서 개인정보가 포함된 학습데이터 원본이 답변으로 생성된 취약점에 대해 사는 조치하였으나,사는 취약점이 공개된 2023년 11월경까지사의 AI 서비스 등에서 해당 문제가 그대로 재현(각주:사는 사의 BaseModel을 복제한 모델을 사 등에게 모델 공유방식으로 제공) 되었다.

이와 관련하여 사는 위원회 메일을 수신함에 따라 한국 AI 서비스를 조사하였고, 한국 기업에 해당 이슈가 발생하고 있다는 점을 발견하여 이를 해결하기 위해 조치를 안내하였고 이후 해당 문제는 해결되었다.라. AI 서비스 투명성 및 정보주체 권리 보장AI 서비스 제공사업자는 개인정보 처리방침, AI 정책, 기술문서, FAQ 등 다양한 문서를 통해 자신이 제공하는 AI 모델 및 서비스를 설명하고 있다.이에 따르면 AI 서비스는 공개된 데이터 등 AI 서비스를 위해 처리하는 정보, 인적 검토 및 AI 모델 학습 등 개인정보 처리 방법 및 목적, 보유 및 이용 기간 등이 통상의 서비스와는 다른 것으로 확인된다.AI 서비스 제공사업자들이 공개하고 있는 문서는 그 종류 및 내용 등에 차이가 있었고, 사업자에 따라 해당 문서를 보기 위해서는 여러 단계에 걸쳐 링크를 찾아가야 하는 등 접근하기가 어렵거나, 문서를 보더라도 AI 모델 학습 등과 관련한 구체적인 내용을 찾기 어려운 경우도 있었다.

또한, AI 서비스 이용자에게 서비스 개선을 위한 피드백을 받기만 하고 개인정보 침해 등 법적 문제에 대한 신고를 받는 기능이 없거나, 이용자가 아닌 정보주체로부터 신고를 받는 기능이 없는 등 정보주체의 권리 보장 방안이 미흡한 경우도 존재하였다.

마. 이용 연령제한 및 법정대리인 동의LLM 개발사업자는 AI 서비스의 이용 연령을 엄격히 제한하나, 동일한 모델을 기반으로 AI 서비스를 제공하는 사업자는 연령제한을 다르게 적용할 수 있다.실제 사와 사는 서비스 연령을 엄격히 제한(각주:사의 경우 14세 미만은 이용금지, 18세 미만은 부모 또는 법정대리인의 동의를 받아야 하며, 사의 경우 한국어 서비스일 시 18세 미만은 이용금지(미국 등 영어권에서는 이용 가능)) 하여 AI 서비스를 제공하고 있으나, 동일한 LLM 기반의 서비스를 제공하는 사 등은 AI 서비스에 이용 연령제한을 두고 있지 않다.또한, 가입 시 연령 확인 없이 14세 이상임을 선택(각주:사는 사전 실태점검이 진행되는 과정에서 연령을 기입ㆍ확인하는 방식으로 수정함) 하도록 하거나, 생년월일을 스스로 입력하도록 하는 경우, 본인확인 절차를 통해 연령을 확인하는 경우가 있었으며, 가입하지 않은 상태에서 연령 확인 없이 서비스를 제공하는 경우도 존재(각주:다만, 사의 경우 로그인하지 않으면 이용자가 입력한 대화를 저장하지 않고, 사는 사전 실태점검이 진행되는 과정에서 로그인하여야만 서비스를 이용할 수 있도록 수정함) 하였다.

Ⅲ. 위법성 판단1. 관련 법 규정보호법 제3조제1항은 “개인정보처리자는 개인정보의 처리 목적을 명확하게 하여야 하고 그 목적에 필요한 범위에서 최소한의 개인정보만을 적법하고 정당하게 수집하여야 한다.”라고 규정하고 있다. 또한 같은 조 제4항은 “개인정보처리자는 개인정보의 처리 방법 및 종류 등에 따라 정보주체의 권리가 침해받을 가능성과 그 위험 정도를 고려하여 개인정보를 안전하게 관리하여야 한다”, 제5항은 “개인정보처리자는 제30조에 따른 개인정보 처리방침 등 개인정보의 처리에 관한 사항을 공개하여야 하며, 열람청구권 등 정보주체의 권리를 보장하여야 한다.”, 제6항은 “개인정보처리자는 정보주체의 사생활 침해를 최소화하는 방법으로 개인정보를 처리하여야 한다.”, 제7항은 “개인정보처리자는 개인정보를 익명 또는 가명으로 처리하여도 개인정보 수집목적을 달성할 수 있는 경우 익명처리가 가능한 경우에는 익명에 의하여, 익명처리로 목적을 달성할 수 없는 경우에는 가명에 의하여 처리될 수 있도록 하여야 한다.”라고 규정하고 있다.보호법 제4조는 “정보주체는 자신의 개인정보 처리와 관련하여 다음 각 호의 권리를 가진다”라고 규정하면서 “개인정보의 처리에 관한 정보를 제공받을 권리(제1호)” 및 “개인정보의 처리로 인하여 발생한 피해를 신속하고 공정한 절차에 따라 구제받을 권리(제5호)”를 규정하고 있다.

2. 위법성 판단가. 이용자 입력 데이터 등 개인정보의 처리 관련피심인은 AI 모델이 정확한 답변을 하도록 이용자 질문에 대한 AI 모델의 답변을 다수의 사람을 투입하여 열람, 지속 검토 및 수정하는 등의 방법으로 데이터셋을 만들고 있으며, 이를 LLM의 미세조정 등 모델 학습 및 프롬프트 개선 등 서비스 개선에 활용하고 있다.그러나, 피심인은 이를 적극 고지하지 않아 이용자는 '인적 검토’ 사실 자체를 알기 어렵고, 이용자가 중요 개인정보 및 이메일 등 민감한 내용을 입력하거나, 식별자 및 개인정보 제거 등 조치 없이 해당 정보를 DB화할 경우, 사생활 침해로 이어질 수 있는 문제점이 있다.개인정보처리자는 정보주체의 사생활 침해를 최소화하는 방법으로 개인정보를 처리하여야 하고, 개인정보를 익명ㆍ가명처리하여도 개인정보 수집목적을 달성할 수 있는 경우 이를 익명에 의하여 또는 가명에 의하여 처리될 수 있도록 하여야 하며, 정보주체는 자신의 개인정보의 처리에 관한 정보를 제공받을 권리를 가진다.따라서 피심인은 이용자에게 인적 검토 사실을 명확히 고지하여 개인정보 및 민감한 내용을 입력하지 않도록 주의를 촉구하는 한편, 데이터 사용 여부에 대한 선택권을 보장하고, 인적 검토 전 식별자, 고유식별정보를 포함한 이름, 주소 등 제거 가능한 개인정보를 제거, 이러한 이용자의 선택권을 보장하기 위한 기능과 데이터를 제거 및 삭제할 수 있는 기능에 대한 접근성을 제고하는 한편, 주기적인 보호조치 안내 등을 강화할 필요성이 있다.나.

LLM 배포 후 이용과정에서 개인정보 등 침해 예방ㆍ대응 조치 관련LLM은 다른 기업들이 활용할 수 있도록 배포되고 있는바, 해당 LLM의 취약점 및 기업들의 서비스 제공 방식에 따라 예상치 못한 개인정보 침해가 발생할 수 있다.개인정보처리자는 보호법에 따라 개인정보의 처리 방법 및 종류 등에 따라 정보주체의 권리가 침해받을 가능성과 그 위험 정도를 고려하여 개인정보를 안전하게 관리하여야 한다.따라서, 개인정보 침해 관련 LLM의 취약점이 발견되는 경우, 신속히 보고받고 수정될 수 있도록 LLM 수정 및 재배포, 문의 창구 개설, 자신의 LLM을 사용하는 기업에 대한 취약점 조치방안 안내 프로세스 등을 마련할 필요가 있다.또한, 피심인은 자신의 LLM 기반 서비스에 적용하고 있는 안전조치가 해당 LLM을 배포 받아 사용하는 기업들도 쉽게 적용할 수 있도록 그 방안을 마련할 필요도 있을 것이다.다.

AI 서비스 투명성 및 정보주체 권리 보장 관련AI 서비스는 공개된 데이터 등 AI 서비스를 위해 처리하는 정보, 식별자 제거, 인적 검토 및 AI 모델 학습 등 개인정보 처리 방법 및 목적, 보유 및 이용 기간 등이 통상의 서비스와는 다르다.그러나 AI 서비스 제공사업자는 AI 서비스에서의 개인정보 처리에 관한 사항을 구체적으로 공개하지 않거나, 해당 사항에 대한 접근이 쉽지 않도록 서비스를 운영하는 경우가 있다.또한, 이용자 대상 AI 답변에 대한 피드백 기능만 제공하고, 개인정보 침해 등 문제에 대해 정보주체가 신고할 수 있는 기능을 제공하지 않는 경우가 존재하였다.개인정보처리자는 보호법에 따라 개인정보 처리방침 등 개인정보의 처리에 관한 사항을 공개하여야 하고, 정보주체는 개인정보의 처리 정지, 정정 등을 요구할 수 있으며, 개인정보의 처리로 인하여 발생한 피해를 신속하고 공정한 절차에 따라 구제받을 권리를 가진다.따라서, 사업자는 AI 서비스에서의 개인정보 처리와 관련하여 투명성 및 정보주체의 접근성 확보를 위해 AI 서비스에 적용되는 '개인정보 처리방침’ 등을 충실히 수립ㆍ공개하고, 서비스 이용자뿐만 아니라 정보주체의 개인정보 침해 등도 신고 접수 및 처리할 수 있는 창구를 마련할 필요가 있다.Ⅳ. 처분 및 결정보호위원회는 개인정보 보호를 위하여 필요하다고 인정하면 개인정보처리자에게 개인정보 처리 실태의 개선을 권고할 수 있는바, 피심인에 대해 별지와 같이 개인정보 처리 실태의 개선을 권고한다.Ⅴ. 결론피심인에 대하여 보호법 제61조(의견제시 및 개선권고) 제2항에 따라 개선권고를 주문과 같이 의결한다.이상과 같은 이유로 주문과 같이 의결한다.

출처: 국가법령정보 공동활용(law.go.kr) 공개 결정문·재결례. 원문 보기 · 본 문서는 참고용이며 법적 효력을 갖지 않습니다.