데이터 빈곤(Data Poverty)이 현대사회의 새로운 불평등이 되는 이유
인터넷에 접속할 수 있고 스마트폰을 가지고 있다면 디지털 격차에서 벗어난 것일까요?
데이터 빈곤(Data Poverty)이 현대사회의 새로운 불평등이 되는 이유는 데이터에 접근하고 활용할 수 있는 능력이 경제·교육·복지의 기회와 연결되기 때문입니다.
데이터가 사회의 중요한 의사결정 자원이 된 지금은 그렇게 단순하게 판단하기 어렵습니다.
누군가는 자신의 행동과 생활에 관한 데이터가 끊임없이 만들어지고 서비스 개선에 활용됩니다. 반면 어떤 사람이나 지역은 데이터가 충분히 수집되지 않거나, 데이터가 존재하더라도 접근하거나 활용하기 어렵습니다.
AI가 행정·금융·의료·교육 등 다양한 영역의 판단에 활용될수록 이러한 차이는 더욱 중요해집니다.
이 글에서는 데이터 빈곤(Data Poverty)이 무엇인지, 기존의 디지털 격차와 무엇이 다른지, 그리고 AI 시대에 왜 새로운 불평등의 원인이 될 수 있는지를 살펴봅니다.
데이터 빈곤은 단순히 ‘데이터가 없는 상태’가 아니다
데이터 빈곤이라는 개념은 하나의 의미로만 사용되지는 않습니다.
초기의 연구에서는 인터넷 연결, 컴퓨터와 모바일 기기, 온라인 정보와 교육자료 등에 접근할 수 있는 능력의 국가 간 차이를 측정하는 개념으로 활용됐습니다. 실제로 연구자들은 인터넷 속도, 컴퓨터·인터넷 이용, 모바일 환경, 교육 여건 등을 활용한 Data Poverty Index를 제시하기도 했습니다.
하지만 오늘날 데이터 기반 사회에서는 문제의 범위가 더 넓어졌습니다.
단순히 데이터에 접근할 수 있는가뿐 아니라,
데이터를 생산할 수 있는가 → 데이터에 제대로 대표되고 있는가 → 데이터를 이해하고 활용할 수 있는가 → 그 데이터로 만들어진 결과의 혜택을 공정하게 받을 수 있는가
까지 살펴볼 필요가 있습니다.
따라서 데이터 빈곤을 이해할 때는 ‘데이터의 양’만 보는 것보다 데이터 사회에 참여할 수 있는 능력과 대표성의 격차를 함께 보는 것이 중요합니다.
기존 디지털 격차와 무엇이 다를까?
전통적인 디지털 격차가 주로 인터넷이나 기기에 대한 접근 문제에서 출발했다면 데이터 불평등은 그 다음 단계에서 발생할 수 있습니다.
| 구분 | 전통적 디지털 격차 | 데이터 빈곤·데이터 불평등 |
|---|---|---|
| 핵심 질문 | 인터넷·기기를 사용할 수 있는가? | 데이터 사회에 제대로 참여하고 있는가? |
| 주요 문제 | 기기, 통신망, 비용 | 데이터 접근·대표성·활용 능력 |
| 개인에게 미치는 영향 | 디지털 서비스 이용 제한 | 데이터 기반 판단에서 불리해질 가능성 |
| AI 시대의 의미 | AI 서비스에 접근하기 어려움 | AI가 특정 집단을 제대로 이해하지 못할 가능성 |
둘은 서로 분리된 문제가 아닙니다.
인터넷 이용이 어려운 사람은 온라인 활동을 통해 만들어지는 데이터에서도 상대적으로 덜 나타날 수 있기 때문입니다.
OECD도 AI를 활용하는 디지털 정부를 분석하면서 인터넷에 접근하지 못하는 사람들이 알고리즘 개발에 사용되는 데이터에서 빠질 수 있으며, 대표성이 부족한 데이터가 정책과 서비스 제공에 영향을 줄 수 있다고 지적합니다.
데이터에 접근하고 활용할 기회의 차이는 정보 접근권과 디지털 기본권의 문제와도 밀접하게 연결됩니다.
보이지 않는 사람이 생기는 과정
데이터 빈곤의 핵심을 이해하기 위해 한 사람을 생각해보겠습니다.
온라인 쇼핑을 자주 하고, 모바일 결제를 사용하고, 지도 앱으로 이동하며, 각종 플랫폼을 사용하는 사람은 일상생활에서 많은 디지털 흔적을 남깁니다.
반대로 현금 결제를 주로 하고, 온라인 서비스를 거의 사용하지 않으며, 디지털 행정서비스에도 접근하기 어려운 사람은 상대적으로 적은 디지털 흔적을 남길 수 있습니다.
문제는 여기서 끝나지 않습니다.
기업이나 공공기관이 온라인에서 수집된 데이터를 이용해 새로운 서비스를 설계한다면 데이터가 풍부한 사람들의 행동은 잘 보이지만 데이터가 부족한 사람들의 생활은 상대적으로 잘 보이지 않을 수 있습니다.
이것을 다음과 같은 과정으로 이해할 수 있습니다.
디지털 접근 차이
→ 데이터 생성량의 차이
→ 데이터 대표성의 차이
→ 분석 결과의 차이
→ 서비스와 의사결정 결과의 차이
따라서 데이터 빈곤은 단순히 정보를 적게 가진 문제가 아니라 데이터 기반 사회에서 자신의 현실이 충분히 반영되지 않을 가능성과 연결됩니다.
AI가 확산될수록 데이터 빈곤이 중요한 이유
AI는 데이터에서 패턴을 학습합니다.
따라서 학습이나 의사결정에 사용되는 데이터가 특정 집단이나 환경을 충분히 포함하지 못하면 AI의 결과 역시 모든 사람에게 동일한 정확도를 보장하기 어려울 수 있습니다.
UNESCO 역시 AI 시스템에서 데이터 수집 과정에서 배제되는 ‘data-invisible groups’ 문제와 알고리즘 편향·불평등의 위험을 다루고 있습니다.
여기서 중요한 것은 AI 자체가 자동으로 불평등을 만든다고 단정하는 것이 아닙니다.
AI가 어떤 데이터를 기반으로 만들어졌는지, 그 데이터에 누가 충분히 포함되어 있고 누가 부족하게 포함되어 있는지를 함께 살펴봐야 한다는 것입니다.
데이터가 부족하면 생길 수 있는 문제
예를 들어 AI 기반 서비스를 만든다고 가정해보겠습니다.
데이터가 특정 연령대나 지역에 지나치게 집중되어 있다면 다른 이용자에게도 동일한 수준으로 작동할 것이라고 보장하기 어렵습니다.
따라서 AI 시대의 데이터 품질을 평가할 때는 단순히 데이터가 얼마나 많은가보다
누구의 데이터인가,
어떤 환경에서 수집됐는가,
누가 빠져 있는가
라는 질문이 중요해집니다.
의료에서 데이터 빈곤이 특히 중요한 이유
의료 분야는 데이터 대표성 문제가 실제 결과와 직접 연결될 수 있는 대표적인 영역입니다.
2023년 PLOS Digital Health에 발표된 연구 리뷰는 health data poverty를 특정 집단이 생성되는 의료 데이터에서 충분히 대표되지 않는 문제로 설명하면서, 편향된 데이터가 기존 건강 격차를 확대할 가능성을 분석했습니다.
예를 들어 특정 인구집단의 의료 데이터가 충분하지 않다면 그 데이터를 이용해 개발된 모델이 해당 집단에서도 동일한 성능을 보이는지 별도로 확인해야 합니다.
따라서 의료 AI에서 중요한 것은 데이터의 규모만이 아닙니다.
데이터가 많다는 것과 데이터가 다양한 사람을 제대로 대표한다는 것은 같은 의미가 아닙니다.
이 차이가 데이터 빈곤을 이해하는 핵심 중 하나입니다.
데이터 빈곤은 어디에서 나타날 수 있을까?
데이터 불평등은 특정 산업에만 존재하지 않습니다.
| 영역 | 데이터가 부족하거나 편중될 경우 생각해볼 문제 |
|---|---|
| 의료 | 특정 환자집단이 충분히 대표되는가 |
| 금융 | 디지털 거래 이력이 적은 사람을 어떻게 평가하는가 |
| 행정 | 온라인 이용자의 행동만으로 정책 수요를 판단하지 않는가 |
| 교통 | 특정 지역의 이동 데이터가 충분한가 |
| 교육 | 온라인 학습 데이터가 모든 학생의 환경을 대표하는가 |
| AI | 학습 데이터에서 특정 언어·지역·집단이 부족하지 않은가 |
특히 언어 문제도 중요합니다.
OECD는 AI와 관련된 데이터 격차를 설명하면서 언어의 과소대표 문제도 함께 지적하고 있습니다.
결국 데이터 빈곤은 소득이나 기기 보유 여부만으로 설명하기 어려운 다층적인 디지털 불평등입니다.
디지털 접근과 활용 수준의 격차는 한국지능정보사회진흥원의 디지털정보격차 실태조사에서도 지속적으로 조사되고 있습니다.
데이터가 많으면 데이터 빈곤은 해결될까?
그렇지 않습니다.
데이터를 무조건 많이 수집하는 것이 해결책이라면 개인정보 보호라는 또 다른 문제가 발생합니다.
데이터에서 잘 보이지 않는 사람을 포함시키기 위해 개인정보를 무제한으로 수집해야 한다는 결론으로 이어져서는 안 됩니다.
오히려 중요한 것은 필요한 데이터를 정당한 방식으로 수집하면서 개인정보를 보호하고, 데이터의 대표성과 품질을 점검하는 것입니다.
UNESCO가 최근 데이터 거버넌스를 설명하면서 강조하는 것도 데이터의 가치뿐 아니라 형평성, 신뢰, 위험과 피해 최소화를 함께 고려하는 접근입니다.
따라서 데이터 빈곤 문제에는 서로 다른 두 가지 가치가 동시에 존재합니다.
데이터에서 배제되지 않을 권리와
불필요하게 데이터화되지 않을 권리입니다.
좋은 데이터 정책은 둘 중 하나를 포기하는 것이 아니라 두 가치를 함께 고려해야 합니다.
한국에서도 ‘데이터 불평등’ 논의가 시작되고 있다
데이터 불평등은 해외에서만 논의되는 개념이 아닙니다.
2024년 한국지능정보사회진흥원의 학술지 정보화정책에 게재된 연구에서는 데이터 기반 사회에서 발생하는 불평등을 데이터 활용 능력, 데이터 관리, 데이터 활용 결과 등의 차원에서 분석했습니다. 연구는 디지털 기기 접근성을 중심으로 논의해온 기존 정보격차에서 한 단계 더 나아가 데이터에 의해 발생할 수 있는 새로운 불평등을 살펴볼 필요성을 제시합니다.
이 관점에서 보면 앞으로의 디지털 격차 정책 역시 단순한 기기 보급이나 인터넷 연결만으로 충분하지 않을 수 있습니다.
사람들이 데이터 기반 사회에서 어떻게 기록되고, 어떻게 분석되며, 그 결과로 어떤 기회와 서비스를 받는지까지 살펴봐야 하기 때문입니다.
데이터 빈곤을 줄이기 위해 필요한 네 가지 질문
데이터 기반 서비스를 설계하거나 정책을 만들 때 다음 네 가지를 점검할 필요가 있습니다.
첫째, 누가 데이터에서 빠져 있는가?
전체 데이터의 양보다 특정 연령·지역·소득·언어 집단이 과소대표되고 있지는 않은지 확인해야 합니다.
둘째, 데이터에 접근할 수 있는가?
데이터가 존재해도 특정 기업이나 기관만 이용할 수 있다면 활용 기회의 격차가 생길 수 있습니다.
셋째, 데이터를 활용할 능력이 있는가?
데이터를 보유하는 것과 분석하고 의미를 찾아내는 것은 다른 문제입니다. 조직·지역·개인의 데이터 역량 차이도 새로운 격차를 만들 수 있습니다.
넷째, 데이터로 만들어진 결과를 검증할 수 있는가?
알고리즘이나 데이터 기반 의사결정이 특정 집단에 지속적으로 불리하게 작동하지 않는지 확인할 수 있는 장치가 필요합니다.
이 네 질문은 데이터 빈곤을 단순한 기술 문제가 아니라 접근성·대표성·역량·책임의 문제로 바라보게 해줍니다.
디지털 격차의 다음 단계는 ‘데이터 격차’일 수 있다
인터넷이 보급되기 시작했을 때 디지털 격차의 핵심 질문은 “누가 인터넷에 접속할 수 있는가?”였습니다.
스마트폰이 일상화되면서 질문은 “누가 디지털 서비스를 제대로 사용할 수 있는가?”로 확장됐습니다.
AI와 데이터 기반 의사결정이 확대되는 지금은 여기에 새로운 질문이 추가되고 있습니다.
“누가 데이터에 제대로 나타나고 있으며, 누가 데이터의 혜택에서 제외되고 있는가?”
데이터 빈곤은 단순히 데이터가 적다는 의미가 아닙니다.
데이터를 만들고, 접근하고, 이해하고, 활용하고, 데이터 기반 시스템에 적절하게 대표될 수 있는 기회의 차이가 새로운 불평등으로 이어질 수 있다는 문제입니다.
따라서 AI 시대의 디지털 포용은 인터넷과 기기를 제공하는 데서 끝나지 않습니다.
데이터가 누구를 보여주고 있으며 누구를 보이지 않게 만드는지까지 살펴보는 것.
그것이 데이터 기반 사회에서 디지털 격차를 바라보는 다음 단계입니다.
참고자료
UNESCO, 데이터 거버넌스 및 data-invisible groups 관련 자료
한국지능정보사회진흥원 「정보화정책」, 「데이터 기반 사회에서 데이터 불평등 개념의 탐색적 논의: 공공과 민간의 데이터 불평등 사례를 중심으로」
OECD, Governing with Artificial Intelligence — AI와 데이터 격차 관련 내용
Leidig & Teeuw, Quantifying and Mapping Global Data Poverty, PLOS ONE
Paik et al., Health data poverty amplifies existing health disparities, PLOS Digital Health
댓글 0
첫 댓글을 남겨보세요.