8편: 머신러닝의 부상, '스스로 학습하는 기계'의 개념
- 공유 링크 만들기
- X
- 이메일
- 기타 앱
인터넷의 폭발적인 보급으로 디지털 세상에 엄청난 데이터가 쌓이기 시작하자, 인공지능 학계는 수십 년간 자신들을 괴롭혔던 ‘지식 획득의 병목 현상’을 해결할 결정적인 실마리를 찾았습니다. 과거에는 사람이 일일이 규칙을 코딩해 주어야만 움직였던 기계가, 이제는 데이터 속에서 스스로 규칙을 찾아내는 방식으로 진화하기 시작한 것입니다. 이 거대한 패러다임의 전환을 우리는 ‘머신러닝(Machine Learning, 기계학습)’의 부상이라고 부릅니다.
처음 머신러닝의 개념을 접했을 때, 저는 이것이 기존의 컴퓨터 프로그래밍 방식과 무엇이 다른지 단번에 이해하기 어려웠습니다. 하지만 한 선배 개발자가 던진 명쾌한 비유 덕분에 무릎을 탁 쳤던 기억이 있습니다. 기존의 프로그래밍이 ‘원인과 규칙을 넣으면 결과가 나오는 방식’이었다면, 머신러닝은 ‘원인과 결과를 통째로 던져주면 컴퓨터가 규칙을 만들어내는 방식’이라는 점이었습니다.
예를 들어 이메일에서 스팸 메일을 걸러내는 프로그램을 만든다고 가정해 보겠습니다. 6편에서 다루었던 과거의 규칙 기반 시스템(Top-down) 방식에서는 사람이 직접 "메일 제목에 '광고', '최저가', '투자'라는 단어가 포함되면 스팸으로 분류하라"는 규칙을 일일이 코딩해야 했습니다.
문제는 스팸 메일을 보내는 사람들이 바보가 아니라는 점입니다. 그들은 금세 규칙을 피해 '광.고', '최/저/가' 같은 식으로 변칙적인 단어를 만들어 보냈고, 그때마다 사람은 또다시 새로운 규칙을 추가하는 끝없는 노동에 시달려야 했습니다. 규칙이 늘어날수록 시스템은 무거워졌고 서로 충돌했습니다.
머신러닝은 이 문제를 완전히 다른 각도에서 접근했습니다. 스팸 메일 5만 통과 정상 메일 5만 통을 기계에게 아무런 설명 없이 통째로 던져주는 것입니다. 그리고 "이건 스팸이고, 이건 정상이야"라는 답(Label)만 알려줍니다.
그러면 머신러닝 알고리즘은 데이터를 반복해서 읽으며 스스로 패턴을 학습합니다. "이상하게 스팸 메일에는 특정 단어 조합이나 특수문자 비율이 높네?", "발송 서버의 주소 패턴이 정상 메일과 다르구나" 하는 식으로, 인간이 미처 인지하지 못했던 미묘한 특징(Feature)과 규칙을 통계학적 기법으로 스스로 찾아내는 것입니다.
이 시기부터 인공지능 연구는 수학과 통계학의 옷을 입기 시작했습니다. 데이터를 분류하는 ‘의사결정나무(Decision Tree)’, 데이터 간의 상관관계를 선으로 표현하는 ‘선형 회귀(Linear Regression)’, 그리고 인간의 뇌 신경망을 본떠 만든 ‘인공신경망(Artificial Neural Network)’ 등 다양한 알고리즘이 실전 무대에 배치되었습니다.
제가 현장에서 머신러닝 모델을 처음 돌려보았을 때 가장 놀라웠던 점은, 제가 알려주지 않은 예외 상황까지도 컴퓨터가 꽤 높은 확률로 맞혀낸다는 사실이었습니다. 100% 완벽한 규칙은 아닐지라도, 통계적인 '확률'을 바탕으로 가장 정답에 가까운 결론을 도출해 내는 유연함을 보여준 것입니다. 드디어 AI가 딱딱한 장난감 세계를 벗어나, 매 순간 예외가 발생하는 현실 세계의 먼지를 털어내고 달릴 준비를 마친 셈입니다.
물론 초기 머신러닝에도 치명적인 한계는 존재했습니다. 컴퓨터가 스스로 규칙을 찾으려면, 인간이 데이터의 어떤 부분(특징)을 집중적으로 가야 하는지 미리 가이드를 주어야 했습니다. 고양이 사진을 판별할 때 "귀 모양과 눈동자 색상을 중점적으로 봐라" 하고 인간이 데이터를 정제(Feature Engineering)해 주어야만 성능이 나왔던 것입니다. 이 한계를 극복하기 위해 과학자들은 인간의 손길을 완전히 배제하고, 특징 추출까지 기계가 알아서 하는 더 깊고 거대한 신경망을 연구하기 시작했습니다.
[핵심 요약]
머신러닝은 사람이 직접 규칙을 코딩하는 방식에서 탈피하여, 컴퓨터가 데이터를 통해 스스로 규칙과 패턴을 찾아내는 기술입니다.
스팸 메일 필터링처럼 변칙적이고 복잡한 현실 세계의 문제를 통계학적 확률 모델을 통해 유연하게 해결하기 시작했습니다.
초기 머신러닝은 데이터에서 어떤 특징을 추출할지 인간이 직접 정제해 주어야 하는 한계가 있었으며, 이는 향후 딥러닝으로 진화하는 도화선이 됩니다.
[다음 편 예고]
머신러닝의 등장으로 한 단계 도약한 인공지능은, 인간의 뇌 신경망을 복잡하게 모방하는 과정에서 다시 한번 커다란 벽에 부딪힙니다. 다음 편에서는 모두가 불가능하다고 고개를 저을 때, 묵묵히 연구를 이어가며 반전의 서막을 열었던 제프리 힌튼 교수와 인공신경망의 부활 이야기를 다루어 보겠습니다.
- 공유 링크 만들기
- X
- 이메일
- 기타 앱
댓글
댓글 쓰기