[송하주의 AI 톡] AI의 고삐를 누가 쥘 것인가

  • 가
부산닷컴 기사퍼가기

부경대 컴퓨터·인공지능공학부 교수 한국정보과학회 데이터소사이어티 회장

과제 해결 방법까지 판단하는 AI
시험장 탈출해 답지 찾아내는 격
성능 뿐 아니라 안전도 투자해야

최근 주요 AI 기업 대표들이 잇따라 인공지능의 위험을 경고하고 있다. 엔트로픽의 CEO 다리오 아모데이는 AI의 성능 개선 속도를 조절해 AI 안전 기술과 평가 체계가 따라갈 시간을 확보해야 한다고 주장한다. 지금처럼 성능 경쟁에만 몰두하다가는 어느 순간 AI가 고삐 풀린 망아지처럼 인간이 통제하기 어려운 존재가 될 수 있다는 우려다.

영화 터미네이터의 스카이넷처럼 AI가 갑자기 인간을 적으로 규정하고 인류 말살에 나서는 장면까지 상상할 필요는 없다. 현재 논의되는 위험은 훨씬 현실적이다. 자율성이 높은 AI가 인간의 의도와 다른 방식으로 목표를 수행하면서 사이버 공격, 기만, 무기 활용, 생물학적 위험과 같은 심각한 결과를 초래할 가능성이다. 특히 주목할 변화는 AI 기술을 개발하는 과정에도 AI가 이용되고 있다는 점이다. 프로그램 작성과 오류 수정은 물론 알고리즘 탐색과 실험 설계에도 AI가 활용된다. 이 과정에서 AI의 역할이 늘수록 인간의 개입은 점차 줄어든다. 문제는 AI가 스스로 성능을 개선하는 과정이 반복되고 인간이 그 과정을 충분히 이해하거나 감독하기 어려워질 때다. AI가 인간에게 악의를 품어서가 아니다. 주어진 목표를 가장 효율적으로 달성하는 과정에서 인간의 의도나 안전을 중요하게 고려하지 않을 가능성이 문제다. 심지어 인간의 개입이 목표 달성을 방해한다고 판단한다면 이를 피하려는 행동이 나타날 수도 있다.

이 같은 경고를 바라보는 시선은 다양하다. AI의 위험을 진지하게 받아들이고 기술개발 속도를 조절해야 한다는 의견이 있는 반면, AI 기업들이 자신들의 기술이 그만큼 강력하다는 점을 홍보하기 위한 메시지라는 비판도 있다. 또 다른 한편에서는 향후 AI로 인한 문제가 발생했을 때 기업의 책임을 줄이기 위한 사전 포석이라는 해석도 있다. 어느 한쪽으로 단정하기는 어렵지만 분명한 것은 지난해까지만 해도 AI가 장차 인류의 생존을 위협할 수 있다는 막연한 가설적 논의가 중심이었다면, 올해는 AI의 사이버보안 문제나 무기 조작 능력, AI 연구 자동화 등이 현실적인 문제로 등장하고 있다는 것이다. 여기에는 지난해 말부터 등장한 AI 에이전트 기술의 영향이 크다. 챗봇은 사람이 질문하면 답을 생성하는 것이 주된 기능인 반면 AI 에이전트는 목표를 전달받으면 스스로 계획을 세우고, 필요한 프로그램을 실행하거나 외부 시스템을 이용해 실제 일을 수행한다. 한마디로 말하는 AI에서 행동하는 AI로 발전한 것이다. 문제는 행동하는 AI에게 얼마나 많은 권한을 부여할 것인가에 있다. 에이전트가 파일과 네트워크, 서버, 외부 서비스에 자유롭게 접근할 수 있다면 작은 오판도 실제 피해로 이어질 수 있다. 주어진 목표를 지나치게 충실하게 수행하다가 사람이 의도하지 않은 방법을 선택할 가능성도 있다.

이와 관련한 대표적인 사례는 지난 7월 챗GPT를 개발한 오픈AI가 공개한 것으로 오픈AI의 LLM이 테스트 환경을 벗어나 허깅 페이스 서비스에 침투한 것이다. 허깅 페이스는 AI 모델, 데이터 세트, 앱을 공유하고 배포하는 오픈소스 플랫폼으로 수많은 AI 연구자와 기업이 이용하는 사이트이다. 오픈AI는 애초 보안을 위해 인터넷과는 격리된 내부 네트워크 환경에서 테스트를 진행하였다. 하지만, LLM은 테스트 환경의 취약점을 스스로 찾아내서 격리된 환경을 뚫고 인터넷에 접속하였다. 그런 다음 허깅 페이스에 정답이나 힌트가 있을 것이라고 추론하고 서비스에 침투를 시도한 것이다. AI가 시험장을 탈출해 정답지가 보관된 장소를 찾아간 셈으로 비유되는 사건으로 목표를 달성하기 위한 예상 밖의 수단은 모두 AI가 선택한 것이다.

그러면 AI 개발의 속도를 늦추는 것이 가능한 것인가. AI 기술 패권을 추구하는 미국의 입장에서는 경쟁국인 중국이 계속 추격하는 상황에서 자국 기업들만 속도를 늦추기는 어렵다. AI 분야는 기업 간 경쟁과 국가 간 기술 패권 경쟁이 동시에 진행되고 있기 때문이다. 결국 쉽지는 않겠지만 기술 발전의 속도를 늦추지 않으면서도 통제력을 놓치지 않도록 해야 할 것이다. 이러한 문제를 다루는 대표적인 연구 분야가 ‘AI 정렬(AI Alignment)’이다. AI의 목표와 행동이 인간의 의도와 가치, 안전에 부합하도록 만드는 것이다. AI가 아무리 뛰어난 능력을 갖추더라도 인간이 원하는 방향과 다르게 행동한다면 그 능력은 오히려 위험이 될 수 있기 때문이다. 성능 평가만큼 안전 평가에 투자하고, 평가 환경 자체의 허점도 점검해야 한다. 전문가마다 위험을 보는 시각은 다르지만, 통제 장치를 미리 갖추는 비용은 통제를 잃은 뒤의 비용보다 훨씬 작다. 가장 똑똑한 AI를 만드는 것만이 능사는 아니다. 전지전능을 향해 달리는 AI의 고삐를 끝까지 인간이 쥐도록 하는 일이 무엇보다 중요하다.


당신을 위한 추천 기사