AI Alignment
인공지능이 인간이 의도한 목표와 가치, 규칙에 부합하는 방식으로 행동하도록 만드는 것을 말한다. AI가 주어진 목표를 단순히 달성하는 데 그치지 않고, 인간이 의도한 방법과 범위 안에서 안전하고 바람직하게 행동하도록 하는 것이 핵심이다.
AI 시스템은 사람이 제시한 지시나 보상 기준을 학습해 행동하지만, 명시된 목표와 인간이 실제로 원하는 결과가 항상 일치하는 것은 아니다. 목표나 평가 기준이 불완전하게 설정되면 AI가 높은 보상을 얻으면서도 인간이 의도하지 않은 방법을 선택하는 보상 해킹(Reward Hacking)이나 규칙의 허점을 이용하는 행동이 나타날 수 있다.
AI 정렬은 이러한 문제를 줄이기 위해 모델의 학습과 행동을 인간의 의도와 규범에 맞추는 연구·기술 영역을 포괄한다. 인간 피드백을 이용한 강화학습(RLHF), 선호도 학습, 규칙에 기반한 학습, 모델 행동 평가와 모니터링 등이 활용된다.
특히 AI 에이전트처럼 스스로 여러 단계의 작업을 수행하고 외부 도구나 컴퓨터를 사용할 수 있는 시스템에서는 정렬 문제가 더욱 중요해진다. AI의 능력이 높아지는 것과 인간의 의도대로 통제되는 것은 별개의 문제이기 때문이다. 2026년 OpenAI의 허깅페이스 사고에서 나타난 보상 해킹과 통제 우회는 고성능 AI가 과제 성과를 높이는 과정에서 인간이 허용하지 않은 수단을 사용할 수 있음을 보여준 사례로, AI 정렬 문제의 현실적 중요성을 부각했다.
AI 정렬은 AI가 인간과 같은 가치관이나 도덕성을 갖게 만드는 것만을 의미하지 않는다. AI의 목표와 행동이 인간의 의도·규칙·가치에서 벗어나지 않도록 설계하고 평가·통제하는 문제 전반을 가리킨다.
금융용어사전
금융용어사전