AI Hacking
인공지능을 이용해 사이버공격을 수행하거나, 인공지능 시스템의 취약점을 악용해 작동을 조작하고 정보·권한을 탈취하는 행위를 통틀어 이르는 말이다. 법령이나 국제표준으로 정립된 용어가 아니라 언론·업계에서 쓰는 통칭이다.
AI 해킹은 크게 두 가지 의미로 쓰인다. 첫째는 생성형 AI나 AI 에이전트를 공격 도구로 활용하는 'AI 활용 해킹'이다. 공격자는 AI로 피싱 문구와 악성코드를 만들고, 공격 대상 선정, 취약점 탐색, 비밀번호 공격, 침투 경로 분석 등을 자동화할 수 있다. 에이전틱 AI를 쓰면 표적 탐색부터 침투, 권한 확대, 정보 탈취까지 여러 단계를 연속으로 수행할 수도 있다. AI는 공격에 드는 시간과 비용을 줄이고 속도와 규모를 키우는 수단이다. 공격의 주체는 대체로 사람이고 AI는 도구이지만, 에이전틱 AI가 여러 단계를 자율적으로 수행할 수 있어서 AI가 어느 단계까지 주도했는지가 사안마다 쟁점이 된다.
2026년 9월 말부터 국내 은행·저축은행·캐피탈 등 금융회사에서 개인정보 유출이 잇따르면서 이 의미의 AI 해킹이 주목받았다. 여러 금융회사에서 동일한 공격자 IP가 발견됐고, 금융보안원은 공통 공격 IP 등에서 오픈소스 자율형 침투테스트 시스템 ARTEX의 흔적을 확인했다고 밝혔다. 경찰청 사이버수사국이 관련성을 조사 중이다. 공격은 핵심 금융거래 시스템이 아니라 대출모집인 조회서비스나 직원용 업무시스템처럼 상대적으로 관리가 소홀했던 외곽 시스템에 집중된 것으로 파악됐다. 다만 AI가 실제로 어떤 역할을 했는지와 공격 주체는 조사 결과가 나와야 확정된다.
둘째는 AI 모델이나 AI 기반 서비스를 직접 공격하는 'AI 시스템 해킹'이다. 악의적인 명령으로 모델의 안전장치를 우회하는 프롬프트 인젝션, 학습자료를 오염시키는 데이터·모델 포이즈닝, 모델이나 학습자료를 빼내는 모델 탈취, 조작된 입력으로 잘못된 판단을 유도하는 적대적 공격 등이 포함된다. 결제·메일·데이터베이스 등 외부 시스템에 접근할 수 있는 AI 에이전트가 공격받으면 잘못된 답변에 그치지 않고 정보 유출, 무단 송금, 파일 삭제, 악성코드 실행 등 실제 피해로 이어질 수 있다. 이에 따라 최소권한 부여, 중요 작업에 대한 사용자 승인, 입력·출력 검증, 접근기록 감시, 모델과 실행환경의 분리 등이 주요 대응책으로 제시된다.
AI 해킹은 사전 승인 아래 취약점을 찾는 침투테스트와 AI 레드티밍과 구별된다. 이들은 같은 기법을 쓰더라도 방어를 목적으로 하는 점검이다. ARTEX처럼 침투테스트용으로 공개된 도구가 공격에 악용될 수 있어, 방어와 공격 양쪽에 쓰이는 이중용도 기술이라는 점이 쟁점이다.
금융용어사전
금융용어사전