Reddit을 이용해 AI 검색을 조작하는 일은 너무 쉽다

2026.07.05

·

✦ guniq 시각

Reddit 댓글 한 줄, 단 13단어로 ChatGPT와 Gemini의 딥리서치 결과를 스캠 콘텐츠로 바꿀 수 있다는 코넬대 연구는 “AI 검색을 신뢰한다”는 전제 자체를 흔든다. 중소기업 입장에서 보면 이는 두 가지 현실이다. 첫째, 우리가 납품 업체·경쟁사·파트너를 AI로 조사할 때 그 결과가 이미 조작되어 있을 수 있다. 둘째, 반대로 우리 브랜드가 누군가의 저비용 허위 캠페인 타깃이 될 수 있다. 기술 패치를 기다리기 전에, AI 검색 결과를 ‘출력된 답이 아니라 가설’로 다루는 워크플로를 지금 당장 팀에 심어야 한다.

▲ 이미지 출처: GeekNews

Sponsored

2026년 5월, 코넬 테크(Cornell Tech)의 연구팀이 arXiv에 논문을 제출했다. 제목은 「딥리서치 에이전트는 사용자 생성 콘텐츠를 통해 중독될 수 있다(Deep-Research Agents Can Be Poisoned via User-Generated Content)」. 저자는 Tingwei Zhang, Harold Triedman, Vitaly Shmatikov다. 이 논문이 6월 말 대중 미디어에 알려지면서 AI 보안 커뮤니티에 조용하지만 선명한 충격이 번졌다. 핵심 메시지는 단순하다. Reddit 쓰기 권한만 있으면 ChatGPT나 Gemini의 딥리서치 결과를 원하는 방향으로 바꿀 수 있다.

딥리서치 에이전트란 무엇인가

OpenAI의 Deep Research, Google의 Gemini Deep Research 같은 서비스는 단순한 챗봇이 아니다. 이 시스템들은 한 번의 사용자 질의에 대해 수십 개의 하위 검색을 자율적으로 수행하고, 웹 페이지를 읽고 종합해 최종 보고서를 생성한다. 마케팅 문구대로라면 “일주일치 리서치를 10분에” 처리하는 도구다. 문제는 이 자율성이 취약점이기도 하다는 것이다. 에이전트가 수십 번의 관련 쿼리를 날리는 과정에서 Reddit, Wikipedia, Quora, Facebook 같은 사용자 생성 콘텐츠(UGC) 플랫폼의 글을 반복적으로 참조한다. Help Net Security가 정리한 연구 결과에 따르면, 오픈소스 딥리서치 시스템에서 수집되는 URL의 16.7%~23.4%가 UGC 사이트 출처였다.

WARP: 13단어로 작동하는 공격

연구팀이 명명한 공격 방식은 WARP(Web Agent Retrieval Poisoning)다. 이 공격은 세 단계로 구성된다. 첫째, 딥리서치 에이전트가 반복적으로 가져오는 Reddit 스레드나 Wikipedia 문서 등을 식별한다. 둘째, 해당 페이지에 짧은 조작 텍스트를 댓글이나 편집으로 추가한다. 셋째, 에이전트가 그 페이지를 다시 수집하면서 조작 텍스트를 신뢰할 만한 정보로 처리해 최종 보고서에 포함시킨다.

Triedman 연구원은 이를 두고 “공격 방식은 당신이 생각하는 것보다 훨씬 단순한 경우가 많다(The way that you can attack these systems is usually so much dumber than you think it is)”고 표현했다. 실제로 실험에서 검색 스니펫 수준의 텍스트 — 단 13단어 분량 — 를 조작 내용으로 사용했을 때, 해당 스니펫이 수집된 이후 AI 에이전트 출력에서 가짜 제품이나 서비스가 언급되는 비율이 38%~51%에 달했다. 복수의 페이지에 조작 내용이 분산되었을 때는 62%까지 올라갔다.

“a tiny snippet…just 13 words…of retrieved text on a UGC website like Reddit…can change AI agents to output spam / scam content”

— Harold Triedman, Cornell Tech (404 Media 인터뷰)

실험: 가짜 음식점부터 가짜 코인까지

연구팀은 실제 공격 효과를 측정하기 위해 가상의 시나리오를 설계했다. 한 실험에서는 “Sol Azteca”라는 허구의 음식점 이름을 특정 Reddit 스레드에 추가한 뒤, 딥리서치 에이전트에 해당 지역 맛집을 물었다. 결과: 기존 페이지 내용의 4% 미만을 차지하는 조작 텍스트만으로 에이전트가 Sol Azteca를 추천하는 비율이 30%~53%에 달했다. 또 다른 실험에서는 가상의 데이팅 앱 “SilverPath”를 Reddit 논의에 등장시켰고, 이번에도 유사한 추천 편향이 관찰됐다. 404 Media의 보도에 따르면, 암호화폐 스레드에 단 15단어를 심는 것만으로 AI 에이전트가 “BananaCoin”이라는 존재하지도 않는 코인을 실제 투자 대상으로 추천하고 자신이 참조한 조작 게시물을 출처로 인용하기까지 했다.

더 우려스러운 점은 이 공격이 모델 자체나 검색 인프라에 대한 어떤 접근 권한도 요구하지 않는다는 것이다. Zhang 연구원은 언어 모델이 “무작위 Reddit 댓글과 정부 사이트 기사를 거의 동등하게 처리(almost the same)한다”고 지적했다. 웹 쓰기 권한이 곧 AI 출력 조작 권한이 된다.