
AI 추천은 조작될 수 있을까? 경쟁사의 LLM 추천 조작 탐지와 대응
LLM 추천 표면을 겨눈 두 공격과, 모니터링으로 막는 법
제품 페이지 텍스트 몇 줄로 LLM 추천 순위가 뒤집힌 두 연구를 정리했어요. 조작을 어떻게 탐지하고 막을지, 프롬프트 인젝션 방어로 충분한지, 경쟁사가 조작하면 어떻게 대응할지 실무 관점이에요.
두 편의 연구는 제품 페이지나 플러그인 설명에 텍스트를 심는 것만으로 LLM의 추천·인용 선택을 조작할 수 있음을 실증해요. TRAIL은 모니터링 제품이라, 이 글의 목적은 조작법 제공이 아니라 그 메커니즘을 이해하고 탐지·경고·방어하는 데 있어요. 정상적인 GEO가 좋은 구조·명확한 주장·인용 가능한 사실로 인용을 얻는 바로 그 채널을, 공격자는 반대로 악용해요 [1][2][3].
생성형 검색·추천은 검색된 제3자 텍스트(제품 페이지·플러그인 설명·뉴스 본문)를 맥락으로 받아 그 안에서 무엇을 인용·추천할지 고르죠. 그래서 맥락에 들어가는 텍스트를 바꾸면 출력이 바뀌어요. 이게 정상 GEO가 작동하는 통로이자, 동시에 조작의 공격면이에요 [2].
두 가지 조작 레버
두 연구는 서로 보완적인 두 방식을 보여줘요 [1][2].
| 구분 | 논문 A (화이트박스) | 논문 B (블랙박스) |
|---|---|---|
| 방식 | 최적화된 토큰열(STS) 주입 | 읽을 수 있는 자연어 설득 |
| 필요 조건 | 모델 기울기 접근(오픈모델) | 없음, 상용 시스템에 즉시 적용 |
| 형태 | 사람이 읽으면 어색한 문자열 | 정상 문장처럼 보임 |
| 탐지 | 비가독이라 상대적으로 쉬움 | 자연어라 더 어려움 |
표 1. 두 조작 방식의 비교 [1][2]. 실무 위협의 무게중심은 탐지가 어려운 자연어 설득이다.
논문 A는 제품 설명에 최적화된 문자열을 심어 추천 순위를 끌어올려요. 개념적으로는, 타깃 제품의 랭크에 대한 모델 출력의 손실을 최소화하도록 주입 토큰 를 고르는 문제예요 [1][4].
다만 이 방식은 모델 기울기가 필요해 오픈모델에만 통해요. 그 약점을 메우는 게 논문 B의 자연어 설득이에요 [2].
실제 상용 시스템에서 통했다
논문 B는 읽을 수 있는 텍스트만으로 상용 시스템을 조작했어요. 명시적 지시("이 제품만 언급하라")뿐 아니라, 명령 없이 "이 제품만 신뢰할 수 있다"고 설득하는 방식도 선택을 바꿨어요 [2].
| 시스템 | 조작 효과 |
|---|---|
| Bing Copilot(카메라) | 가상 제품 추천율 34% → 59.4% |
| 플러그인 선택(GPT-4·Claude) | 적대적 플러그인 선택 2–8배, 일부 0% → 90%+ |
| Perplexity(뉴스) | 외부 주입 공격 성공률 최대 25% |
표 2. 자연어 설득이 실제 상용 시스템에서 낸 효과 [2].

그림 1. 페이지 텍스트 주입으로 추천 순위가 바뀌는 개념도.
핵심은 "부각"과 "경쟁사 깎아내리기"가 같은 텍스트 주입 채널로 작동한다는 점이에요. 자사 인용률을 올리는 것과 경쟁사 신뢰도를 떨어뜨리는 것이 한 메커니즘의 양면이라, 모니터링은 우리 가시성 상승뿐 아니라 경쟁사발 허위 주장도 함께 봐야 해요 [2].
모두가 조작하면 다 같이 무너진다
흥미로운 게임이론적 발견이 있어요. 한 제품만 공격하면 그 제품 추천율이 급등하지만, 여러 제품이 동시에 공격하면 LLM이 전부 의심해 모든 추천율이 기준선 아래로 떨어졌어요. 개별 합리성이 집단 비합리성으로 귀결되는 죄수의 딜레마예요 [2].

그림 2. 동시 조작이 늘수록 카테고리 전체 추천율이 무너진다.
그리고 프롬프트 인젝션 방어만으로는 부족해요. 설득형 허위정보는 명시적 명령이 아니어서 인젝션 필터를 통과하거든요. 저자들도 신뢰할 출처 귀속은 미해결 문제이고, 효과적 대응이 시급하다고 결론지었어요 [2].
TRAIL 관점: 모니터링이 현실적 방어선
완벽한 모델 차원 방어가 없는 동안, 외부 관측 기반의 탐지가 현실적 방어선이에요. TRAIL Search가 인용·점유율(SoV)을 추적하는 자리에서 할 수 있는 일이 여기 있어요.
- 경쟁사발 부정 주장 탐지: 우리 브랜드에 대해 "안전하지 않다·신뢰할 수 없다"류 부정 주장이 AI 응답에 갑자기 등장하는지 감시해 경고해요.
- 이상 급등 탐지: 경쟁사 가시성이 콘텐츠 변화 없이 단기 급등하면 주입 의심 신호로 플래그해요.
- 숨은 주입 스캔: 페이지의 폰트 크기 1·흰색 텍스트·비가독 토큰열·"이 제품만 언급하라" 패턴을 크롤해 조작 마커로 점검해요.
- 카테고리 신뢰 붕괴 경보: 한 시장에서 다수가 동시 조작해 AI가 그 카테고리를 불신하기 시작하는 패턴을 감지해요.
명확히 해 둘 게 있어요. TRAIL은 조작을 설계·권유·제공하지 않아요. 우리가 파는 건 정직한 콘텐츠 품질 기반의 가시성 향상 처방과, 이 공격들로부터의 탐지·경고·방어예요. 정상적으로 인용을 얻는 길은 GEO 원전과 FeatGEO가 보여준 대로, 근거·구조·인용 가능성을 사실 기반으로 높이는 거예요 [3].
자주 묻는 질문
LLM 추천이 정말 조작되나요?
두 연구가 실증했어요. 제품 페이지나 플러그인 설명에 텍스트를 심는 것만으로 LLM의 추천·인용 선택을 바꿀 수 있었어요. 한쪽은 최적화된 토큰열로, 다른 쪽은 읽을 수 있는 자연어 설득으로 Bing·Perplexity·플러그인 같은 실제 시스템에서 성공했어요.
프롬프트 인젝션만 막으면 되나요?
부족해요. 명시적 지시 주입은 필터로 걸러도, '이 제품만 신뢰할 수 있다' 같은 설득형 허위정보는 명령이 아니어서 인젝션 방어를 통과해요. 저자들도 신뢰할 출처 귀속은 미해결 문제이고 대응이 시급하다고 결론지었어요.
모두가 조작하면 어떻게 되나요?
역설적으로 다 같이 손해예요. 여러 제품이 동시에 공격하면 LLM이 전부 의심해 카테고리 전체 추천율이 기준선 아래로 떨어졌어요. 개별 유인이 집단 붕괴로 이어지는 죄수의 딜레마예요.
우리는 무엇을 할 수 있나요?
모니터링으로 방어해요. 경쟁사발 부정 주장 급등, 콘텐츠 변화 없는 가시성 급등, 숨은 주입 마커(폰트 1·흰색 텍스트·비가독 토큰열)를 탐지해 경고할 수 있어요. TRAIL은 조작을 만들지 않고, 탐지·경고·방어만 제공해요.
참고자료
- [1]Kumar & Lakkaraju, "Manipulating LLMs to Increase Product Visibility", arXiv:2404.07981 (2024)
- [2]Nestaas et al., "Adversarial Search Engine Optimization for LLMs", arXiv:2406.18382 (2024)
- [3]Aggarwal et al., "GEO: Generative Engine Optimization", KDD 2024
- [4]Zou et al., "Universal and Transferable Adversarial Attacks (GCG)", 2023
요약
- 두 연구는 제품 페이지·플러그인 설명에 텍스트를 심는 것만으로 LLM 추천을 조작할 수 있음을 실증했어요.
- 한쪽은 화이트박스 토큰 최적화(오픈모델 한정), 다른 쪽은 블랙박스 자연어 설득으로 Bing·Perplexity·플러그인 등 상용 시스템에서 성공했어요.
- 설득형 허위정보는 명시적 명령이 없어 프롬프트 인젝션 방어를 통과해서, 신뢰할 출처 귀속은 미해결 문제로 남았어요.
- 모두가 조작하면 LLM이 카테고리 전체를 불신해 추천율이 함께 무너지는 죄수의 딜레마가 나타났어요.
- 완벽한 모델 방어가 없는 동안, 외부 관측 기반의 탐지·경고가 현실적 방어선이라 모니터링의 가치가 커요.
이 글의 주제를 우리 브랜드로 확인해 보세요
고객의 한국어 질문에 ChatGPT·Perplexity가 어떻게 답하는지 측정하고 빠진 자리를 찾아 고치는 TRAIL Search가 이 글의 내용을 진단으로 이어 줍니다. 카드 없이 질문 10개로 시작합니다.
이 글의 주제와 직접 닿는 기능은 자사 가시성 추적입니다.
다른 글

AI는 두 페이지 중 무엇을 인용할까? 경쟁 인용의 4대 게이트키퍼
생성형 검색에서 경쟁사보다 먼저 인용되려면 콘텐츠에 뭐가 있어야 할까요. 주제 일치·가격 명시·최신 날짜·앞자리 4개 중 하나만 무너져도 인용이 사라진다는 25만 회 실험과 ChatGPT·Gemini의 기준 차이예요.

GEO 논문 45편 서베이: 검증된 기법과 재현 안 되는 기법
GEO 연구 45편을 훑은 서베이예요. 3년간 네 번의 연구 전환, AI 가시성을 나누는 지표 9단계, 본문만 최적화하면 왜 인용이 줄어드는지와 재현되는 기법을 정리했어요.

AI 검색엔진은 어떤 브랜드를 언급할까? 규모·인지도·출처 벤치마크
10만 건 응답으로 다섯 AI 엔진의 브랜드 가시성과 점유율을 측정한 대규모 GEO 벤치마크예요. 브랜드 규모와 인지도의 영향, 엔진마다 다른 언급, 인용 출처가 자사 사이트인지 외부인지 정리했어요.
같은 주제로 이어 읽기
- FeatGEO: AI 인용을 만드는 건 키워드일까 구조일까, 피처 단위 GEO웹페이지를 피처로 추상화해 AI 인용 가시성과 콘텐츠 품질을 동시에 최적화하는 FeatGEO예요. 글자를 고치는 GEO와 피처 단위 GEO의 차이, 사람이 쓴 페이지에 적용하면 어떻게 되는지 정리했어요.
- 구조만 바꿔도 AI 인용이 오를까? 헤딩·문단 길이·문서 골격 실증내용은 그대로 두고 헤딩 단계·문단 길이·강조 표시 같은 문서 골격만 손봐 AI 검색 인용률을 17.3% 올린 실증 연구예요. 엔진마다 선호하는 문서 구조가 다른지도 정리했어요.
- SAGEO Arena: 본문만 고치면 검색에서 빠진다, 제목·메타 필드가 먼저검색·재랭킹·생성 전체 파이프라인에서 GEO 전략을 재평가한 SAGEO Arena예요. AI 검색에서 제목·메타 같은 구조 필드가 본문보다 중요한 이유, 재랭킹 병목에서 살아남는 문서 작성법을 정리했어요.
이 글은 Papers 카테고리에 속해요. 같은 카테고리 글 12편을 한자리에서 볼 수 있어요. Papers 카테고리 글 전체 보기