
GEO를 처음 정의한 원전 논문: 생성형 검색 가시성 측정과 9가지 기법
생성 엔진 최적화(GEO)의 가시성 지표·9가지 기법·GEO-Bench
생성 엔진 최적화(GEO) 개념을 처음 정의한 논문이에요. 생성형 검색 가시성을 측정하는 지표, 9가지 기법 중 뭐가 효과적인지, 키워드 스터핑의 효과, 검색 순위가 낮은 페이지도 인용될 수 있는지 정리했어요.
GEO(Generative Engine Optimization, 생성 엔진 최적화)는 Perplexity·구글 AI 개요 같은 생성형 검색 엔진이 답을 만들 때 우리 콘텐츠를 인용할 확률을 높이도록 최적화하는 프레임워크예요. 2024년 KDD에 발표된 Aggarwal 등의 논문이 이 개념과 측정 지표, 벤치마크를 처음으로 정의한 GEO의 원전이에요 [1].
생성 엔진은 검색 결과를 나열하는 대신, 여러 소스를 읽고 하나의 답으로 합쳐서 직접 보여줘요. 그래서 이제 노출은 순위가 아니라 그 답 안에 인용되느냐로 결정돼요. 문제는 콘텐츠 창작자가 자기 글이 언제·어떻게 답에 등장할지 통제하기 어렵다는 점이에요. GEO는 바로 이 새로운 판에서 창작자에게 최적화 수단을 주려는 시도예요 [1]. (GEO의 기본 개념은 GEO란 무엇인가 글에서 더 풀어 뒀어요.)
생성 엔진이란, 왜 SEO로는 부족할까
생성 엔진은 대략 네 단계로 움직여요. 질의를 여러 개로 재작성하고, 검색 엔진으로 소스를 모으고, 요약 모델이 정리하고, 응답 모델이 인용을 단 최종 답을 만들어요.

그림 1. 생성 엔진의 구조: 질의 재작성 → 검색 → 요약 → 인용이 달린 응답 생성.
전통 SEO는 검색 랭킹 알고리즘에 맞춰 순위를 올리는 일이었어요. 하지만 생성 엔진은 키워드 매칭에 머물지 않고, 언어 모델이 소스와 질의를 더 깊이 이해해서 답을 합성해요. 게다가 인용은 답 본문 안에 서로 다른 길이·위치로 박혀요. 그래서 "우리가 몇 위인가"만으로는 가시성을 잴 수 없어요.

그림 2. 검색 엔진은 순위·원문이 그대로지만, 생성 엔진은 인용이 답 안에 섞여 측정이 다차원이 된다.
가시성을 어떻게 측정할까
이 논문의 가장 근본적인 기여는 생성 엔진용 임프레션(가시성) 지표를 정의한 거예요. 먼저 가장 단순한 '단어수' 지표는, 특정 인용 를 다는 문장들의 단어수를 전체 응답 단어수로 나눠요.
여기서 는 를 인용한 문장 집합, 은 응답 전체 문장, 는 문장 의 단어수예요. 인용이 더 많은 분량을 차지할수록 그 소스가 답에서 더 큰 역할을 한 거예요.
그런데 단어수만으로는 인용이 앞에 나오든 뒤에 나오든 똑같이 세요. 앞에 놓인 인용이 더 많이 읽히니까, 위치를 지수적으로 감쇠시키는 위치 보정 단어수를 함께 써요 [4].
여기에 더해, 클릭 확률·질의 관련성·인용의 영향력·고유성 같은 주관적 측면은 단어수로 잡히지 않아요. 그래서 G-Eval로 7개 축(관련성·영향력·고유성·다양성·후속질문·주관적 위치·인용 횟수) 을 재는 주관적 임프레션을 함께 둬요 [3]. 어떤 기법의 효과는 원래 응답 대비 수정한 응답 의 상대 개선으로 비교해요.
9가지 GEO 기법
논문은 웹 콘텐츠에 적용할 수 있는 9가지 엔진-무관 기법을 정의하고, GEO-Bench(10K 질의·9개 소스·25개 도메인)에서 평가해요 [1][2].
| # | 기법 | 무엇을 바꾸나 |
|---|---|---|
| 1 | Authoritative | 더 설득력 있고 단정적인 어조로 |
| 2 | Statistics Addition | 정성 서술을 정량 통계·수치로 |
| 3 | Keyword Stuffing | 질의 키워드를 더 많이 (전통 SEO식) |
| 4 | Cite Sources | 신뢰할 출처·기관 인용을 추가 |
| 5 | Quotation Addition | 전문가·권위자 인용문을 추가 |
| 6 | Easy-to-Understand | 쉬운 언어로 단순화 |
| 7 | Fluency Optimization | 문장 유창성·논리 흐름 개선 |
| 8 | Unique Words | 고유한 단어·표현 추가 |
| 9 | Technical Terms | 전문 용어·도메인 어휘 추가 |
표 1. 논문이 평가한 9가지 GEO 기법.
핵심은 이 중 3·4·5번을 뺀 대부분이 새 정보를 크게 더하지 않고 기존 내용의 제시 방식만 바꾼다는 점이에요. 즉 없는 사실을 지어내지 않고도 가시성을 올릴 수 있어요.

그림 3. GEO 적용 전후: 낮은 가시성의 소스가 최적화 뒤 생성 응답에서 더 앞·더 길게 인용된다.
무엇이 통했나
결과는 분명해요. 출처 인용·전문가 인용문·통계 추가가 가장 강력했고, 최고 기법은 위치 보정 단어수에서 기준선 대비 41%, 주관적 임프레션에서 28% 개선했어요. 반면 전통 SEO의 키워드 스터핑은 거의 효과가 없거나 오히려 떨어졌어요 [1].
| 방법 | 위치 보정 단어수 | 주관적 임프레션 |
|---|---|---|
| No Optimization (기준선) | 19.3 | 19.3 |
| Keyword Stuffing | 17.7 | 20.2 |
| Cite Sources | 24.6 | 21.9 |
| Statistics Addition | 25.2 | 23.7 |
| Quotation Addition | 27.2 | 24.7 |
표 2. GEO 기법의 절대 임프레션(발췌). 인용·통계 계열이 두 지표 모두 크게 올린다 [1].
기법은 조합할 때 더 좋아요. 유창성 개선과 통계 추가를 함께 쓰면 단일 기법보다 성능이 더 오르고, 도메인마다 잘 듣는 조합이 달라요.

그림 4. 기법 조합별 가시성 상대 개선 히트맵. 유창성 + 통계 조합이 가장 강하다.
하위 랭크일수록 기회가 크다
더 흥미로운 건 검색 순위가 낮은 페이지일수록 GEO 효과가 크다는 점이에요. 검색 5위 페이지에 출처 인용을 더하면 생성 응답 가시성이 무려 115% 올랐어요. 백링크·도메인 파워로 밀리던 작은 창작자도 콘텐츠 설계만으로 인용을 얻을 수 있다는 뜻이라, GEO가 판을 평평하게 만드는 셈이에요 [1].
| 방법 | 검색 1위 | 3위 | 5위 |
|---|---|---|---|
| Cite Sources | -30.3 | 20.4 | 115.1 |
| Quotation Addition | -22.9 | 3.5 | 99.7 |
| Statistics Addition | -20.6 | 8.1 | 97.9 |
표 3. 검색 랭크별 가시성 상대 개선(%). 하위 랭크에서 이득이 폭발한다 [1].
도메인마다 잘 듣는 기법이 다르다
한 기법이 모든 주제에 통하지는 않아요. 논문은 질의 도메인별로 어떤 기법이 강한지도 분석했어요. 토론형 질문에는 권위적 어조가, 사실형 질문에는 출처 인용이 특히 잘 들어요 [1].
| 기법 | 잘 듣는 도메인 |
|---|---|
| Authoritative | 토론(Debate)·역사·과학 |
| Cite Sources | 사실 진술(Statement)·팩트·법/정부 |
| Statistics Addition | 법/정부·토론·의견 |
| Quotation Addition | 사회(People & Society)·설명·역사 |
표 4. 기법별로 특히 효과가 큰 도메인 [1]. 타깃 주제에 맞춰 기법을 골라야 한다.
실제 배포 엔진에서도 통했다
합성 벤치마크를 넘어, 실제 배포된 Perplexity.ai에서도 검증했어요. 출처·통계·인용문 계열은 주관적 임프레션을 최대 37% 올린 반면, 키워드 스터핑은 여기서도 기준선보다 낮았어요 [1]. 실험실 결과가 실제 상용 엔진으로도 이어진다는 신호예요.
이 방법의 한계
논문은 스스로 한계도 밝혀요 [1].
- 엔진은 변한다: 생성 엔진이 진화하면 기법의 효과도 SEO처럼 바뀔 수 있어요.
- 블랙박스: 엔진 내부를 모른 채 텍스트만 조정하는 접근이라, 왜 되는지의 인과는 완전히 규명되지 않아요.
- 검색 랭킹 영향 미측정: GEO 수정이 전통 검색 순위에 주는 영향은 따로 재지 않았어요.
- 태그 노이즈: 도메인·의도 태그를 자동으로 붙여서 일부 오류가 섞일 수 있어요.
TRAIL 관점: 인용은 측정하고 설계하는 것
이 원전이 세운 두 축은 지금 우리가 하는 일의 뼈대예요. 가시성을 새로 정의해 측정하고, 콘텐츠 설계로 최적화하는 거죠. TRAIL Search는 이 가시성·점유율(SoV)을 엔진별로 추적하고, 실무 처방은 논문의 결론과 같아요. 키워드를 반복하지 말고, 출처·통계·전문가 인용으로 근거를 촘촘히 하고, 문장을 유창하게 다듬는 거예요 [1].
이 논문이 문을 열었다면, 그 뒤 연구는 기법을 자동으로 고르는 쪽으로 나아가고 있어요. 글자를 직접 고치는 대신 피처 단위로 최적화하는 FeatGEO 가 그 예예요 [5]. 그리고 어떤 문서가 답을 만들었는지 되짚는 RAG 출처 귀속 연구와 함께 보면, 측정과 설계가 한 쌍으로 맞물려요. 결국 AI 답변 속 우리 자리는, 무엇을 담고 어떻게 제시하느냐를 측정 가능한 문제로 바꾸는 순간부터 넓어져요.
자주 묻는 질문
GEO가 SEO와 뭐가 다른가요?
SEO는 검색 결과에서 우리 페이지의 '순위'를 올리는 일이에요. GEO는 생성형 검색이 답을 만들 때 우리 콘텐츠를 '인용'하도록 만드는 일이고요. 생성 엔진은 여러 소스를 하나의 답으로 합치면서 인용을 본문 안에 위치·길이가 제각각인 형태로 심어요. 그래서 순위 대신 답 안에서의 가시성을 새로 측정하고 최적화해야 해요.
AI 인용을 높이는 가장 효과적인 방법은 뭔가요?
이 논문 실험에서는 출처 인용(Cite Sources), 전문가 인용문(Quotation Addition), 통계 추가(Statistics Addition)가 가장 효과적이었어요. 위치 보정 단어수 기준으로 기준선 대비 최대 41%, 주관적 임프레션 기준 최대 28% 개선됐어요. 유창성·가독성 개선도 15–30% 올렸고요.
키워드를 많이 넣으면 AI가 더 인용하나요?
아니요. 전통 SEO의 키워드 스터핑은 생성 엔진 응답에서 거의 효과가 없거나 오히려 가시성을 낮췄어요. 생성 엔진은 표면 키워드보다 근거·인용·정보 제시 방식 같은 콘텐츠 품질 신호를 봐요.
GEO는 큰 사이트에만 유리한가요?
오히려 반대예요. 검색 순위가 낮은 페이지일수록 GEO 효과가 컸어요. 예를 들어 검색 5위 페이지에 출처 인용을 더하면 생성 응답 가시성이 115%까지 올랐어요. 백링크·도메인 파워가 부족한 작은 창작자도 콘텐츠 설계로 인용을 얻을 수 있다는 뜻이에요.
참고자료
- [1]Aggarwal et al., "GEO: Generative Engine Optimization", KDD 2024
- [2]GEO 프로젝트·코드·GEO-Bench (GEO-optim/GEO)
- [3]Liu et al., "G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment", EMNLP 2023
- [4]Liu et al., "Lost in the Middle: How Language Models Use Long Contexts", TACL 2024
- [5]Liu & Xu, "Think Before Writing (FeatGEO)", ACL 2026
요약
- GEO(생성 엔진 최적화)는 Perplexity·AI 개요 같은 생성형 검색이 답을 만들 때 우리 콘텐츠를 인용하도록 최적화하는 프레임워크예요. 이 논문이 그 개념·지표·벤치마크를 처음 정의했어요.
- 가시성은 순위 대신 답 안에서의 노출로 재요. 위치 보정 단어수(객관)와 주관적 임프레션(G-Eval 7개 축)으로 측정해요.
- 9가지 기법 중 출처 인용·전문가 인용문·통계 추가가 가장 효과적이라 기준선 대비 최대 41%(단어수)·28%(임프레션) 올렸고, 키워드 스터핑은 통하지 않았어요.
- 효과는 도메인마다 다르고, 검색 하위 랭크 페이지일수록 커요(5위 +115%). 실제 배포된 Perplexity.ai에서도 최대 37% 개선을 확인했어요.
- 결국 표면 수사보다 근거·구조·권위가 인용을 만들고, 이는 후속 연구(FeatGEO)로 자동화·정교화되고 있어요.
이 글의 주제를 우리 브랜드로 확인해 보세요
고객의 한국어 질문에 ChatGPT·Perplexity가 어떻게 답하는지 측정하고 빠진 자리를 찾아 고치는 TRAIL Search가 이 글의 내용을 진단으로 이어 줍니다. 카드 없이 질문 10개로 시작합니다.
이 글의 주제와 직접 닿는 기능은 자사 가시성 추적입니다.
다른 글

AI는 두 페이지 중 무엇을 인용할까? 경쟁 인용의 4대 게이트키퍼
생성형 검색에서 경쟁사보다 먼저 인용되려면 콘텐츠에 뭐가 있어야 할까요. 주제 일치·가격 명시·최신 날짜·앞자리 4개 중 하나만 무너져도 인용이 사라진다는 25만 회 실험과 ChatGPT·Gemini의 기준 차이예요.

GEO 논문 45편 서베이: 검증된 기법과 재현 안 되는 기법
GEO 연구 45편을 훑은 서베이예요. 3년간 네 번의 연구 전환, AI 가시성을 나누는 지표 9단계, 본문만 최적화하면 왜 인용이 줄어드는지와 재현되는 기법을 정리했어요.

AI 검색엔진은 어떤 브랜드를 언급할까? 규모·인지도·출처 벤치마크
10만 건 응답으로 다섯 AI 엔진의 브랜드 가시성과 점유율을 측정한 대규모 GEO 벤치마크예요. 브랜드 규모와 인지도의 영향, 엔진마다 다른 언급, 인용 출처가 자사 사이트인지 외부인지 정리했어요.
같은 주제로 이어 읽기
- FeatGEO: AI 인용을 만드는 건 키워드일까 구조일까, 피처 단위 GEO웹페이지를 피처로 추상화해 AI 인용 가시성과 콘텐츠 품질을 동시에 최적화하는 FeatGEO예요. 글자를 고치는 GEO와 피처 단위 GEO의 차이, 사람이 쓴 페이지에 적용하면 어떻게 되는지 정리했어요.
- 구조만 바꿔도 AI 인용이 오를까? 헤딩·문단 길이·문서 골격 실증내용은 그대로 두고 헤딩 단계·문단 길이·강조 표시 같은 문서 골격만 손봐 AI 검색 인용률을 17.3% 올린 실증 연구예요. 엔진마다 선호하는 문서 구조가 다른지도 정리했어요.
- SAGEO Arena: 본문만 고치면 검색에서 빠진다, 제목·메타 필드가 먼저검색·재랭킹·생성 전체 파이프라인에서 GEO 전략을 재평가한 SAGEO Arena예요. AI 검색에서 제목·메타 같은 구조 필드가 본문보다 중요한 이유, 재랭킹 병목에서 살아남는 문서 작성법을 정리했어요.
이 글은 Papers 카테고리에 속해요. 같은 카테고리 글 12편을 한자리에서 볼 수 있어요. Papers 카테고리 글 전체 보기