
병원 웹사이트가 AI 검색에 인용되지 않는 기술적 원인과 해결책
생성형 AI 검색(ChatGPT Search, Perplexity, 네이버 AI 등)은 사용자의 질의를 기반으로 웹 문서를 실시간 탐색해 답변을 조합하는 RAG(검색 증강 생성) 방식을 따릅니다. 환자가 "퇴근 후 갈 수 있는 무릎 통증 전문의 병원"을 물었을 때 특정 병원이 답변에서 제외되는 주된 요인은 마케팅 문구의 부족이 아니라, 쿼리 팬아웃(Query Fan-out) 단계에서의 기술적 인덱싱 병목 때문입니다.
AI 검색 엔진의 쿼리 팬아웃(Query Fan-out) 작동 원리
환자가 복합적인 요구사항을 담아 1개의 프롬프트를 입력하면, 최신 LLM 검색 엔진은 답변의 정확도를 높이기 위해 내부적으로 여러 갈래의 서브 쿼리(Sub-queries)를 동시 발행(Fan-out)하여 웹을 탐색합니다.
환자 입력 프롬프트: "강남역 근처에 야간진료 하고 무릎 비수술 치료 잘하는 정형외과 전문의 병원 추천해줘"
AI의 내부 서브 쿼리 분기(Fan-out):
서브 쿼리 1:
강남역 정형외과 전문의 대표원장 약력$\rightarrow$Physician엔티티 매칭서브 쿼리 2:
강남역 평일 야간진료 정형외과 운영 시간$\rightarrow$openingHoursSpecification엔티티 매칭서브 쿼리 3:
무릎 관절 도수치료 및 체외충격파 비수술 항목$\rightarrow$MedicalProcedure엔티티 매칭
웹사이트가 이러한 세부 속성별로 데이터를 구조화해 두지 않으면, AI가 발행한 서브 쿼리 중 일부에서 데이터 매칭에 실패하여 최종 추천 조합 후보에서 완전히 배제됩니다.
병원 웹사이트가 AI 답변에서 누락되는 3가지 기술적 병목
1. AI 크롤러 접근 차단 (Robots.txt)
robots.txt에서GPTBot,PerplexityBot,ClaudeBot,Google-Extended등의 접근이 차단(Disallow)되어 있으면, AI 검색 엔진이 최신 진료 데이터 자체를 수집하지 못합니다.
2. 비정형 통이미지 중심의 랜딩페이지
통배너나 텍스트 없는 이미지 위주로 제작된 웹사이트는 LLM의 토큰화(Tokenization) 및 텍스트 추출 단계에서 정보가 누락되어 쿼리 분기 시 매칭될 텍스트 자산이 남지 않습니다.
3. 시맨틱 웹 표준 및 구조화 데이터(JSON-LD) 부재
진료 과목, 의료진 이력, 진료 시간 등이 HTML 시맨틱 태그 및 표준 구조화 데이터로 정의되지 않으면, 기계가 텍스트의 맥락을 정확한 엔티티 속성으로 파싱하지 못합니다.
Schema.org 기반 병원 특화 JSON-LD 설계 표준
AI 봇이 다중 분기 쿼리에 맞춰 병원의 세부 속성을 즉각 매핑할 수 있도록, 웹페이지 <head> 영역에 MedicalClinic, Physician, MedicalProcedure 스키마를 JSON-LD 포맷으로 구축해야 합니다.
온페이지 구조화 전후 AI 인용(Citation) 테스트 결과
구분 | 구조화 데이터 적용 전 | 구조화 데이터(JSON-LD) 적용 후 |
크롤링/파싱 | 이미지/단순 텍스트 인식 실패로 요약 누락 | 스키마 필드별 정확한 속성값 파싱 완료 |
인용(Citation) | "관련 진료 정보를 찾을 수 없습니다" 출력 | "위온정형외과는 월·수·금 20시까지 야간진료를 운영합니다" 직접 생성 |
출처 표기 | 미노출 또는 일반 포털 메인 링크 | 병원 공식 상세 웹페이지 링크 직접 각주 인용 |
병원 GEO(Generative Engine Optimization)는 단순한 감성 카피라이팅이 아닌 기술적 인덱싱과 데이터 구조화에서 출발합니다. 크롤러 허용, 이미지 텍스트화, JSON-LD 스키마 마크업 구축을 선행해야 AI 검색 엔진의 직접 인용 및 추천 풀에 진입할 수 있습니다.
