llms.txt는 웹사이트 루트(/llms.txt)에 두는 마크다운 파일로, LLM(Large Language Model) 기반 에이전트에게 "이 사이트가 무엇이고 어떤 콘텐츠를 어디서 읽으면 되는지"를 알려 준다. 2024년 9월 제러미 하워드(Jeremy Howard)가 제안했다. HTML 페이지는 내비게이션·광고·스크립트가 섞여 있어 LLM이 읽기에 번거롭고 컨텍스트 윈도우(Context Window)를 낭비하므로, 바로 읽을 수 있는 깔끔한 원문 목록을 한곳에 모아 두자는 취지다.
형식
# 사이트 이름
> 한 문단짜리 요약
부가 설명(선택)
## 문서
- [시작하기](https://example.com/start.md): 한 줄 설명
- [API 레퍼런스](https://example.com/api.md)
## Optional
- [변경 기록](https://example.com/changelog.md)- H1(사이트 이름)만 필수다. 그 아래 인용문 요약, 자유 설명, H2로 나눈 링크 목록이 순서대로 온다
- 링크 목록의 각 항목은
[이름](URL)에 선택적으로: 설명을 붙인다 ## Optional절은 컨텍스트가 모자랄 때 건너뛰어도 되는 보조 자료다- 사이트 루트뿐 아니라
/docs/llms.txt처럼 하위 경로에 둘 수도 있다 - 함께 제안된 관례로, 각 페이지의 마크다운판을 같은 URL에
.md를 붙이거나(page.html.md) 확장자를 바꿔(page.md) 제공한다
llms-full.txt는 제안 문서에는 없는 관례로, 링크 목록 대신 사이트 문서 전체를 한 텍스트 파일로 이어 붙인 것이다. 에이전트가 여러 번 요청하지 않고 한 번에 읽게 하려는 것으로, Anthropic의 Claude 문서처럼 개발자 문서 사이트에서 볼 수 있다.
robots.txt·sitemap과의 차이
- robots.txt: 크롤러에게 어디를 가도 되는지 알려 주는 접근 규칙이다
- sitemap.xml: 색인할 모든 페이지 목록이다. 대개 LLM 컨텍스트에 다 넣기엔 너무 크다
- llms.txt: 에이전트가 필요할 때 읽을 추린 원문 목록이다. 학습용 크롤링이 아니라 추론 시점에 쓰는 것을 염두에 뒀다
한계 (2026 기준)
- 공식 표준이 아니라 제안이다
- 구글은 AI 검색 기능을 포함한 구글 검색에 나오려고 AI용 텍스트 파일이나 마크다운을 새로 만들 필요가 없고, 구글 검색은 그런 파일을 쓰지 않는다고 밝혔다. 만들어도 순위에 득도 실도 없다
- Ahrefs가 2026년 5월 서버 로그로 13만여 도메인을 조사한 결과, llms.txt를 둔 사이트의 97%는 그 파일이 한 번도 요청되지 않았다. 요청 대부분은 SEO(Search Engine Optimization) 점검 도구 같은 AI가 아닌 봇이었다
그러니 검색 노출 효과를 기대할 파일은 아니다. 사용자가 에이전트에게 "이 문서를 읽고 답해 줘"라고 시켰을 때 에이전트가 HTML을 파싱하지 않고 원문을 바로 읽게 돕는 장치로 보는 것이 정확하다. 이미 마크다운 원문을 서빙하고 있다면 비용이 거의 들지 않는다. 에이전트가 자료를 찾아 쓰는 방식은 RAG (검색 증강 생성), 메타데이터로 검색 엔진에 페이지를 설명하는 쪽은 generateMetadata에서 다룬다.
출처: The /llms.txt file Jeremy Howard(2024) · Google 검색 Central: AI 최적화 가이드 · We Analyzed 137K Sites: 97% of llms.txt Files Never Get Read Ahrefs(2026)