사례 2주차 2026-08-05 · 나만의 지식체계 구축 연재

AI가 논문을 못 구해왔어요 — 페이월에 세 번 막히고 나서야 안 것

TEM 이미지 디노이징 AI 논문을 넣으려다 페이월에 세 번 막혔어요. AI가 세 가지 경로를 다 시도했지만 못 뚫었고, 결국 제가 브라우저에서 직접 받아서 절대경로로 넘겨주고서야 풀렸어요.

📝 한줄 요약

논문 지식체계에 AI 주제 논문을 넣으려고 했는데, 딱 맞는 논문(SHINE — TEM 이미지 디노이징 AI)을 찾았지만 PDF가 페이월에 막혀 있었어요. AI가 세 가지 경로로 다운로드를 시도했지만 다 실패했고, 결국 제가 직접 브라우저에서 로그인해서 받은 다음 파일 경로만 알려주니 그제야 진행됐어요.

바쁘시면 이것만 읽어도 돼요:

  • AI가 학술 논문 PDF를 다운로드할 때 페이월(paywall)에 막히면, 직접 다운로드·오픈액세스 미러(PMC 등)·기관 리포지토리 세 가지 경로를 시도해봐요. 그래도 안 뚫리면 미련 없이 사람이 받아서 넘기는 게 빨라요.
  • Science Advances처럼 “오픈액세스 저널”이라고 알려진 곳도, 자동화된 요청은 봇 차단(JS 챌린지)에 걸려 원문을 못 받을 수 있어요 — 브라우저로 직접 열면 되는데 curl 같은 도구는 못 뚫는 경우가 있더라고요.
  • 막힌 걸 세 번 시도하고도 안 되면, “이거 못 하겠어요”라고 솔직히 알리는 게 계속 헛수고하는 것보다 나아요.

Before — 왜 이 논문이 필요했나

논문 지식체계 프로젝트를 10편까지 채우는 중이었는데, AI 주제 논문 하나가 비어 있었어요. 마침 그날 만든 “TEM 관찰” 개념 페이지가 소재·바이오 논문 두 주제에 이미 걸려 있어서, 여기에 AI 논문까지 하나 걸리면 세 주제가 한 개념으로 다 이어지는 그림이 나올 수 있었어요. 그래서 “TEM 이미지를 딥러닝으로 다루는 논문”을 웹 검색으로 찾았고, SHINE(Science Advances, 2025)이라는 논문을 발견했어요 — 제 실제 관심사(TEM 이미지 디노이징)와 정확히 겹치는 논문이었죠.

과정 — 세 번 막히고, 네 번째에 풀림

1차 시도 — 직접 다운로드

curl -sL -o "shine.pdf" "https://www.science.org/doi/pdf/10.1126/sciadv.ads5552"

결과: PDF가 아니라 5.4KB짜리 HTML만 받아졌어요. 페이지가 JS로 렌더링되는 방식이라 curl로는 껍데기만 오는 거였어요.

2차 시도 — PMC(오픈액세스 미러)

논문이 실린 Science Advances는 원래 오픈액세스 저널이라, PMC(PubMed Central)에 무료 사본이 있을 거라 생각했어요. 하지만 curl로 PMC를 검색했더니 빈 결과만 나왔어요.

3차 시도 — 대학 리포지토리

검색 결과에 한양대 리포지토리(ERICA) 직접 PDF 링크가 있길래 시도했어요.

curl -sL -o "shine.pdf" "https://scholarworks.bwise.kr/erica/bitstream/.../Self-supervised...pdf"

이번에도 657바이트짜리 HTML만 받아졌어요.

여기서 멈췄어요. 세 가지 경로를 다 써봤는데 안 되니, 더 파고들기보다 “이거 못 구했어요”라고 솔직히 알리는 걸 골랐어요.

4번째 — 제가 직접 받아서 넘겨주니 바로 풀림

브라우저로 직접 열어서 로그인 상태로 다운로드받고, 로컬 파일 경로(~/Downloads/sciadv.ads5552.pdf)만 알려줬어요. AI가 그 경로에서 파일을 바로 읽어 논문 노트를 완성했어요.

After — 뭐가 달라졌나

BeforeAfter
논문 주제 배분소재4·바이오3·AI2소재4·바이오3·AI3 (목표 10편 완성)
TEM 개념 페이지소재·바이오 2개 주제소재·바이오·AI 3개 주제에 다 걸림
걸린 시간자동화 시도 3번(각각 1~2분) + 사람이 받아서 넘기는 데 몇 분

배운 것

“오픈액세스”라는 말이 “자동화 도구로 바로 받을 수 있다”는 뜻은 아니에요. 사람이 브라우저로 열면 문제없이 무료로 보이는 페이지도, curl 같은 자동화 요청은 봇 차단(JS 챌린지, Cloudflare 등)에 걸려 껍데기 HTML만 받는 경우가 있더라고요. 이건 논문 사이트만의 문제가 아니라 요즘 웹사이트 전반의 패턴이라, AI가 “웹에서 파일을 받아온다”고 할 때 이 한계를 미리 알아두면 좋을 것 같아요.

세 번 막히면 네 번째는 사람에게 넘기는 게 맞아요. AI가 계속 다른 우회로를 찾아 헤매는 것보다, “이 경로들을 시도했는데 다 막혔다”고 구체적으로 보고하고 사람의 손을 빌리는 게 훨씬 빨랐어요. 실제로 제가 브라우저 로그인 하나로 몇 분 안에 해결됐거든요.

재사용 자산 — AI에게 파일 다운로드를 시킬 때 체크리스트

  • 직접 URL로 시도해봤나요? (curl -sL -o 파일명 URL)
  • 받은 파일이 진짜 PDF인지 확인했나요? (file 파일명 — “PDF document”가 아니라 “HTML”이면 실패)
  • 오픈액세스 저널이면 PMC·arXiv 같은 미러도 시도해봤나요?
  • 그래도 안 되면, 몇 번까지 시도하고 사람에게 넘길지 미리 정해두세요 (저는 3번이 적당했어요)
  • 사람이 직접 받았다면 로컬 파일 경로 그대로 AI에게 알려주면 돼요 — AI가 그 경로에서 바로 읽을 수 있어요