📝 한줄 요약
논문 지식체계에 AI 주제 논문을 넣으려고 했는데, 딱 맞는 논문(SHINE — TEM 이미지 디노이징 AI)을 찾았지만 PDF가 페이월에 막혀 있었어요. AI가 세 가지 경로로 다운로드를 시도했지만 다 실패했고, 결국 제가 직접 브라우저에서 로그인해서 받은 다음 파일 경로만 알려주니 그제야 진행됐어요.
바쁘시면 이것만 읽어도 돼요:
- AI가 학술 논문 PDF를 다운로드할 때 페이월(paywall)에 막히면, 직접 다운로드·오픈액세스 미러(PMC 등)·기관 리포지토리 세 가지 경로를 시도해봐요. 그래도 안 뚫리면 미련 없이 사람이 받아서 넘기는 게 빨라요.
- Science Advances처럼 “오픈액세스 저널”이라고 알려진 곳도, 자동화된 요청은 봇 차단(JS 챌린지)에 걸려 원문을 못 받을 수 있어요 — 브라우저로 직접 열면 되는데
curl같은 도구는 못 뚫는 경우가 있더라고요. - 막힌 걸 세 번 시도하고도 안 되면, “이거 못 하겠어요”라고 솔직히 알리는 게 계속 헛수고하는 것보다 나아요.
Before — 왜 이 논문이 필요했나
논문 지식체계 프로젝트를 10편까지 채우는 중이었는데, AI 주제 논문 하나가 비어 있었어요. 마침 그날 만든 “TEM 관찰” 개념 페이지가 소재·바이오 논문 두 주제에 이미 걸려 있어서, 여기에 AI 논문까지 하나 걸리면 세 주제가 한 개념으로 다 이어지는 그림이 나올 수 있었어요. 그래서 “TEM 이미지를 딥러닝으로 다루는 논문”을 웹 검색으로 찾았고, SHINE(Science Advances, 2025)이라는 논문을 발견했어요 — 제 실제 관심사(TEM 이미지 디노이징)와 정확히 겹치는 논문이었죠.
과정 — 세 번 막히고, 네 번째에 풀림
1차 시도 — 직접 다운로드
curl -sL -o "shine.pdf" "https://www.science.org/doi/pdf/10.1126/sciadv.ads5552"
결과: PDF가 아니라 5.4KB짜리 HTML만 받아졌어요. 페이지가 JS로 렌더링되는 방식이라 curl로는 껍데기만 오는 거였어요.
2차 시도 — PMC(오픈액세스 미러)
논문이 실린 Science Advances는 원래 오픈액세스 저널이라, PMC(PubMed Central)에 무료 사본이 있을 거라 생각했어요. 하지만 curl로 PMC를 검색했더니 빈 결과만 나왔어요.
3차 시도 — 대학 리포지토리
검색 결과에 한양대 리포지토리(ERICA) 직접 PDF 링크가 있길래 시도했어요.
curl -sL -o "shine.pdf" "https://scholarworks.bwise.kr/erica/bitstream/.../Self-supervised...pdf"
이번에도 657바이트짜리 HTML만 받아졌어요.
여기서 멈췄어요. 세 가지 경로를 다 써봤는데 안 되니, 더 파고들기보다 “이거 못 구했어요”라고 솔직히 알리는 걸 골랐어요.
4번째 — 제가 직접 받아서 넘겨주니 바로 풀림
브라우저로 직접 열어서 로그인 상태로 다운로드받고, 로컬 파일 경로(~/Downloads/sciadv.ads5552.pdf)만 알려줬어요. AI가 그 경로에서 파일을 바로 읽어 논문 노트를 완성했어요.
After — 뭐가 달라졌나
| Before | After | |
|---|---|---|
| 논문 주제 배분 | 소재4·바이오3·AI2 | 소재4·바이오3·AI3 (목표 10편 완성) |
| TEM 개념 페이지 | 소재·바이오 2개 주제 | 소재·바이오·AI 3개 주제에 다 걸림 |
| 걸린 시간 | 자동화 시도 3번(각각 1~2분) + 사람이 받아서 넘기는 데 몇 분 | — |
배운 것
“오픈액세스”라는 말이 “자동화 도구로 바로 받을 수 있다”는 뜻은 아니에요. 사람이 브라우저로 열면 문제없이 무료로 보이는 페이지도, curl 같은 자동화 요청은 봇 차단(JS 챌린지, Cloudflare 등)에 걸려 껍데기 HTML만 받는 경우가 있더라고요. 이건 논문 사이트만의 문제가 아니라 요즘 웹사이트 전반의 패턴이라, AI가 “웹에서 파일을 받아온다”고 할 때 이 한계를 미리 알아두면 좋을 것 같아요.
세 번 막히면 네 번째는 사람에게 넘기는 게 맞아요. AI가 계속 다른 우회로를 찾아 헤매는 것보다, “이 경로들을 시도했는데 다 막혔다”고 구체적으로 보고하고 사람의 손을 빌리는 게 훨씬 빨랐어요. 실제로 제가 브라우저 로그인 하나로 몇 분 안에 해결됐거든요.
재사용 자산 — AI에게 파일 다운로드를 시킬 때 체크리스트
- 직접 URL로 시도해봤나요? (
curl -sL -o 파일명 URL) - 받은 파일이 진짜 PDF인지 확인했나요? (
file 파일명— “PDF document”가 아니라 “HTML”이면 실패) - 오픈액세스 저널이면 PMC·arXiv 같은 미러도 시도해봤나요?
- 그래도 안 되면, 몇 번까지 시도하고 사람에게 넘길지 미리 정해두세요 (저는 3번이 적당했어요)
- 사람이 직접 받았다면 로컬 파일 경로 그대로 AI에게 알려주면 돼요 — AI가 그 경로에서 바로 읽을 수 있어요