1. 서지정보
Subramanian, S., Akinfaderin, A., Zhang, Y., Singh, I., Khanuja, M., Singh, S., & Ladeira Tanke, M. (2025). Keyword search is all you need: Achieving RAG-Level Performance without vector databases using agentic tool use. arXiv preprint arXiv:2602.23368.
정확도 메모: 이전에 이 논문을 “AAAI 2026 논문”으로만 불렀는데(이 프로젝트 PRD·세부계획), 실제로 원문을 읽어보니 arXiv에 2025-12-19 게재된 프리프린트이고 저작권 표기만 “Association for the Advancement of Artificial Intelligence”로 돼 있다. AAAI 학회지에 정식 게재됐는지는 이 문서만으로 확인할 수 없어 “arXiv 프리프린트(AAAI 저작권 표기)“로 정정한다.
2. 연구문제
RAG(검색 증강 생성)에 벡터DB·임베딩 기반 의미 검색이 실제로 얼마나 추가 가치를 주는가 — 단순한 키워드 검색만 쓰는 에이전트형 도구 사용으로도 비슷한 성능을 낼 수 있는가?
3. 방법
두 파이프라인을 같은 데이터셋·같은 평가 기준으로 직접 비교했다.
- 기준선(RAG): Amazon Bedrock 지식베이스, Titan Text Embedding V2(1024차원), 300토큰 청킹(20% 중첩), OpenSearch 서버리스 색인, Claude 3 Sonnet(200K 컨텍스트)으로 답변 생성.
- 비교군(에이전트): 벡터DB 없이 Claude 3 Sonnet + LangChain으로 ReAct 추론 루프를 돌리며,
pdfmetadata.sh(파일 메타데이터 확인) →rga(RipGrep-All, 정규식·다중 키워드 검색) →pdfgrep(PDF 전용 검색, 페이지 범위 지정) 순서로 리눅스 셸 명령을 실행해 답을 찾는다(Algorithm 1). - 평가는 RAGAS 프레임워크로 충실도(Faithfulness)·문맥 재현율(Context Recall)·정답 정확도(Answer Correctness) 세 지표를 측정했고, LLM-as-a-Judge 방식을 썼다.
4. 데이터
llamahub에서 가져온 6개 데이터셋(PaulGrahamEssay, Llama2Paper, HistoryOfAlexnet, BlockchainSolana, LLM Survey paper, FinanceBench) — 각각 원문 PDF + 질문 + 정답·근거 문맥이 딸려 있는 표준 RAG 벤치마크.
5. 결과
- 세 지표 평균 attainment(RAG 대비 달성률): 충실도 94.52%, 문맥 재현율 88.05%, 정답 정확도 91.48% — 벡터DB 없이 90% 안팎을 달성.
- 데이터셋별 편차가 컸다: BlockchainSolana·LLM Survey paper는 RAG와 거의 동률(99%대)인 반면, Llama2Paper는 문맥 재현율이 70.56%로 가장 낮았다.
- 복잡한 표·구조가 많은 FinanceBench에서는 오히려 에이전트가 RAG를 앞섰다 — 정답 정확도 32.71%(에이전트) vs 24.24%(RAG), 약 6%p 개선.
- Claude Computer Use(브라우저를 직접 열어 Ctrl+F로 찾는 방식)와도 비교했는데, 결과는 비슷했지만 저자들은 자신들의 키워드 검색 에이전트가 설치·재현이 훨씬 간단하다고 강조했다.
6. 한계
저자가 밝힌 한계: 큰 문서에서 성능이 떨어지고, 멀티미디어 처리가 제한적이며, 컨텍스트 윈도우 제약이 있다. 모호한 질의 처리와 장기 지식 유지에도 약하다. 자동화된 검색 시스템의 개인정보·윤리 문제(접근 제어·콘텐츠 필터링 등)도 추가 검토가 필요하다고 명시했다(Conclusion).
읽으면서 느낀 한계:
- 비교 대상 임베딩 모델이 Titan Text Embedding V2 하나뿐이다. 더 강력한 임베딩 모델(예: 최신 오픈소스 임베딩)과 비교했다면 격차가 달라졌을 수 있다.
- 데이터셋 6개가 전부 영어이고 규모도 크지 않다. 이 프로젝트(한국어 위키, 논문 10편 규모)와 언어·규모 조건이 다르다는 걸 감안해야 한다 — 그래도 “적은 노트 수에서는 벡터가 필요 없다”는 이 프로젝트의 판단 방향과는 일치한다.
- Attainment 점수(RAG 대비 %)만 강조하고, 절대 점수의 실용적 의미(예: 충실도 0.7 vs 0.9가 실제 사용자에게 얼마나 다르게 느껴지는지)는 논의가 얕다.
7. 원문 인용
Our empirical analysis demonstrates that tool-based keyword search implementations within an agentic framework can attain over 90% of the performance metrics compared to traditional RAG systems without using a standing vector database. — Abstract
Overall, these results suggest that while the keyword search agent generally performed slightly below the RAG baseline, it maintained competitive performance levels, consistently achieving above 88% average attainment across all three metrics without the use of a semantic search via a vector database. — Results
However, several limitations were identified, including performance degradation with large documents, restricted multimedia handling, and context window constraints. — Conclusion
관련 개념
[[rag]] · [[keyword-search]] · [[llm-agent]]
(아직 만들어진 개념 페이지는 없다. SCHEMA.md 규칙대로 “나중에 쓸 것”이라는 표시로 미리 걸어둔다.)