본문 바로가기

server/paper

[paper] Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction

이번주 아무거나 논문 

Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction


https://arxiv.org/pdf/2605.05242


1. 요약
- Agentic Search에서 검색 품질의 병목은 단순히 embedding/retriever 성능이 아니라, 에이전트가 코퍼스에 접근하는 인터페이스의 해상도에 있다고 주장
- 기존 RAG처럼 top-k 문서를 받아오는 방식 대신, 에이전트가 grep, find, bash, 파일 읽기 같은 터미널 도구로 원본 코퍼스를 직접 탐색하는 Direct Corpus Interaction, DCI를 제안

 



2. 기존 문제점 
- 기존 RAG 흐름
  문서 chunking → embedding/indexing → query → top-k 검색 결과 → LLM reasoning
- 이 방식은 효율적이지만 agent가 볼 수 있는 증거가 retriever의 top-k 결과로 제한 됨
- top-k 밖으로 밀린 증거는 그 시점의 reasoning에 활용되기 어려움
- 정확한 문자열 조건 / 약한 단서 조합 / 문서 내부 문맥 확인 / multi-hop 탐색에 한계


3. 제안
- DCI(Direct Corpus Interaction) 에이전트가 원본 코퍼스를 직접 접근
- grep, rg, find, glob, bash, 스크립트 실행을 통한 파일 및 코퍼스 검색
- DCI는 관련 문서를 많이 찾는 것보다 유용한 문서에 도달하면 그 안에서 해결
  + 기존 : 여기 관련 문서 10개 있음 찾아
  + DCI : 이 파일에 단어가 나오는 줄에서 앞뒤 30줄을 읽고 관련된 단어 다시 검색
-> 검색 후 문서 내부에서 연관된 문장을 찾아내고, 그 문장을 다음 탐색으로 연결



4. 한계 
- 문서가 많을수록 빠르게 비용과 latency 증가 | 정확도 하락 
 + 기존 RAG를 추천



나의 생각
- 단순 파일 검색이 아닌 그래프 형태로 먼저 제시하면 빠르게 파일 접근 가능할꺼라 생각됨
  + 앞단에서 Graph RAG 구성으로 관련 문서 빠르게 검색 후 DCI로 넘기기
  + Graph RAG + Hybrid Retrieval + DCI 구조