01 · PROBLEM & CONTEXT
과학정보 RAG는 ‘찾는 것’과 ‘출처를 붙이는 것’을 동시에 잘해야 했습니다.
ScienceON AI Challenge는 주어진 질의에 대해 ScienceON OpenAPI 검색 결과를 활용해 관련 문서를 찾고, 재랭킹한 뒤, 근거 기반 답변을 생성하는 과제였습니다. 모든 과정은 고정된 GPU 예산 안에서 수행돼야 했기 때문에 성능과 효율을 함께 최적화해야 했습니다.
02 · ROLE & CONSTRAINTS
팀원과 논문 공동저자로 참여했습니다.
공개 논문은 팀 전체 방법론을 설명하며 개인별 구현 범위를 분리하지 않습니다. 따라서 이 페이지는 팀 차원의 시스템 설계와 공개 결과를 중심으로 정리합니다. 제약은 고정 GPU 예산, OpenAPI 기반 후보 집합, 다양한 과학 질의의 표현 차이, 그리고 답변 문장별 출처 검증이었습니다.
03 · APPROACH
MPR로 검색을 넓히고, CiteG로 문장과 출처를 다시 연결했습니다.
Multi-Portfolio Query Expansion
LLM이 질문에서 핵심 키워드·동의어·확장 키워드를 추출하고 Q, S, F, G 네 가지 검색 포트폴리오를 생성했습니다.
후보 통합과 재랭킹
포트폴리오별 Top-50 문서를 통합하고 중복을 정리한 뒤, 최종 답변에 사용할 문서를 정밀 재랭킹했습니다.
문서 조건부 답변 생성
상위 문서만 컨텍스트로 제공해 질문에 답하도록 하고, 외부 지식보다 검색 근거를 우선하도록 프롬프트를 제약했습니다.
문장 단위 Citation Grounding
생성된 각 문장을 다시 문서 후보와 대조해 가장 직접적인 단일 출처를 연결했습니다.
04 · OUTCOME
ScienceON AI Challenge 2위와 KISTI 원장상.
MPR-CiteG는 대회에서 2위를 기록했고 KISTI 원장상을 수상했습니다. 방법론은 CIKM 2025 RDGENAI Workshop 논문으로 공개됐으며, 검색 다양성과 출처 근거성을 하나의 RAG 파이프라인에서 다룬 사례가 됐습니다.
05 · LEARNINGS
검색 다양성과 근거 정밀도는 서로 다른 단계에서 관리해야 합니다.
초기 검색은 놓치지 않기 위해 다양하게 구성하고, 최종 생성 직전에는 후보를 정밀하게 줄이는 coarse-to-fine 전략이 유효했습니다. 또한 답변 전체에 출처를 한 번 붙이는 것보다 문장 단위로 근거를 연결하는 편이 검증 가능성을 높였습니다.