COMPETITION · MULTILINGUAL INFORMATION RETRIEVAL

Alibaba International E-commerce Product Search

다국어 상품 검색의 QC/QI relevance prediction을 위해 data refinement, language tagging, task-specific modeling, LLM fine-tuning을 구성한 competition project입니다.

Multilingual IRData RefinementLoRAeCeLLM-MQC/QILLM Fine-tuning
기간2025
역할팀원 · 기술보고서 공동저자
기관·대회Alibaba International Tech · CIKM 2025
대표 결과0.8819 · Special Award
MULTILINGUAL RELEVANCE MODELING QUERY × PRODUCT ENKOJAESFR · AR+ QC · Query–Category QI · Query–Item DATA-CENTRIC PIPELINE 01 · Quality Refinement 02 · Task-specific Tagging 03 · LoRA Fine-tuning LT · HCT · SIT · DG · ICL/CoT FINAL SCORE 0.8819 SPECIAL AWARD QC 0.8861 · QI 0.8778

01 · PROBLEM & CONTEXT

언어가 달라도 ‘이 상품이 이 질의와 관련 있는가’를 판단해야 했습니다.

대회는 다국어 전자상거래 검색에서 Query–Category(QC)와 Query–Item(QI)의 관련도를 예측하는 문제였습니다. 일부 언어는 학습 데이터에 없고 테스트에만 등장했기 때문에, 특정 언어의 표면 표현보다 언어 간 일반화와 데이터 품질이 중요했습니다.

핵심 관찰더 큰 모델 하나보다, 노이즈가 섞인 데이터와 언어·카테고리 구조를 어떻게 정리해 모델에 전달하는지가 성능에 크게 영향을 주었습니다.

02 · ROLE & CONSTRAINTS

팀원과 기술보고서 공동저자로 참여했습니다.

공개 기술보고서에는 개인별 구현 범위가 분리되어 있지 않으므로, 이 페이지는 개인 기여를 과장하지 않고 팀 차원의 방법과 결과를 설명합니다. 핵심 제약은 다국어 분포 차이, 라벨 노이즈 가능성, QC/QI 두 과업의 상이한 구조, 그리고 제한된 실험 예산이었습니다.

03 · APPROACH

모델보다 먼저 데이터를 정제하고 구조 신호를 넣었습니다.

01

Quality Refinement

파인튜닝 모델의 재예측과 TF-IDF/Jaccard 유사도를 결합해 라벨·예측·표면 유사도가 강하게 충돌하는 샘플을 탐지하고 정제했습니다.

02

언어·과업별 태깅

Language Tagging과 함께 QC에는 계층 카테고리 태깅, QI에는 의미 속성 태깅과 설명 생성을 적용했습니다.

03

경량 파인튜닝과 추론 전략

eCeLLM-M 기반 LoRA 파인튜닝을 수행하고, ICL과 CoT를 포함한 여러 추론 구성을 검토했습니다.

04

QC/QI 균형 최적화

한 과업의 점수만 높이는 대신 검증 세트에서 두 과업의 평균 성능과 언어별 안정성을 함께 확인했습니다.

04 · OUTCOME

공개 기술보고서 기준 최종 0.8819와 Special Award.

공개 기술보고서는 QC 0.8861, QI 0.8778, 종합 0.8819를 기록하고 최종 리더보드 5위와 Special Award를 보고합니다. 방법과 실험은 CIKM 2025에서 기술보고서로 발표되었습니다.

0.8861QC score
0.8778QI score
0.8819Overall

기술보고서 보기

05 · LEARNINGS

다국어 검색에서는 데이터 품질 자체가 모델 설계입니다.

언어별 데이터량과 분포가 다를 때는 모든 샘플을 동일하게 취급하는 것보다, 노이즈와 구조를 명시적으로 다루는 편이 안정적이었습니다. 이후 RAG 연구에서도 검색 범위를 넓히기 전에 후보의 품질과 조직 방식을 먼저 보게 된 계기가 됐습니다.