Artificial Analysis가 AI 에이전트용 검색 API를 종합 평가하는 'Search Index' 벤치마크를 공개했다. Parallel, Exa, Firecrawl, You.com, Tavily, Keenable, Brave 등 7개 제공사가 초기 라인업에 포함됐다.
측정 방법론
모든 제공사는 동일한 모델(GPT-5.6 Luna)과 동일한 에이전트 환경에서 테스트된다. 변수는 검색 제공사 하나뿐이다. 에이전트는 Artificial Analysis가 만든 오픈소스 프레임워크 Stirrup 위에서 구동되며, 과제당 25회 실행으로 웹 페이지를 검색·수집한다.
벤치마크는 세 항목을 동일 비중으로 합산한다.
| 항목 | 설명 | 문항 수 |
|---|---|---|
| DeepSearchQA | 복수 쿼리가 필요한 리서치 질문 | 900개 |
| BrowseComp | 다단계 탐색이 필요한 난이도 높은 사실 확인 | 200개 |
| AA-Omniscience | 6개 지식 도메인 종합 질문 | 600개 |
검색 도구 없이 모델 단독으로 답할 때 기준 점수는 33점이다.
품질·비용·속도 비교
▼ 주요 검색 API 성능 비교 (출처: Artificial Analysis Search Index)
| 제공사 | 품질 점수 | 과제당 총비용 ($) | 쿼리당 응답시간 (초) |
|---|---|---|---|
| Parallel (advanced) | 75 | 0.084 | - |
| Exa | 74 | - | - |
| Firecrawl | 73 | - | - |
| Parallel (basic) | 73 | 0.11 | 1.03 |
| Parallel (turbo) | 67 | - | 0.51 |
| 도구 없음 (기준) | 33 | - | - |
검색 품질이 높을수록 총비용은 오히려 낮아졌다. Parallel (advanced)는 Basic 대비 토큰 사용량이 40% 이상 줄었고, 검색 비용 자체는 더 들지만 총비용은 $0.084로 Basic의 $0.11보다 낮았다. 에이전트가 처음부터 좋은 결과를 받으면 추가 쿼리를 덜 돌리기 때문이다.
속도는 다른 결과를 보였다. Parallel (turbo)는 쿼리당 응답시간이 0.51초로 Basic(1.03초)의 절반이지만, 품질 점수(67)가 낮아 에이전트가 더 많은 반복 실행을 하게 된다. 결국 과제 완료까지 걸리는 총 시간은 Basic과 거의 같았다.
Artificial Analysis는 Parallel, Firecrawl, Parallel (turbo)를 비용 대비 성능 최적 조합으로 꼽았다.
국내 AI 에이전트 개발사 관점
국내에서 AI 에이전트 서비스를 개발할 때 검색 API 선택은 응답 품질과 운영 비용 모두에 영향을 미친다. 이번 벤치마크는 '쿼리당 단가'가 아니라 '과제 완료까지의 총비용'으로 비교해야 한다는 점을 수치로 보여준다. 검색 품질이 낮은 API를 저렴하다고 선택하면 에이전트 반복 실행 비용이 늘어 총비용이 역전될 수 있다.
벤치마크 전체 방법론은 Artificial Analysis 공식 사이트에 공개돼 있으며, 추가 제공사는 신청을 통해 참여할 수 있다.








