Learn.ai.kr
← AI 노트

멀티 에이전트 연구는 어떻게 일을 나누고 다시 합칠까요?

Anthropic Research 시스템의 내부 평가, 실패 사례, 오케스트레이션과 출처 검증 절차를 따라가며 여러 에이전트가 함께 일할 때 필요한 공통 기준을 살펴봅니다.

최재현 · 2026.10.02

LinkedIn 공유Threads 공유

자료 기준일: 2025-06-13. Anthropic이 「How we built our multi-agent research system」을 공개한 날짜입니다. 본문 수치는 당시 Claude Opus 4·Sonnet 4 구성과 Anthropic 내부 평가 기준이며, 현재 모델 성능을 뜻하지 않습니다.

여러 에이전트를 만든다고 협업이 생기지는 않습니다. Anthropic이 2025년 6월 공개한 Research 시스템은 중앙 에이전트가 연구 계획을 세우고, 전문 하위 에이전트가 동시에 검색하고, 다시 중앙에서 결과를 합치는 구조입니다. 이 글은 결과뿐 아니라 연구에 멀티 에이전트를 쓴 이유와 초기에 실패한 내용까지 공개합니다.

연구는 다음 검색을 미리 정하기 어렵습니다

Anthropic은 복잡한 연구를 열린 문제로 봅니다. 처음 찾은 자료에 따라 다음 질문이 바뀌고, 예상하지 못한 연결을 따라가야 합니다. 고정된 1회 검색이나 정해진 선형 절차로는 이 변화를 다루기 어렵습니다. 하위 에이전트는 각자 별도 맥락을 사용해 서로 다른 방향을 탐색하고, 찾은 내용을 압축해 중앙 에이전트에 전달합니다. 하나의 긴 대화에 모든 검색 기록을 넣는 대신, 독립된 조사 공간을 늘리는 방식입니다.

내부 평가에서 Claude Opus 4가 중앙을 맡고 Claude Sonnet 4가 하위 조사를 수행한 시스템은 단일 Claude Opus 4보다 Anthropic의 연구 평가에서 90.2% 높은 성과를 냈습니다. 예시 과제는 정보기술 분야 S&P 500 기업의 이사진을 모두 찾는 일이었습니다. 단일 에이전트는 순차 검색으로 답을 완성하지 못했고, 멀티 에이전트는 기업 집합을 나눠 조사했습니다. 본문에 나오는 90.2%, 토큰 사용량 약 4배·15배, 연구 시간 최대 90%, 작업 완료 시간 40% 감소는 모두 Anthropic이 자사 시스템을 평가해 보고한 값이며 독립 검증 수치가 아닙니다.

다만 이 결과를 모든 업무에 적용할 수는 없습니다. Anthropic의 내부 평가이며, 폭넓게 독립 검색할 수 있는 질문에 특히 잘 맞았다는 설명입니다. BrowseComp 평가 분석에서는 토큰 사용량, 도구 호출 수, 모델 선택이 성과 차이의 95%를 설명했고, 토큰 사용량 하나가 80%를 설명했습니다. 멀티 에이전트의 성과가 “여럿이어서” 자동으로 생긴 것이 아니라, 별도 맥락과 도구 호출에 더 많은 계산을 투입한 결과라는 해석이 가능합니다.

비용도 큽니다. Anthropic의 운영 데이터에서 일반 에이전트는 채팅보다 약 4배, 멀티 에이전트는 약 15배 많은 토큰을 사용했습니다. 모든 에이전트가 같은 맥락을 공유해야 하거나 작업 의존성이 많은 분야에는 잘 맞지 않는다고 적었습니다. 코딩은 연구보다 실제 병렬화할 작업이 적고, 현재 에이전트가 실시간으로 서로 조정하고 위임하는 능력에도 제한이 있다고 설명합니다.

중앙 에이전트가 계획하고 출처 담당이 인용을 확인합니다

Research 시스템에서 사용자의 질문은 LeadResearcher로 들어갑니다. 중앙 에이전트는 접근 방법을 정하고 계획을 메모리에 저장합니다. 글에 따르면 맥락이 20만 토큰을 넘으면 잘릴 수 있으므로, 계획을 외부 메모리에 남겨 계속 사용할 수 있게 했습니다.

다음으로 중앙 에이전트가 구체적인 연구 과제를 적어 하위 에이전트를 만듭니다. 각 하위 에이전트는 검색 도구를 쓰고, 결과 품질과 빠진 내용을 판단하며, 필요한 경우 검색어를 바꿉니다. 중앙 에이전트는 돌아온 결과를 합친 뒤 조사가 더 필요한지 결정합니다. 충분하다고 판단하면 문서와 보고서를 CitationAgent에 넘깁니다. 이 담당은 각 주장에 맞는 출처 위치를 찾아 인용을 붙입니다. 조사와 인용 검증을 분리한 것입니다.

이 구조에서 공통 기준을 세우려면 하위 작업마다 목표, 출력 형식, 사용할 도구와 출처, 맡지 말아야 할 범위를 적어야 합니다. 중앙 에이전트는 조사 범위를 겹치지 않게 나누고, 결과를 어떤 형식으로 받을지 정합니다. 마지막에는 인용 담당이 주장과 출처가 맞는지 다시 확인합니다.

멀티 에이전트 연구와 출처 검증

Anthropic Research의 계획·병렬 조사·종합·인용 확인 구조. 하위 조사 수는 과제에 맞게 조정합니다. 도식 크게 보기

초기 시스템은 일을 너무 많이 벌였습니다

Anthropic의 초기 에이전트는 간단한 질문에도 하위 에이전트 50개를 만들고, 존재하지 않는 출처를 끝없이 찾고, 지나친 진행 보고로 서로의 작업을 방해했습니다. “반도체 부족을 조사하라”처럼 짧은 지시를 주었을 때에는 한 하위 에이전트가 2021년 자동차 반도체 위기를 찾는 동안 다른 2개가 2025년 공급망을 중복 조사했습니다. 목표와 기간, 결과 형식, 담당 범위가 빠지면 분업이 아니라 중복 검색이 된다는 사례입니다.

연구팀은 질문 난이도에 따라 예산을 다르게 주는 규칙도 프롬프트에 넣었습니다. 단순 사실 확인은 에이전트 1개와 도구 호출 3~10회, 직접 비교는 하위 에이전트 2~4개와 각각 10~15회, 복잡한 연구는 역할을 명확히 나눈 하위 에이전트 10개 이상을 사용할 수 있게 했습니다. 이 숫자는 Anthropic 시스템의 운영 지침이지 일반 표준은 아닙니다.

검색 방식도 고쳤습니다. 처음부터 길고 구체적인 검색어를 쓰면 결과가 거의 없어서, 짧고 넓게 찾은 뒤 자료를 보고 범위를 좁히게 했습니다. 중앙 에이전트는 보통 하위 에이전트 3~5개를 동시에 시작하고, 하위 에이전트도 도구 3개 이상을 병렬로 호출하게 했습니다. Anthropic은 이 변경으로 복잡한 질문의 연구 시간이 최대 90% 줄었다고 보고했습니다. “최대” 수치이며 과제와 시스템 조건에 따라 달라집니다.

도구 설명도 실험 대상이었습니다. 연구팀은 문제가 있는 MCP 도구를 여러 차례 사용해 실패 원인을 찾고 설명을 다시 쓰는 도구 테스트 에이전트를 만들었습니다. 새 설명을 사용한 이후 다른 에이전트의 작업 완료 시간이 40% 줄었다고 적었습니다. 프롬프트만 고치는 것이 아니라 도구 설명의 구체성이 전체 조정 비용을 바꾼 사례입니다.

평가는 경로보다 결과와 출처를 봅니다

멀티 에이전트는 같은 질문에도 서로 다른 검색 경로를 택합니다. 그래서 Anthropic은 미리 정한 정답 경로를 그대로 따랐는지보다 결과를 평가했습니다. 사실 정확성, 주장과 인용의 일치, 요청 범위의 완결성, 1차 자료 우선 여부, 도구 사용의 효율성을 0.0~1.0 점수와 통과 여부로 판정했습니다. 초기에는 실제 사용을 대표하는 질문 약 20개로 시작했고, 프롬프트 수정으로 성공률이 30%에서 80%로 오르는 큰 변화는 적은 표본에서도 확인할 수 있었다고 설명합니다.

자동 평가만으로는 부족했습니다. 사람 검토자는 초기 시스템이 권위 있는 학술 PDF보다 검색 노출에 유리한 콘텐츠 농장을 자주 고른다는 편향을 발견했습니다. 연구팀은 출처 품질 기준을 프롬프트에 추가했습니다. 운영 단계에서는 전체 실행 추적을 넣어 검색어가 나빴는지, 출처 선택이 틀렸는지, 도구 오류가 있었는지 확인했습니다.

교육 예시에서도 공통 정의가 먼저입니다

제조 AX 리더 검토 실습에는 교육용 검사 병목 자료가 있습니다. 최초 검사 제품 1만 개, 재검 대상 고유 제품 600개, 재검 실행 900회를 구분하고, 비계획 정지 120분 중 원인 코드가 없는 50분을 따로 표시합니다. 생산·품질·보전·재무·고객 대응 관점에서 질문을 만들되, 각 부서 의견을 실제 원인으로 확정하지 않습니다.

이 자료를 여러 에이전트에게 나눈다면 “제품 수”의 정의, 기간, 단위, 사실과 가설 표시, 필요한 출처, 결과 형식을 먼저 공유해야 합니다. 한 에이전트는 고유 제품 600개를 세고 다른 에이전트는 실행 900회를 세면 결과를 합칠 수 없습니다.

에이전트를 늘리기 전에는 작업이 실제로 병렬화되는지, 중앙에서 계획과 예산을 조정할 수 있는지, 각 하위 작업에 목표와 출처 기준이 있는지, 인용과 최종 결과를 별도로 검증하는지 확인해야 합니다. 이 조건이 없으면 에이전트 수만 늘고 검색 비용과 중복도 함께 늘어납니다.

참고자료