원문: https://blog.bytebytego.com/p/mcp-vs-a2a-vs-acp-how-ai-agents-actually 발신: ByteByteGo | 수신일: 2026-07-18
이번 주 시스템 설계 요약
- MCP vs A2A vs ACP: AI 에이전트들이 실제로 서로 어떻게 대화하는가
- 내가 가장 기대하는 8가지 프론티어 오픈 모델
- LLM vs RAG vs Agent 평가 (evals)
- 분산 트레이싱은 높은 수준에서 어떻게 작동하는가?
- Redis 쿼리의 생애
MCP vs A2A vs ACP: AI 에이전트들이 실제로 서로 어떻게 대화하는가
에이전트는 혼자서도 뛰어나지만, 도구와 다른 에이전트들과 결합되면 그 능력이 배가된다. 그렇다면 어떻게 통신해야 할까?
MCP: 에이전트-도구 통신(Agent to Tool Communication)
호스트 앱이 사용자 요청을 받으면, 내장된 MCP 클라이언트가 이를 적절한 MCP 서버로 포맷하고 라우팅한다. 서버는 도구 호출을 실행하고 구조화된 응답을 반환한다. 에이전트는 그 결과를 사용하여 추론을 계속한다.
A2A: 에이전트-에이전트 통신(Agent to Agent Communication)
혼자서 작업을 완료할 수 없는 에이전트는 에이전트 카드(Agent Card, 잘 알려진 URL에 게시됨)를 통해 능력 있는 동료 에이전트를 발견하고, 작업을 위임하며, 구조화된 결과를 돌려받는다. 두 번째 에이전트가 작업 중에 추가 입력이 필요한 경우, input-required 상태로 일시 중지하고 첫 번째 에이전트에게 되돌아간다.
ACP: REST 기반 에이전트-에이전트 통신 (A2A에 통합)
ACP는 REST 우선 방식을 채택했다. 동료 에이전트들은 에이전트 매니페스트(Agent Manifest)를 통해 발견되고, HTTP로 직접 호출되며, 저지연 작업에는 동기적으로, 또는 비동기 SSE 스트림으로 응답한다.
프로덕션 환경에서 MCP와 A2A는 상호보완적이다. MCP는 도구 접근을 처리하고, A2A는 에이전트 간 통신을 처리한다.
내가 가장 기대하는 8가지 프론티어 오픈 모델
- Inkling (Thinking Machines): 이번 주 출시, 현재 미국 최강의 오픈 모델. 텍스트, 이미지, 오디오 입력 지원.
- Nemotron 3 Ultra (NVIDIA): 장기 실행 에이전트에 적합한 선택. Mamba 하이브리드가 긴 컨텍스트 추론 비용을 저렴하게 유지.
- GLM-5.2 (Z.ai): 현재 코딩에 가장 적합한 오픈 모델.
- Kimi K2.6 (Moonshot): 긴 에이전트 작업에 강함. 수백 번의 도구 호출에도 성능 유지.
- DeepSeek-V4 Pro: API를 통해 프론티어급 품질을 매우 저렴하게 이용하는 방법.
- Qwen3.6-35B (Alibaba): 자신의 기기에서 실행하기에 가장 좋은 모델. 24GB GPU 하나면 충분.
- Gemma 4 31B (Google): 온디바이스 멀티모달에 가장 좋은 선택. 게이밍 GPU에서 이미지와 오디오 입력 가능.
- MiniMax M3: 네이티브 비디오 입력을 가진 유일한 오픈 모델.
LLM vs RAG vs Agent 평가 (evals)
LLM, RAG 파이프라인, 에이전트는 서로 다른 시스템이지만, 평가 방식은 동일하다: 작업을 선택하고, 평가 데이터를 수집하고, 채점자를 개발한다.
- LLM: 입력은 프롬프트, 출력은 텍스트. 작업은 원시 모델이 단독으로 할 수 있는 것에 집중: 안전성, 코드, 지시 따르기. 채점자는 종종 최종 답변에 대한 LLM-as-judge.
- RAG: LLM 앞에 검색기가 추가됨. 따라서 두 가지를 채점: 검색(올바른 문서?) 및 생성(충실한 답변?).
- 코딩 에이전트: LLM이 도구와 루프를 얻음. 작업은 버그 수정 및 장기 계획 같은 종단 간 작업이 됨. 채점은 주로 코드 기반: 최종 패치에 대한 단위 테스트 실행.
- 멀티 에이전트 시스템: 오케스트레이터를 통해 조율하는 여러 에이전트. 작업은 조정과 역할 준수로 이동. 채점은 코드 테스트, LLM-as-judge, 인간 검토를 혼합.
파이프라인의 모든 새 구성 요소는 문제가 발생할 수 있는 새로운 지점이며, 평가가 잡아야 할 새로운 것이다.
분산 트레이싱은 높은 수준에서 어떻게 작동하는가?
- 서비스가 요청을 처리하면서 텔레메트리 데이터(트레이스, 로그, 메트릭)를 생성한다.
- OpenTelemetry 컬렉터가 모든 서비스의 데이터를 통합된 형식으로 수신한다.
- 컬렉터가 데이터를 세 스트림으로 분리: 트레이스, 로그, 메트릭.
- 각 스트림은 저장 및 분석을 위해 준비하는 수신 및 처리 단위로 전송된다.
- 처리된 데이터는 쿼리 및 장기 액세스를 위해 로그 데이터베이스에 저장된다.
- 데이터베이스의 데이터는 모니터링 및 디버깅을 위한 시각화 대시보드를 통해 시각화된다.
Redis 쿼리의 생애
Redis는 인메모리 데이터베이스로, 모든 데이터가 속도를 위해 RAM에 존재한다. 그러나 서버가 충돌하거나 재시작하면 데이터가 손실될 수 있다.
이 문제를 해결하기 위해 Redis는 두 가지 지속성 메커니즘을 제공한다:
AOF (Append-Only File)
클라이언트가 명령을 보내면, Redis는 먼저 메모리(RAM)에서 실행한다. 그 후, Redis는 AOF 파일에 명령을 추가하여 디스크에 기록한다. 이를 통해 모든 작업을 나중에 재생하여 데이터셋을 재구성할 수 있다. 명령이 먼저 실행되고 이후에 기록되므로, **쓰기는 논블로킹(non-blocking)**이다. 복구 프로세스는 이벤트 로그를 사용하여 기록된 명령을 재생한다.
RDB (Redis Database)
모든 명령을 기록하는 대신, Redis는 주기적으로 전체 데이터셋의 스냅샷을 찍을 수 있다.
메인 스레드가 서브프로세스(bgsave)를 포크하는데, 이 서브프로세스는 메인 스레드의 모든 인메모리 데이터를 공유한다. bgsave 서브프로세스는 메인 스레드에서 데이터를 읽고 RDB 파일에 기록한다.
Redis는 Copy-on-Write를 사용한다. 메인 스레드가 데이터를 수정하면, 데이터의 복사본이 생성되고 프로세스가 그 복사본으로 작업하여 쓰기가 차단되지 않는다. 스냅샷은 이후 디스크에 RDB 파일로 기록되어, Redis가 필요할 때 빠르게 스냅샷을 메모리에 다시 로드할 수 있게 한다.
혼합 방식
프로덕션에서 Redis는 종종 AOF와 RDB를 모두 사용한다. RDB는 압축된 스냅샷으로 빠른 재로드를 제공하고, AOF는 마지막 스냅샷 이후의 모든 작업을 기록하여 내구성을 보장한다.
핵심 요약 (20줄)
- AI 에이전트 간 통신 프로토콜 3종: MCP(도구 통신), A2A(에이전트 간 통신), ACP(REST 기반, A2A에 통합)
- MCP: 호스트 앱 → MCP 클라이언트 → MCP 서버 → 도구 실행 → 결과 반환 흐름
- A2A: 에이전트가 Agent Card로 동료 발견 → 작업 위임 → 구조화된 결과 수신
- ACP는 REST 기반으로 시작했으나 A2A에 병합 — 동기/비동기 SSE 스트림 지원
- 프로덕션: MCP(도구 접근) + A2A(에이전트 통신) 상호보완적으로 사용
- Inkling(Thinking Machines): 이번 주 출시, 미국 최강 오픈 모델, 텍스트·이미지·오디오 입력
- GLM-5.2(Z.ai): 현재 코딩 최고 오픈 모델
- Kimi K2.6(Moonshot): 수백 번 도구 호출에도 안정적인 장기 에이전트 작업
- Qwen3.6-35B(Alibaba): 24GB GPU 하나로 로컬 실행 가능한 최고 모델
- MiniMax M3: 네이티브 비디오 입력을 지원하는 유일한 오픈 모델
- LLM/RAG/에이전트 평가 공통 레시피: 작업 선택 → 평가 데이터 수집 → 채점자 개발
- RAG 평가: 검색 정확도(올바른 문서?) + 생성 충실도(정확한 답변?) 2단계 채점
- 코딩 에이전트: 단위 테스트로 최종 패치 평가 → 코드 기반 채점
- 멀티 에이전트: 코드 테스트 + LLM-as-judge + 인간 검토 혼합 방식
- 분산 트레이싱: 서비스 → OpenTelemetry 컬렉터 → 트레이스/로그/메트릭 분리 → 저장 → 시각화
- Redis AOF: 명령을 메모리 실행 후 디스크에 추가 기록 → 논블로킹 쓰기 → 복구 시 명령 재생
- Redis RDB: 주기적 스냅샷 → bgsave 서브프로세스 → Copy-on-Write 방식 → 빠른 복구
- Redis 혼합 방식: RDB(빠른 재로드) + AOF(매 작업 내구성 보장) 동시 사용
- 에이전트 파이프라인: 구성 요소가 늘어날수록 평가(evals) 포인트도 그만큼 증가
- 오픈 모델 트렌드: 추론 특화(Nemotron), 코딩 특화(GLM), 온디바이스(Qwen/Gemma), 비디오 입력(MiniMax)