메트릭 기반 평가
n8n v2.29Pro 및 Enterprise 플랜에서 사용 가능 메트릭 기반 평가는 Pro 및 Enterprise 플랜에서 사용할 수 있습니다. 워크플로가 배포 준비를 마치면, 빌드하는 동안 사용했던 것보다 더 많은 예제로 테스트하고 싶을 것입니다.
Pro 및 Enterprise 플랜에서 사용 가능
메트릭 기반 평가는 Pro 및 Enterprise 플랜에서 사용할 수 있습니다. 등록된 커뮤니티 및 Starter 플랜 사용자도 단일 워크플로에 한해 사용할 수 있습니다.
메트릭 기반 평가란 무엇인가요?#
워크플로가 배포 준비를 마치면, 빌드하는 동안 사용했던 것보다 더 많은 예제로 테스트하고 싶을 것입니다.
예를 들어, 프로덕션 실행에서 엣지 케이스가 나타나기 시작하면, 이를 테스트 데이터셋에 추가하여 해당 케이스가 확실히 커버되도록 하고 싶을 것입니다.
프로덕션 데이터로부터 구축된 것과 같은 대규모 데이터셋의 경우, 결과를 단순히 눈으로 훑어보는 것만으로는 성능을 파악하기 어려울 수 있습니다. 대신 성능을 측정해야 합니다. 메트릭 기반 평가는 각 테스트 실행에 하나 이상의 점수를 할당할 수 있으며, 이를 이전 실행과 비교할 수 있습니다. 개별 점수는 전체 데이터셋에 대한 성능을 측정하기 위해 집계됩니다.
이 기능을 사용하면 메트릭을 계산하는 평가를 실행하고, 실행 간에 해당 메트릭이 어떻게 변화하는지 추적하며, 그 변화의 원인을 자세히 파고들 수 있습니다.
메트릭은 결정론적 함수(예: 두 문자열 간의 거리)일 수도 있고, AI를 사용하여 계산할 수도 있습니다. 메트릭은 종종 출력이 참조 출력(그라운드 트루스(ground truth)라고도 함)에서 얼마나 벗어났는지 확인하는 것을 포함합니다. 이를 위해서는 데이터셋에 해당 참조 출력이 포함되어 있어야 합니다. 다만 일부 평가는 이 참조 출력이 필요하지 않습니다(예: 텍스트의 감정 또는 유해성을 확인하는 경우).
작동 방식#
Google Sheets 자격 증명
평가는 테스트 데이터셋을 저장하기 위해 데이터 테이블(data table) 또는 Google Sheets를 사용합니다. Google Sheets를 데이터셋 소스로 사용하려면 Google Sheets 자격 증명을 구성하세요.
- 경량 평가 설정
- 워크플로에 메트릭 추가
- 평가 실행 및 결과 확인
1. 경량 평가 설정#
설정 지침에 따라 데이터셋을 생성하고 이를 워크플로에 연결하여 출력을 다시 데이터셋에 기록하세요.
다음 단계에서는 경량 평가 문서에서 사용한 것과 동일한 지원 티켓 분류 워크플로를 사용합니다.

2. 워크플로에 메트릭 추가#
메트릭은 워크플로의 출력을 점수화하는 데 사용되는 차원입니다. 메트릭은 실제 워크플로 출력을 참조 출력과 비교하는 경우가 많습니다. 메트릭을 계산할 때 AI를 사용하는 것이 일반적이지만, 코드만으로 계산이 가능한 경우도 있습니다. n8n에서 메트릭은 항상 숫자입니다.
워크플로가 출력을 생성한 이후 시점에 메트릭을 계산하는 로직을 추가해야 합니다. 메트릭이 사용하는 참조 출력은 데이터셋의 열(column)로 추가할 수 있습니다. 이렇게 하면 평가 트리거에 의해 해당 값이 출력되므로, 워크플로 내에서 확실히 사용할 수 있게 됩니다.
Set Metrics 작업을 사용하여 다음을 계산할 수 있습니다.
- 정확성(AI 기반): 답변의 의미가 제공된 참조 답변과 일치하는지 여부입니다. 1에서 5까지의 척도를 사용하며, 5가 가장 좋은 점수입니다.
- 유용성(AI 기반): 응답이 주어진 질의에 답하는지 여부입니다. 1에서 5까지의 척도를 사용하며, 5가 가장 좋은 점수입니다.
- 문자열 유사도: 답변이 참조 답변과 얼마나 가까운지를 문자 단위(편집 거리)로 측정합니다. 0에서 1 사이의 점수를 반환합니다.
- 범주화: 답변이 참조 답변과 정확히 일치하는지 여부입니다. 일치하면 1, 그렇지 않으면 0을 반환합니다.
- 사용된 도구: 실행에서 도구를 사용했는지 여부입니다. 0에서 1 사이의 점수를 반환합니다.
커스텀 메트릭을 추가할 수도 있습니다. 워크플로 내에서 메트릭을 계산한 다음 Evaluation 노드에 매핑하기만 하면 됩니다. Set Metrics 작업을 사용하고 Metric으로 Custom Metrics를 선택하세요. 그런 다음 반환하려는 메트릭의 이름과 값을 설정할 수 있습니다.
예를 들면 다음과 같습니다.
- RAG 문서 관련성: 벡터 데이터베이스로 작업할 때, 검색된 문서가 질문과 관련이 있는지 여부입니다.
메트릭 계산은 지연 시간과 비용을 추가할 수 있으므로, 평가를 실행할 때만 계산하고 프로덕션 실행 시에는 피하고 싶을 수 있습니다. 이를 위해 메트릭 로직을 '평가 여부 확인' 작업 뒤에 배치하면 됩니다.

3. 평가 실행 및 결과 확인#
워크플로에서 Evaluations 탭으로 전환하고 Run Test 버튼을 클릭하세요. 평가가 시작됩니다. 평가가 완료되면 각 메트릭에 대한 요약 점수가 표시됩니다.
테스트 실행 행을 클릭하면 각 테스트 케이스의 결과를 확인할 수 있습니다. 개별 테스트 케이스를 클릭하면 이를 생성한 실행이 새 탭에서 열립니다.
테스트 케이스 병렬 실행#
동시성(concurrency)을 지원하는 플랜에서는 Run Test가 분할 버튼(split-button)으로 표시됩니다. 오른쪽의 캐럿(caret)을 클릭하면 몇 개의 테스트 케이스를 동시에 실행할지 제어하는 슬라이더가 있는 팝오버가 열립니다.
기본 최댓값은 플랜에 따라 다릅니다.
| 플랜 | 최대 병렬 테스트 케이스 수 |
|---|---|
| 커뮤니티 / Pro | 1 (순차 실행) |
| Business | 3 |
| Enterprise | 5 |
최댓값이 1인 경우 캐럿과 팝오버는 숨겨지고 Run Test는 일반 버튼으로 표시됩니다. 이 경우 실행은 이전 버전과 동일하게 순차적으로 이루어집니다.
셀프 호스팅 인스턴스는 플랜 등급과 무관하게 N8N_CONCURRENCY_EVALUATION_LIMIT 환경 변수로 최댓값을 재정의할 수 있습니다.
LLM 속도 제한(rate limit)
동시성을 높이면 평가 실행 속도가 빨라지지만, 업스트림 LLM의 속도 제한에 도달할 가능성도 커집니다. 속도 제한 오류가 발생하면 슬라이더를 낮추세요.