InfoGrab DocsInfoGrab Docs

메트릭 기반 평가

Note Pro 및 Enterprise 플랜에서 사용 가능 메트릭 기반 평가는 Pro 및 Enterprise 플랜에서 사용할 수 있습니다. 등록된 커뮤니티 및 Starter 플랜 사용자도 단일 워크플로에 한해 사용할 수 있습니다. 메트릭 기반 평가란 무엇인가요? # 워크플로가 배포 준비를 마치면, 빌드하는 동안 사용했던 것 보다 더 많은 예제로 테스트하고 싶을 것입니다. 예를 들어, 프로덕션 실행에서 엣지 케이스가 나타나기 시작하면, 이를 테스트 데이터셋에 추가하여 해당 케이스가 확실히 커버되도록 하고 싶을 것입니다. 프로덕션 데이터로부터 구축된 것과 같은 대규모 데이터셋의 경우, 결과를 단순히 눈으로 훑어보는 것만으로는 성능을 파악하기 어려울 수 있습니다. 대신 성능을 측정해야 합니다. 메트릭 기반 평가는 각 테스트 실행에 하나 이상의 점수를 할당할 수 있으며, 이를 이전 실행과 비교할 수 있습니다. 개별 점수는 전체 데이터셋에 대한 성능을 측정하기 위해 집계됩니다. 이 기능을 사용하면 메트릭을 계산하는 평가를 실행하고, 실행 간에 해당 메트릭이 어떻게 변화하는지 추적하며, 그 변화의 원인을 자세히 파고들 수 있습니다. 메트릭은 결정론적 함수(예: 두 문자열 간의 거리)일 수도 있고, AI를 사용하여 계산할 수도 있습니다. 메트릭은 종종 출력이 참조 출력 (그라운드 트루스(ground truth)라고도 함)에서 얼마나 벗어났는지 확인하는 것을 포함합니다. 이를 위해서는 데이터셋에 해당 참조 출력이 포함되어 있어야 합니다. 다만 일부 평가는 이 참조 출력이 필요하지 않습니다(예: 텍스트의 감정 또는 유해성을 확인하는 경우). 작동 방식 # Note Google Sheets 자격 증명 평가는 테스트 데이터셋을 저장하기 위해 데이터 테이블(data table) 또는 Google Sheets를 사용합니다. Google Sheets를 데이터셋 소스로 사용하려면 Google Sheets 자격 증명 을 구성하세요. 경량 평가 설정 워크플로에 메트릭 추가 평가 실행 및 결과 확인 1. 경량 평가 설정 # 설정 지침 에 따라 데이터셋을 생성하고 이를 워크플로에 연결하여 출력을 다시 데이터셋에 기록하세요. 다음 단계에서는 경량 평가 문서에서 사용한 것과 동일한 지원 티켓 분류 워크플로를 사용합니다. 2. 워크플로에 메트릭 추가 # 메트릭은 워크플로의 출력을 점수화하는 데 사용되는 차원입니다. 메트릭은 실제 워크플로 출력을 참조 출력과 비교하는 경우가 많습니다. 메트릭을 계산할 때 AI를 사용하는 것이 일반적이지만, 코드만으로 계산이 가능한 경우도 있습니다. n8n에서 메트릭은 항상 숫자입니다. 워크플로가 출력을 생성한 이후 시점에 메트릭을 계산하는 로직을 추가해야 합니다. 메트릭이 사용하는 참조 출력은 데이터셋의 열(column)로 추가할 수 있습니다. 이렇게 하면 평가 트리거에 의해 해당 값이 출력되므로, 워크플로 내에서 확실히 사용할 수 있게 됩니다. Set Metrics 작업을 사용하여 다음을 계산할 수 있습니다. 정확성(AI 기반) : 답변의 의