콘텐츠로 이동

품질 출력 평가

품질 출력 평가는 대규모 모델의 출력이 기대에 부합하는지 확인하는 기능입니다. 평가 규칙을 구성하여 온라인 모델 호출 또는 지정된 범위의 데이터를 평가하고, 점수 및 규칙 적중 결과를 확인할 수 있습니다.

현재 Prompt EvalSchema Eval 두 가지 평가 유형을 지원합니다.

새 평가기 생성

Agent 모니터링 > 평가로 이동한 후 새 평가기 생성을 클릭합니다.

다음 정보를 구성합니다.

  1. 평가기 Skill 템플릿을 선택합니다.
  2. 평가 대상 유형을 선택합니다.
  3. 평가 입력 및 판단 규칙을 구성합니다.
  4. 테스트 데이터를 사용하여 시험 실행합니다.
  5. 결과가 기대에 부합하는지 확인한 후 평가기를 게시합니다.

Prompt Eval

Prompt Eval은 프롬프트를 통해 모델 입력 또는 출력을 판단하며, 콘텐츠 품질, 관련성, 완전성, 안전성 등 평가 시나리오에 적합합니다.

구성 시 다음을 설정해야 합니다.

  • 평가 프롬프트
  • 평가 결과 및 점수 규칙

평가 결과가 안정적으로 유지되도록 프롬프트에 평가 목표, 판단 기준, 반환 형식을 명확히 지정하는 것이 좋습니다.

Schema Eval

Schema Eval은 모델 출력이 지정된 데이터 구조를 준수하는지 확인하는 데 사용되며, 모델이 JSON이나 기타 구조화된 콘텐츠를 반환해야 하는 시나리오에 적합합니다.

구성 시 대상 Schema를 설정해야 합니다. 평가를 실행하면 시스템은 출력 콘텐츠의 필드, 유형, 구조가 요구 사항을 충족하는지 확인합니다.

평가기 테스트

평가기 게시 전에 테스트 데이터를 입력하여 시험 실행할 수 있습니다.

테스트 결과에는 평가 출력, 점수 또는 구조 검증 결과가 표시됩니다. 결과에 따라 프롬프트, Schema 또는 판단 규칙을 조정한 후 다시 테스트할 수 있습니다.

테스트가 통과하면 게시를 클릭하여 평가기가 실제 평가 작업에 사용되도록 합니다.

평가 실행

온라인 평가

온라인 평가는 온라인에서 생성되는 모델 호출 데이터를 지속적으로 확인하는 데 사용합니다.

대상 애플리케이션과 평가기를 선택하고 평가할 데이터 범위를 구성합니다. 작업이 활성화되면 시스템은 구성에 따라 조건에 맞는 데이터를 평가합니다.

배치 평가

배치 평가는 지정된 시간 범위 또는 쿼리 조건의 기존 모델 호출 데이터를 평가하는 데 사용합니다.

배치 평가 작업을 생성할 때:

  1. 대상 애플리케이션을 선택합니다.
  2. 시간 범위 및 필터 조건을 설정합니다.
  3. 사용할 평가기를 선택합니다.
  4. 확인 후 평가 작업을 시작합니다.

평가 결과 확인

평가 결과 페이지에서 다음을 확인할 수 있습니다.

  • 평가기 및 평가 방식
  • 평가 상태
  • 점수 또는 규칙 검증 결과
  • 모델 입력 및 출력
  • 평가 시간
  • 실패 원인

애플리케이션, 평가기, 평가 상태, 시간 범위 등의 조건으로 평가 결과를 필터링할 수 있습니다.

Note

평가 결과는 모델 출력, 평가 프롬프트 및 Schema 구성에 따라 달라집니다. 평가 작업을 실제로 활성화하기 전에 대표성이 있는 테스트 데이터를 사용하여 평가기 효과를 검증하는 것이 좋습니다.

수동 주석

수동 주석을 통해 모델 입력, 출력 및 호출 체인을 함께 검토하여 평가 결과를 재확인하고, 샘플을 데이터셋에 추가할 수 있습니다.

주석 큐 생성

Trace 쿼리 조건에 따라 주석 대기 큐를 생성합니다. 실패 및 Agent 판단 이상 등 데이터를 표시할 수 있습니다.

큐에는 대기 주석, 완료, 건너뜀 수와 현재 처리 진행률이 표시됩니다. 큐는 공유 대기 주석 목록을 사용하며, 담당자 배정, 가져오기, 중재 프로세스는 현재 지원되지 않습니다.

주석 제출

주석 워크벤치에서 입력, 출력, 호출 체인, 도구 호출, 사용자 피드백 및 기존 평가 결과를 확인한 후 다음을 작성합니다.

주석 내용 작성 요구 사항
Pass / Fail 필수
점수 선택 사항, 1~5점 지원
문제 유형 Fail 선택 시 필수
참고 답변, 메모 및 태그 선택 사항

작성을 완료한 후 "저장 후 다음 항목"을 선택하여 주석을 계속하거나, "저장 후 Dataset에 추가"를 선택하여 샘플을 축적할 수 있습니다.

다시 주석을 작성하면 이전 기록이 유지됩니다. 수동 주석 결과에는 출처가 표시되며, 플랫폼 평가 결과 및 외부 Score와 구분되어 표시됩니다.

데이터셋

데이터셋은 프로덕션 Trace 조건과 수동 주석 조건으로 구성되며, 샘플을 집중적으로 관리하고 배치 평가를 실행하는 데 사용됩니다.

배치 평가 시작

데이터셋에서 샘플을 선택하고 배치 평가를 시작합니다. 작업이 시작되면 이번에 사용할 샘플 범위가 고정되며, 이후 데이터셋 구성원이 변경되어도 실행 중인 작업에는 영향을 미치지 않습니다.

권한 설명

주석 큐 생성과 수동 주석 제출에는 주석 권한이 필요하고, 배치 평가 실행에는 평가 실행 권한이 필요합니다. 데이터셋, 주석 및 평가 결과는 모두 현재 워크스페이스와 원본 Trace의 액세스 권한을 따릅니다.

문서 평가

이 페이지가 도움이 되었나요?