# Cấu hình Đánh giá Hành vi Agent (AWKit Evaluation Setup)
# Định nghĩa các tiêu chí và mô hình Trọng tài LLM dùng để chấm điểm.

judge:
  model: "gemini-1.5-flash"  # Sử dụng gemini-1.5-flash để tiết kiệm chi phí, hoặc gemini-1.5-pro để chính xác hơn
  temperature: 0.0

dataset:
  path: "tests/eval/cases.jsonl"  # Đường dẫn tới bộ dữ liệu kiểm thử mặc định

metrics:
  - name: "final_response_quality"
    threshold: 4.0  # Điểm tối thiểu đạt yêu cầu (Thang điểm 1 - 5)
    description: "Đánh giá chất lượng ngôn ngữ, tính chính xác và đầy đủ thông tin của phản hồi."

  - name: "caveman_compliance"
    type: "LLMMetric"
    threshold: 4.5
    rubric: "Đánh giá mức độ tuân thủ luật Caveman Ultra. Phản hồi chat phải bằng Tiếng Việt, cực kỳ ngắn gọn (chỉ từ 1 đến 2 câu), không giải thích dài dòng hoặc chào hỏi sáo rỗng."
