Chuyển đến nội dung

Hướng dẫn

Những gì hoạt động hôm nay

Những gì bạn có thể đánh giá bằng Oloproof hôm nay, cách bạn tiếp cận chúng (Python SDK, oloproof.yaml và CLI, hoặc trình duyệt), và những gì chưa được xây dựng. Trang này dựa trên đợt kiểm định năng lực ngày 8 tháng 10 năm 2026, một đợt rà soát nội bộ đã kiểm tra từng dòng so với mã nguồn và các bài kiểm thử của nó chứ không so với kế hoạch.

Cách đọc trang này

"SDK" nghĩa là gói Python (import oloproof). "YAML" nghĩa là một dự án bạn chạy bằng oloproof run từ oloproof.yaml. Chúng không phải cùng một bề mặt: một vài bộ đánh giá chỉ có ở một trong hai, và trang này cho biết là bên nào. "Trình duyệt" nghĩa là workbench được lưu trữ, nơi hiển thị những gì bạn oloproof push; nó không chạy các đợt đánh giá mà bạn chưa định nghĩa trong mã hoặc YAML.

Oloproof gọi hệ thống của bạn; nó không lưu trữ, không cô lập và không đặt lại hệ thống đó. Ứng dụng của bạn tự quản lý trạng thái, phiên và tác dụng phụ của công cụ trong một lần chạy.

Theo loại hệ thống

Hệ thống của bạnNhững gì hoạt độngỞ đâuChưa xây dựng
Bộ phân loại hoặc đầu ra có cấu trúcKhớp chính xác, chứa, regex, JSON schema, giám khảo theo rubric, giám khảo xác suất, bộ phân loại mô hình; tỷ lệ đạt kèm khoảngSDK và YAML; model_classifier, probability_judge và cascade chỉ có trong YAMLn/a
Sinh văn bản, tóm tắt, trích xuấtCùng các phép kiểm tra trên văn bản tự do, giám khảo theo rubric, mức đồng thuận của giám khảo với nhãn của con người, ưu tiên theo cặpSDK và YAML; ưu tiên là lệnh oloproof preferBLEU, ROUGE hoặc độ tương đồng embedding (tự viết bằng @evaluator)
RAG bạn chạy như hộp đenHit rate, recall, MRR, nDCG, tính hợp lệ của trích dẫn, giám khảo về tính có căn cứ và về mức hỗ trợ của trích dẫn, từ các artifact truy xuất mà hệ thống của bạn ghi lại hoặc trả vềSDK và YAMLChẩn đoán: diagnose cần một hệ thống theo giai đoạn
RAG xây dựng theo giai đoạnTất cả những điều trên, bộ nhớ đệm theo giai đoạn, và oloproof diagnose với ngữ cảnh chuẩn, thay đổi top-k hoặc reranker bên cạnh một nhóm đối chứngSDK @rag_system, YAML system.rag, CLI diagnoseCác can thiệp ngoài ba loại đó
Agent dùng công cụGiới hạn số bước, công cụ bắt buộc và bị cấm, thứ tự công cụ, vòng lặp, ràng buộc, từ một quỹ đạo đã ghi lạiSDK và YAMLMột phép kiểm tra chất lượng quỹ đạo do LLM chấm
Hệ thống đa agentĐịnh tuyến, quyền dùng công cụ theo từng agent, giới hạn chuyển giaoSDK và YAMLn/a
Phát lại agentChạy lại một trường hợp từ một checkpoint để gắn nhãn một bước là cần thiết hay khôngChỉ SDK (replay_case), cho hệ thống hỗ trợ checkpointMột lệnh CLI
Mô hình phân loại nhị phânĐộ chính xác, precision, recall, Brier, log loss, xếp hạng (AUC)SDK và YAML predictive:n/a
Mô hình đa lớpMỗi lớp một khối (một lớp so với phần còn lại)SDK và YAMLTrung bình macro hoặc micro
Mô hình hồi quySai số tuyệt đối trong một target_range đã khai báoSDK và YAMLSai số bình phương, R bình phương, sai số không giới hạn
Hội thoại nhiều lượtLiệu mọi lượt theo kịch bản có được trả lời hay không, và một giám khảo theo rubric trên toàn bộ hội thoạiChỉ SDK (ConversationCompleted, ConversationJudge)Kiểu YAML, điểm theo từng lượt, trình mô phỏng người dùng, phát lại hội thoại
Hình ảnh, âm thanh, videoKhông có gì gốc: một trường hợp có thể mang một URL hoặc một tệp đã mã hóa qua hệ thống của bạn, và @evaluator có thể kiểm tra đầu ran/aGiám khảo chỉ thấy văn bản JSON; không có artifact đa phương tiện hay hiển thị

Một cách làm thay cho hội thoại nhiều lượt: biến mỗi lượt thành một trường hợp và gán cho các lượt của cùng một hội thoại cùng một group_id, để phân tích coi chúng là một cụm (Cụm). Khi đó mỗi lượt là một lời gọi riêng, không phải một đoạn hội thoại được ghi lại.

Kết nối hệ thống của bạn

  • Callable Python: @system trong SDK hoặc system.callable: module:function trong YAML. Nó nhận input của trường hợp và trả về một dictionary. Cả hàm đồng bộ lẫn bất đồng bộ đều hoạt động.
  • HTTP: system.http với url, method, output_path, artifacts và timeout_s. Đầu vào của trường hợp được gửi dưới dạng thân JSON và phản hồi được đọc dưới dạng JSON. Chưa thể cấu hình header và xác thực; hãy đặt một endpoint cần khóa phía sau một callable có thêm khóa đó.
  • Bộ đánh giá tùy chỉnh: @evaluator trong SDK. oloproof.yaml chưa thể gọi tên một bộ như vậy.

Quy trình làm việc

Quy trìnhNhững gì hoạt độngChưa xây dựng
So sánh hai phiên bảnVượt trội theo cặp, không kém hơn và tương đương; lát cắt có kiểm soát đa so sánhn/a
CIMã thoát của oloproof gate từ block_on trong chính sách của bạn, phê duyệt, bản ghi có chữ ký; bản tóm tắt pull request (--summary markdown)n/a
Đánh giá của con ngườiNhãn từ một tệp hoặc từ terminal; hàng đợi đánh giá trên trình duyệt với người đánh giá được phân công trên một workspace được lưu trữHàng đợi đánh giá trên trình duyệt cho một dự án cục bộ
Workbench trên trình duyệtLần chạy, trường hợp, so sánh, chẩn đoán, bộ đánh giá, đánh giá và lưu lượng, sau oloproof pushNhập tập dữ liệu, soạn giám khảo, lịch chạy, cảnh báo và postmortem (hiển thị là đã lên kế hoạch)
Trình duyệt cục bộn/aKhông có lệnh CLI nào phục vụ workbench cục bộ; workbench được lưu trữ

Những gì đã được kiểm thử, và bằng cách nào

Mọi nhóm ở trên đều có kiểm thử tự động, chạy trên fixture và nhà cung cấp giả lập. Các lần chạy với hệ thống thật và mô hình thật đã được ghi lại cho RAG, một agent đơn và một hội thoại nhiều lượt; chưa có cho mô hình dự đoán hay hệ thống đa agent. Mỗi phương pháp thống kê dùng để quyết định phát hành đều được chấp nhận qua đợt kiểm định riêng của nó; một chỉ số không có khoảng được chấp nhận sẽ không quyết định một quy tắc dựa trên khoảng, và một quy tắc cần đến khoảng đó sẽ trả về MANUAL_REVIEW hoặc INSUFFICIENT_EVIDENCE kèm lý do.