Tuân thủ prompt
Metric: bám prompt. Đọc riêng việc chủ thể, hành động, bối cảnh và ràng buộc có xuất hiện đúng hay không.
BENCHMARK PROTOCOL / V0.2
Prompt Atlas giúp đọc khác biệt giữa hai product route lịch sử. Mọi con số chỉ mô tả 90 prompt và một output đã chọn cho mỗi route; chúng không phải API model benchmark.
01
Mỗi phong cách bắt đầu từ một exact prompt có immutable recipe ID và SHA-256. Evidence mode chỉ mở so sánh khi có ít nhất hai provider thành công với cùng hai định danh này và còn truy xuất được output.
Hai nhãn trên là product route, không phải immutable API model snapshot. Route OpenAI không giữ lại model version; route Google chỉ giữ provider alias. Applied settings lịch sử không có snapshot đáng tin cậy và được hiển thị là unknown.
02
Metric: bám prompt. Đọc riêng việc chủ thể, hành động, bối cảnh và ràng buộc có xuất hiện đúng hay không.
Metrics: đúng phong cách, bố cục và kỹ thuật. Trục này không thay thế cho tuân thủ prompt.
Dữ liệu cũ lưu “toàn vẹn chi tiết” theo hướng 10 = ít artifact. UI công khai phép ánh xạ này thay vì giả định đây là thang severity gốc.
03
Đối chiếu exact prompt, product route, model disclosure, settings và output trước; sau đó đọc từng trục cùng scoring rationale. Prompt Atlas không công bố overall average, win count hay universal winner từ bộ mẫu này.
04
05
Manifest media liệt kê toàn bộ file đã tối ưu cho website. Mã nguồn, dữ liệu đã chuẩn hóa và lịch sử deploy được công khai trên GitHub.
Recipe được lưu trên thiết bị này.
Mở Composer