فصل ۰۵ · علم سنجش

دقت، یک عدد تنها نیست

هر ادعای کیفیت باید dataset ID، نسخه، حجم نمونه، نحوهٔ split، داوری، بازهٔ اطمینان و تاریخ داشته باشد. سرعت، کالیبراسیون، drift و بار انسانی نیز بخشی از کیفیت‌اند.

Eval harness PILOT۲۰۰ نمونه SYNTHETICدقت production تأیید نشده

ابعاد کیفیت

Exact match و F1

Exact کل ساختار را سخت‌گیرانه می‌سنجد؛ F1 تعادل precision/recall اجزای درست را نشان می‌دهد. هر دو لازم‌اند.

ECE

اگر خروجی با اطمینان ۹۰٪ فقط ۶۰٪ درست باشد، confidence گمراه‌کننده است. ECE این فاصله را می‌سنجد.

PSI و drift

تغییر ترکیب ورودی‌ها، رده‌ها یا زبان می‌تواند بدون تغییر کد کیفیت را پایین بیاورد.

Latency p50/p95

میانه تجربهٔ عادی را نشان می‌دهد؛ p95 دم کند را. فقط average برای SLA کافی نیست.

Review burden

تعداد ارجاع، زمان داوری، age صف، disagreement و نرخ حل؛ کاهش خطا نباید با صف ناممکن خریداری شود.

Citation correctness

برای RAG، بازیابی خوب کافی نیست؛ ادعای پاسخ باید واقعاً توسط citation پشتیبانی شود.

مثال

دو سامانه ممکن است هر دو F1 برابر داشته باشند؛ یکی موارد سخت را صادقانه به انسان می‌فرستد و دیگری با اطمینان زیاد جواب غلط می‌دهد. ECE، referral rate و خطای تأییدشده این تفاوت را آشکار می‌کنند.

مجموعهٔ توسعه با پذیرش واقعی یکی نیست

SYNTHETIC

مجموعهٔ ۲۰۰ موردی

۲۰۰ نمونهٔ فارسی ساختگی در ۲۰ گروه برای wiring و توسعه وجود دارد. human adjudication و official reference آن false است؛ نتیجهٔ کامل روی همان set فقط development-set conformance است.

Golden development

برای یافتن regression و اصلاح prompt مفید است؛ نباید معیار generalization یا تأیید سازمانی شود.

Blind holdout واقعی

نمونهٔ representative، pseudonymized، جدا از توسعه و با داوری مستقل دوکارشناس؛ شرط ادعای production.

جزء شناسنامهچرا لازم است؟
dataset_id + version + hashجلوگیری از جابه‌جایی نامرئی داده
sampling frameدانستن اینکه نمونه نمایندهٔ کدام جمعیت است
train/dev/test separationجلوگیری از یادگیری پاسخ آزمون
dual adjudication + disagreementاندازه‌گیری ابهام انسانی و تعیین مرجع
n + CIتمایز تغییر واقعی از نوسان نمونه

آزمایشگاه طراحی پایلوت

این محاسبه‌گر فقط ظرفیت را برآورد می‌کند و هیچ داده‌ای ذخیره نمی‌کند.

سهم نمونه مستقلsample ÷ volume
پروندهٔ بازبینیبرآورد ظرفیت
کل ساعت کارشناسیدر دوره
بار روزانهتقسیم بر روزهای کاری

این ابزار چه چیزی را نمی‌گوید؟

نمی‌گوید ۶۰۰ نمونه برای هر رده و هر سطح خطا کافی است. اندازهٔ نمونه باید بر اساس prevalence، حساسیت ریسک و بازهٔ اطمینان مورد انتظار طراحی شود.

KPIهای عملیاتی و مالک تصمیم

KPIتعریفمالکواکنش
Referral rateارجاع به بازبینی ÷ کلعملیات + کیفیتظرفیت، آستانه و rule gap بررسی شود
Adjudication completionپروندهٔ بسته‌شده ÷ ارجاعمدیر پایشage و تخصیص صف اصلاح شود
Confirmed error rateخطای تأییدشده ÷ موارد داوری‌شدهاستانداردسازیregression و rollback rule/prompt
Evidence coverageخروجی دارای source/rule/version ÷ کلمالک خدمتانتشار بدون evidence متوقف شود
P95 latencyصدک ۹۵ زمان پاسخ هر workflowITتحلیل engine/queue/dependency
Drift PSIفاصله توزیع ورودی از baselineتیم دادهنمونه‌گیری و بازآموزی/قاعده پس از تصویب

دروازه‌های انتشار کیفیت

  1. Reproducible datasetmanifest، hash و script یکسان نتیجه را بازتولید کند.
  2. No protected regressionGTIN، اسم خاص، مدل، برند و قواعد first-word خراب نشوند.
  3. Metric + CIهر بهبود با n و confidence interval گزارش شود.
  4. Calibration and driftآستانه با ECE و cohort واقعی تنظیم شود، نه intuition.
  5. Human acceptanceموارد اختلاف حل و تأیید مسئول استاندارد ثبت شود.
  6. Operational canarylatency، صف، audit، هزینه و rollback در محیط هدف آزمون شود.