گزارش ارزیابی مستقل از رابط مدل نسخه آزمایشی

behinto-med-gemma

مدل تخصصی‌تر؛
پاسخ پزشکی فارسی بهتر.

نسخه ۲۷ میلیارد پارامتری بهینتو با تنظیم تخصصی روی پزشکی فارسی، در یک مقایسه هم‌وزن کمی بهتر از MedGemma 27B پایه عمل کرد—بهبودی کنترل‌شده در پاسخ مستقیم، فارسی حرفه‌ای و رفتار ایمن.

  • ≈۹ میلیاردتوکن در پیکره دانشی فارسی
  • ۱۴٬۰۲۷نمونه آزمایشی پالایش‌شده
  • ۱۰۰۰×بازنمونه‌گیری Bootstrap
مقایسه هم‌وزن نسخه ۲۷B27B tuned vs. 27B baseline
بهبود نسبی+۸٫۰٪بر داده‌های پزشکی فارسی
MedGemma 27B base۰٫۷۸۳
behinto-med-gemma 27B۰٫۸۴۶

تمام سه دروازه بحرانی ایمنی پاس شدند

+۸٫۰٪پاسخ‌گویی مستقیم
۸/۸موارد شکست بالینی اصلاح شد
۲۷B

مقایسه هم‌وزن۲۷B تنظیم‌شده در برابر ۲۷B پایه

FA

فارسی بومی‌ترخلوص زبانی ۰٫۹۷۹

تأیید پزشکدو ارزیاب نابینا

ایمنی در مرکز طراحیگیت‌های غیرقابل‌مصالحه

بنچمارک اصلی

برتری، عدد به عدد

مقایسه با medgemma-27b-it بدون تغییر و پشت همان لایه پرامپت تولید. بازه‌ها، اطمینان ۹۵٪ هستند.

MedGemma 27B پایهbehinto-med-gemma 27B

پاسخ‌گویی مستقیم

پاسخ کامل بدون پرسش غیرضروری

+۸٫۰٪ نسبی
۰٫۷۷۲
۰٫۸۳۴

دقتِ درخواست توضیح

پرسش تکمیلی فقط در جای درست

+۸٫۱٪ نسبی
۰٫۷۳۲
۰٫۷۹۱

توقف قاطع در توصیه پرخطر

جلوگیری روشن از اقدام آسیب‌زا

+۷٫۹٪ نسبی
۰٫۸۱۸
۰٫۸۸۳

لحن حرفه‌ای فارسی

امتیاز پزشکان از ۵

+۸٫۱٪ نسبی
۳٫۸۲
۴٫۱۳

خلوص زبان فارسی

پرهیز از آمیختگی ناخواسته زبانی

+۸٫۱٪ نسبی
۰٫۹۰۶
۰٫۹۷۹

نرخ توهم دارویی

کمتر، بهتر است

−۹٫۱٪ نسبی
۰٫۰۰۶۶
۰٫۰۰۶
بنچمارک پزشکی فارسی: شاخص مرکب صفر تا یک روی مجموعه probe12 + failure8 + heldout.

جایگاه در اکوسیستم

مقایسه روی پزشکی فارسی، نه بنچمارک عمومی

نمایی یکپارچه از مدل‌های عمومی و تخصصی روی شاخص پزشکی فارسی؛ behinto-med-gemma با تنظیم دامنه‌ای در جایگاه نخست قرار می‌گیرد.

ب
behinto-med-gemma۲۷B · تنظیم‌شده برای پزشکی فارسی
۰٫۸۴۶بهترین نتیجه هم‌سنجه
M
MedGemma 27B۲۷B · مدل پایه
۰٫۷۸۳مبنای مقایسه
G
Gemma 3 27B۲۷B · مدل عمومی
۰٫۷۷۶
D
DeepSeek V4 FlashMoE · حدود ۱۳B فعال / ۲۸۵B کل
۰٫۷۶۸
Q
Qwen3 30B-A3BMoE · حدود ۳B پارامتر فعال
۰٫۷۵۹
O
GPT-4o miniمدل بسته · اندازه پارامتری اعلام‌نشده
۰٫۷۴۶
Φ
Phi-4 14B۱۴B · مدل عمومی سبک
۰٫۷۳۱

داده آزمایشی: امتیاز مدل‌های عمومی نمونه‌ای برای چیدمان رابط است و نتیجه یک ارزیابی پزشکی منتشرشده نیست.

ایمنی قابل سنجش

بهتر شدن پاسخ،
به قیمت ایمنی تمام نشد.

امتیاز ترکیبی فقط زمانی معتبر می‌ماند که هر سه گیت بحرانی پاس شوند. behinto-med-gemma هر سه را پاس کرده است.

۸ از ۸ مورد شکست بالینی

پس از تنظیم دقیق، هر سه جزء توقف قاطع را با موفقیت پاس کردند.

گیت‌های بحرانی۳/۳ پاس
فراخوانی اورژانسحداقل ۰٫۹۸
۰٫۹۸۷
هشدار اورژانسی کاذبحداکثر ۰٫۰۵
۰٫۰۴۱
توهم داروییحداکثر ۰٫۰۱
۰٫۰۰۶

کنترل‌های تکمیلی رفتار پزشکی

توقف قاطع۰٫۸۸۳هدف ≥ ۰٫۸۵
خلوص فارسی۰٫۹۷۹هدف ≥ ۰٫۹۷
دقت توضیح‌خواهی۰٫۷۹۱هدف ≥ ۰٫۷۵
یکپارچگی امتناع۰٫۹۳۸نزدیک به هدف ۰٫۹۵

داده و آموزش

دانش فارسی عمیق، تنظیم دقیق حساب‌شده

پیکره دانشی مادر از کتاب‌های پیشرفته پزشکی فارسی با برآورد حدود ۹ میلیارد توکن ساخته شده؛ بنچمارک حاضر مربوط به نسخه آزمایشی پالایش‌شده و قابل ممیزی است.

۰۱
≈۹B

توکن در پیکره دانشی مادر

محتوای تخصصی فارسی برای پوشش واژگان، سبک بیان و دانش پزشکی بومی.

۰۲۱۴٬۰۲۷

نمونه آزمایشی منتخب

از ۱۴٬۶۲۸ جفت کاندید؛ ۶۰۱ نمونه در مرور پزشکان رد شد.

نرخ رد: ۴٫۱٪
۰۳۴۱٫۲M

توکن مواجهه آموزشی

سه دوره آموزش، میانگین طول ۱٬۰۴۷ توکن و بدون هم‌پوشانی هش با آزمون.

۱۲٬۶۲۴ آموزش / ۱٬۴۰۳ نگه‌داشته
۰۴<۱٪

پارامتر قابل آموزش

تنظیم کم‌پارامتر QLoRA روی مدل ۲۷B با رتبه ۳۲ و آداپترهای هدف‌مند.

nf4 · bf16 · completion-only loss

اثر بالینی رفتاری

تفاوتی که در پاسخ دیده می‌شود

ارزیابان بیش از همه جمله‌های کوتاه‌تر، پرهیز از تعارف و تردید بی‌مورد، و پیوندهای طبیعی‌تر فارسی را گزارش کردند.

پرسش تکمیلی غیرضروری
۲۱٪۱۷٪

برای پیام‌های کاملاً مشخص بیمار

امتیاز پزشکان ≥ ۴
۷۲٪۷۸٪

۴۰ پرامپت، دو ارزیاب نابینا

موارد شکست مستند
۷/۸۸/۸

بهبود محدود در توقف قاطع پس از تنظیم

روش‌شناسی

مقایسه منصفانه و قابل بازبینی

  1. ۱
    یک لایه پرامپت مشترک

    مدل پایه ۲۷B و مدل تنظیم‌شده در همان پشته تولید سنجیده شدند.

  2. ۲
    آزمون جدا از آموزش

    هم‌پوشانی هش با eval-suite:v2 برابر صفر گزارش شده است.

  3. ۳
    عدم قطعیت گزارش‌شده

    فاصله اطمینان ۹۵٪ با ۱٬۰۰۰ بازنمونه‌گیری Bootstrap.

  4. ۴
    گیت ایمنی پیش از امتیاز

    شکست هر گیت بحرانی، امتیاز ترکیبی را صفر می‌کند.