דיווח OpenAI על פגמים בבדיקת קוד – האם היא אמורה להשפיע על שיטות הערכה של מודל?

OpenAI פרסם דווח חדש על פגמים בתוצאה של SWE-Bench Pro, שמהווה למודל שיטת בדיקה נפוצה. הדווח raises concerns about the reliability and accuracy of evaluating AI models based on this benchmark.

מקור: OpenAI News — לכתבה המלאה

Comments

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *

עוזר האתר מודל מקומי · gemma2
שלום! 👋 אני העוזר החכם של האתר, רץ על מודל מקומי בשרת. איך אפשר לעזור?