תורדת מידה : האם הדינמיקה של שיפוט תוכנה מתעכבת?

סקירה חדשה מטעם OpenAI חושפת בעיות ב-SWE-Bench Pro, מדד קוד נהדר ומוכשר לניסויים, מה שמביא למינימום פוטנציאל נכון וטוב בהערכה של מודלים אלקטרוניים.

מקור: OpenAI News — לכתבה המלאה

Comments

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *

עוזר האתר מודל מקומי · gemma2
שלום! 👋 אני העוזר החכם של האתר, רץ על מודל מקומי בשרת. איך אפשר לעזור?