תעיתים בין תיאור לביצועים בייצור תוכנה

מחקר חדש מ-OpenAI חושף בעיות ב-SWE-Bench Pro, מדד ביצועי פופולרי, שגורם לנושאים לגבי विश्वसनीयता ואיכות 평ינה של מודלים AI.

מקור: OpenAI News — לכתבה המלאה

Comments

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *

עוזר האתר מודל מקומי · gemma2
שלום! 👋 אני העוזר החכם של האתר, רץ על מודל מקומי בשרת. איך אפשר לעזור?