סינון אותיות מיותרות בדוחות ניסויים בקוד

OpenAI פרסם מחקר חדש שמצביע על בעיות ב-SWE-Bench Pro, מודל ניסוי בקוד פופולרי, וגורם לחששות לגבי विश्वसनीयता והאמת בדירוגים של מודלים בינה מלאכותית.

מקור: OpenAI News — לכתבה המלאה

Comments

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *

עוזר האתר מודל מקומי · gemma2
שלום! 👋 אני העוזר החכם של האתר, רץ על מודל מקומי בשרת. איך אפשר לעזור?