520 - Harness optimization with Or from AI21labs
פרק מספר 520 של רברס עם פלטפורמה. בפרק זה רן מארח את אור דגן, COO בחברת AI21 Labs, לשיחה עמוקה על עולם ה-Harness Optimization. נדבר על האופן שבו ארגונים יכולים לאמץ בינה מלאכותית ב-Scale, החל משלב האוולואציות (Evals) ועד ל-Post-Training של מודלים.
[00:00] הכרות עם אור והסיפור של AI21
- אור דגן מציג את ההתפתחות של AI21, חברה שפועלת בתחום כבר 9 שנים.
- התפתחות החברה לאורך השנים:
- אימון Foundational Models גדולים כמו משפחות Jurassic ו-Jamba.
- פיתוח מוצרי B2C מוכרים מבוססי LLM, כמו תוסף הכתיבה Wordtune.
- המעבר לסוכנים חכמים (Agents כמו Maestro) ולעולמות ה-B2B.
- המוקד הנוכחי: לעזור לארגונים לאמץ AI בצורה נרחבת תוך התגברות על מכשולי עלות (Cost), זמני תגובה (Latency) ואיכות.
[03:39] מה זה בעצם Harness?
- המונח “Harness” (או Scaffold) מתייחס לכל התוכנה והלוגיקה שעוטפות את מודל השפה עצמו (שמקבל ופולט טקסט).
- ההרנס יכול לנוע בין מבנה פשוט מאוד (כמו Assistant שלוקח קלט מהמשתמש וזורק למודל), למערכות מורכבות הכוללות זיכרון, שימוש בכלים חיצוניים, שרשראות חשיבה ואג’נטים.
- המושג “Model-Harness Fit”: אותו המודל יכול להפיק תוצאות שונות לחלוטין בהתאם למעטפת שסביבו.
[06:51] הכל מתחיל באוולואציות (Evals)
- It all starts with evals: אי אפשר לעשות אופטימיזציה בלי למדוד. “Vibe testing” של ניסוי וטעייה לא מספיק כדי להרגיש הבדלים משמעותיים באמת.
- בנצ’מרקים קיימים (כמו משימות קידוד) פעמים רבות לא משקפים את הטראפיק האמיתי בעולם האמיתי (שכולל גם קריאת PRD, חיפושי אינטרנט ושאלות המשך).
- כדי לאפטם, חייבים לבנות Test-set רלוונטי ולהתחיל לשחק עם ה”כפתורים” השונים (Knobs): החלפת המודלים עצמם, שינוי פרומפטים, ניהול קונטקסט ועוד.
[10:21] אתגר האופטימיזציה ו-”Claude Code ל-Data Scientist”
- האתגר הגדול: איך בודקים את כל הקונפיגורציות האפשריות ביעילות? מרחב החיפוש הוא כמעט אינסופי וכולל תלויות בלתי צפויות.
- עבודת Applied Research ידנית לוקחת חודשים ועולה עשרות אלפי דולרים בריצות מודל.
- AI21 פיתחה סוג של “Claude Code ל-Data Scientist” – סוכן אוטונומי (Auto-Researcher) שעושה Vibresearching יעיל במרחב הקינפוגים ומקצר עבודה של שבועות לחיפוש של שש שעות וקצת דולרים בודדים.
- קשר אדם-מכונה: האוטו-ריסרצ’ר זקוק למפעיל שינחה אותו ויקבל החלטות עסקיות לגבי הטרייד-אוף שבין עלות (Cost) לאיכות התוצאה.
[14:29] “GEPA for Harness” וחיפוש במרחב הקינפוגים
- הרצת אוולואציות על מטריצה של קונפיגורציות כוללת שילוב של מספר גישות אלגוריתמיות מתקדמות:
- Hyper-parameter tuning לאזורים רציפים.
- אלגוריתמים גנטיים, בגישת “GEPA for harness” – לוקחים את הניסויים המוצלחים, מוצאים את המשותף, מאחדים ומוציאים “צאצא” חדש.
- Multi-arm bandit לאיזון מתמטי בין אקספלורציה (Exploration) לאקספלויטציה (Exploitation).
[22:30] מדדי הצלחה: Success @k לעומת Success ^k
- כשעושים אוולואציות לדברים לא דטרמיניסטיים, חשוב להבין את הסטטיסטיקה:
- Success @k: מתוך K ניסיונות, כמה פעמים המודל הצליח? (בוחן מובהקות).
- Success ^k: מה הסיכוי שלאחר K ניסיונות נקבל לפחות הצלחה אחת?
- Test-time compute scaling: במקום לשנות את המודל, אפשר לעשות שינוי בהרנס – להריץ בקשה 16 פעמים במקביל (Swarm), ולהשתמש ב-Judge מבוסס מודל System 1 (מודלים של סיווג מהיר וזול בהמון) כדי לבחור את התשובה הנכונה ולשפר את האיכות דרמטית.
[26:49] המעבר ל-Post-Training
- כאשר ה-Success @k גבוה מאוד אבל היכולת להצליח בניסיון בודד (Single-shot) נמוכה, זה סימן לפוטנציאל חבוי במשקולות המודל.
- במקרים כאלו, מומלץ לצאת ל-Post-training ו-Reinforcement Learning (RL) כדי לחזק את הסיגנלים הנכונים.
- המגמה העסקית: חברות לוקחות מודלי Open-Source קטנים ומאמנות אותם כדי לקבל את האיכות של הפרונטיר מודלס (Frontier models) ברבע מהעלות, תוך שמירה על בידול.
[31:24] אינטגרציה וגישת ה-Middleware
- גישה מבוססת Middleware (Middleware based approach): חברות מספקות סט כלים של Skills או Middleware שהלקוחות יכולים לבדוק וליישם בקלות.
- איך משנים ומתאימים בזמן אמת (Inference time)?
- Intelligent Gateway: כלי שיושב באמצע ומנתב את הבקשות בזמן אמת למודל הנכון (Low integration).
- התממשקות ל-SDKs קיימים (כמו LangGraph) או לפתרונות פנימיים שהארגון בנה.
- האופטימיזציה מתבצעת בדרך כלל End-to-End בשכבה העליונה, אך יכולה לרדת גם לרזולוציות של Sub-agents פנימיים כדי לדייק את הביצועים.
האזנה נעימה!