520 - Harness optimization with Or from AI21labs

520 - Harness optimization with Or from AI21labs

פרק מספר 520 של רברס עם פלטפורמה. בפרק זה רן מארח את אור דגן, COO בחברת AI21 Labs, לשיחה עמוקה על עולם ה-Harness Optimization. נדבר על האופן שבו ארגונים יכולים לאמץ בינה מלאכותית ב-Scale, החל משלב האוולואציות (Evals) ועד ל-Post-Training של מודלים.

[00:00] הכרות עם אור והסיפור של AI21

  • אור דגן מציג את ההתפתחות של AI21, חברה שפועלת בתחום כבר 9 שנים.
  • התפתחות החברה לאורך השנים:
    • אימון Foundational Models גדולים כמו משפחות Jurassic ו-Jamba.
    • פיתוח מוצרי B2C מוכרים מבוססי LLM, כמו תוסף הכתיבה Wordtune.
    • המעבר לסוכנים חכמים (Agents כמו Maestro) ולעולמות ה-B2B.
  • המוקד הנוכחי: לעזור לארגונים לאמץ AI בצורה נרחבת תוך התגברות על מכשולי עלות (Cost), זמני תגובה (Latency) ואיכות.

[03:39] מה זה בעצם Harness?

  • המונח “Harness” (או Scaffold) מתייחס לכל התוכנה והלוגיקה שעוטפות את מודל השפה עצמו (שמקבל ופולט טקסט).
  • ההרנס יכול לנוע בין מבנה פשוט מאוד (כמו Assistant שלוקח קלט מהמשתמש וזורק למודל), למערכות מורכבות הכוללות זיכרון, שימוש בכלים חיצוניים, שרשראות חשיבה ואג’נטים.
  • המושג “Model-Harness Fit”: אותו המודל יכול להפיק תוצאות שונות לחלוטין בהתאם למעטפת שסביבו.

[06:51] הכל מתחיל באוולואציות (Evals)

  • It all starts with evals: אי אפשר לעשות אופטימיזציה בלי למדוד. “Vibe testing” של ניסוי וטעייה לא מספיק כדי להרגיש הבדלים משמעותיים באמת.
  • בנצ’מרקים קיימים (כמו משימות קידוד) פעמים רבות לא משקפים את הטראפיק האמיתי בעולם האמיתי (שכולל גם קריאת PRD, חיפושי אינטרנט ושאלות המשך).
  • כדי לאפטם, חייבים לבנות Test-set רלוונטי ולהתחיל לשחק עם ה”כפתורים” השונים (Knobs): החלפת המודלים עצמם, שינוי פרומפטים, ניהול קונטקסט ועוד.

[10:21] אתגר האופטימיזציה ו-”Claude Code ל-Data Scientist”

  • האתגר הגדול: איך בודקים את כל הקונפיגורציות האפשריות ביעילות? מרחב החיפוש הוא כמעט אינסופי וכולל תלויות בלתי צפויות.
  • עבודת Applied Research ידנית לוקחת חודשים ועולה עשרות אלפי דולרים בריצות מודל.
  • AI21 פיתחה סוג של “Claude Code ל-Data Scientist” – סוכן אוטונומי (Auto-Researcher) שעושה Vibresearching יעיל במרחב הקינפוגים ומקצר עבודה של שבועות לחיפוש של שש שעות וקצת דולרים בודדים.
  • קשר אדם-מכונה: האוטו-ריסרצ’ר זקוק למפעיל שינחה אותו ויקבל החלטות עסקיות לגבי הטרייד-אוף שבין עלות (Cost) לאיכות התוצאה.

[14:29] “GEPA for Harness” וחיפוש במרחב הקינפוגים

  • הרצת אוולואציות על מטריצה של קונפיגורציות כוללת שילוב של מספר גישות אלגוריתמיות מתקדמות:
    • Hyper-parameter tuning לאזורים רציפים.
    • אלגוריתמים גנטיים, בגישת “GEPA for harness” – לוקחים את הניסויים המוצלחים, מוצאים את המשותף, מאחדים ומוציאים “צאצא” חדש.
    • Multi-arm bandit לאיזון מתמטי בין אקספלורציה (Exploration) לאקספלויטציה (Exploitation).

[22:30] מדדי הצלחה: Success @k לעומת Success ^k

  • כשעושים אוולואציות לדברים לא דטרמיניסטיים, חשוב להבין את הסטטיסטיקה:
    • Success @k: מתוך K ניסיונות, כמה פעמים המודל הצליח? (בוחן מובהקות).
    • Success ^k: מה הסיכוי שלאחר K ניסיונות נקבל לפחות הצלחה אחת?
  • Test-time compute scaling: במקום לשנות את המודל, אפשר לעשות שינוי בהרנס – להריץ בקשה 16 פעמים במקביל (Swarm), ולהשתמש ב-Judge מבוסס מודל System 1 (מודלים של סיווג מהיר וזול בהמון) כדי לבחור את התשובה הנכונה ולשפר את האיכות דרמטית.

[26:49] המעבר ל-Post-Training

  • כאשר ה-Success @k גבוה מאוד אבל היכולת להצליח בניסיון בודד (Single-shot) נמוכה, זה סימן לפוטנציאל חבוי במשקולות המודל.
  • במקרים כאלו, מומלץ לצאת ל-Post-training ו-Reinforcement Learning (RL) כדי לחזק את הסיגנלים הנכונים.
  • המגמה העסקית: חברות לוקחות מודלי Open-Source קטנים ומאמנות אותם כדי לקבל את האיכות של הפרונטיר מודלס (Frontier models) ברבע מהעלות, תוך שמירה על בידול.

[31:24] אינטגרציה וגישת ה-Middleware

  • גישה מבוססת Middleware (Middleware based approach): חברות מספקות סט כלים של Skills או Middleware שהלקוחות יכולים לבדוק וליישם בקלות.
  • איך משנים ומתאימים בזמן אמת (Inference time)?
    • Intelligent Gateway: כלי שיושב באמצע ומנתב את הבקשות בזמן אמת למודל הנכון (Low integration).
    • התממשקות ל-SDKs קיימים (כמו LangGraph) או לפתרונות פנימיים שהארגון בנה.
  • האופטימיזציה מתבצעת בדרך כלל End-to-End בשכבה העליונה, אך יכולה לרדת גם לרזולוציות של Sub-agents פנימיים כדי לדייק את הביצועים.

האזנה נעימה!