Skip to content
Agentic Engineering

אני מת פה😂😂😂😂

2026-09-23
Uriel

https://lnkd.in/p/dpf_87pN

אני מת פה😂😂😂😂

12:47
אבי אמסלם

גאוני הספקתי לשלוח את זה לכל חבר שהתחבר לשירות

12:55
Shay

כרגיל יתפקד נורמלי בימים הקרובים, ואז הולכים לסרס אותו כמו תמיד.

18:17
Itamar Zabari

פיבל התייצב יפה יפה בשבועיים האחרונים

אני מקווה שאופוס 5.5 יהיה יציב, אבל time will tell

18:18
Shay

זה פשוט כי דהה לך ההתחלה ואתה כבר לא יודע להשוות למה שהיה, זו דעתי. הם פשוט כל מודל בהתחלה נותנים לו 100%, אחר כך מסרסים וגמרנו.
לצערי גם התחילו לעשות את זה במודלים של GPT. פעם לא היו עושים, עכשיו גם הם עושים את זה.
לדעתי מה שהם עושים זה נותנים בהתחלה 100 אחוז, אחר כך מורידים את זה ל-50 אחוז, נותנים לזה שבוע שאנשים מתלוננים, ואז מחזירים את זה ל-70 אחוז – ואופס, כולם מבסוטים תיקנו!!
אבל זה אף פעם לא חוזר למה שהיה בהתחלה.

18:20
ניצן מגדל

כן...

מדויק מאוד. ועצוב

18:23
Itamar Zabari

אצלי זה מאוד ברור, זה בהחלט לא היה פיבל בתחילת דרכו, אבל הוא התייצב על 80%. אם לא, הייתי בקלות מאבד עוד כמה שנים טובות....

רמת המורכבות אצלי כל כך גבוהה, שקל לי מאוד לראות מתי זה הופך לזבל.

אבל פיבל בתחילת דרכו, היה מטורף, האקסטרה 20% הפך אותו לכלי מאוד אמין ושיטתי.

18:41
Dean

אני עדיין מאמין שהאופוס של לפני שנה וחצי עבד פי 10 יותר טוב מכל מה שאנחנו מכירים היום

18:53
Shay

חחחחח
המניוקים חיקו לאנטרופיק להרוס להם את המסיבה.
יללה מסיבר ריסטים חחחח

18:54
Dean

“We need to slow down” they said

18:55
Koren Cohen

Fah

18:56
Michael

סייקל דופמינים

19:22
Avishai Tsabari

אני חושב שאופוס 4.5 פשוט יצר את השינוי..
במקום ש ai יבנה 1 ויהרוס 2, הוא עבר למצב של לבנות 2 ולהרוס 1

מאז דווקא אני חושב שהייתה התקדמות גדולה ביחס של בונה-הורס

פשוט בנקודה הזו נגמר הסיפור של לכתוב קוד. או לפחות התחיל הסוף.

19:29
Uriel

4.5 זה הרגע שזה התחיל לעבוד

השינוי הכי גדול

19:29
Avishai Tsabari

בדיוק

19:29
Uriel

אחרי זה השינוי פחות משמעותי כי זה מ0 ל1 בערך

19:29
Avishai Tsabari

https://www.facebook.com/share/p/14poWGXNc6k/

מעניין

19:46
Regev

אם יש מישהו שעובד על business data ומעניין אותו jev-like tool אנחנו עובדים על משהו כזה ברמה גבוהה עכשיו, אשמח לשמוע על היוז קייס ולתת גישה לשחק עם זה אחר כך.. current jev לא כזה טוב ולא ככ calibrated מהבדיקות שלנו באיזורים האלה

19:47
Itamar Zabari

4.6 היה מדהים ביחס ל 4.5, ו4.5 היה טירוף ביחס ל 4.

הקפיצות היו משמעותיות.

20:07
Shay

אני חושב שכולם מתמקדים בביצועים ובכל מיני יוז קייסים שטותיים, ובגלל זה כולם מאוד מתלהבים שיש כל מיני מודלים פתוחים שיכולים לרוץ אצלך על המחשב (לפעמים אפילו על ה-CPU) ומציגים ביצועים יותר טובים ממודל כמו ג'מיני.

הבעיה היא, בעיניי לפחות, זה הדיוק. בסוף יש הבדל: מה שמיוחד בג'מיני זה שאימנו אותו על כמות דאטה אדירה, לפחות לפי מה שהם טוענים, ויש לו ידע ואינטליגנציה גבוהה ביחס לידע עולם. בינתיים, אולי ל-Qwen יש את זה, אבל חוץ מזה לא ראיתי עוד מתחרה אמיתי בתחום הזה.

בסוף מהירות זה נחמד, אבל אני יכול לחיות עם חצי שנייה במקום עשר מילישניות אם הדיוק שאני מקבל יותר גבוה. זה לפחות יותר חשוב לי.
אני לא עושה אלגו טריידינג, אבל אני חייב לקבל תשובות מאוד מאוד מדויקות.

אני כבר עובד על לשלב את הדבר הזה במוצר, כי אפשר לעשות עם זה דברים מאוד מאוד יפים והוא נותן תוצאות מאוד מדויקות. עשיתי בדיקות מול כמה מודלים, ובינתיים הוא נותן לי את התוצאות הכי מדויקות.
אני הולך להחליף את מה שיש לנו בjev, כי פשוט התוצאות שלו הרבה יותר אמינות ביחס עם מהירות שמאוד גבוהה ביחס לללם

20:12
Regev

אנחנו עושים structuring למחחיתנו כבר 4 שנים - תמיד הסדר עדיפויות של הלקוחות:
preceision
recall
cost and scale
latency

ב99 אחוז מהמקרים זה מה שחשוב

20:14
Shay

אני דווקא עובד עם ביזנס דאטה ומקבל תוצאות לא רעות מג'יפיטי.

לצערי, בינתיים אני לא יכול כל כך לחלוק מה בדיוק אנחנו עושים, אבל אנחנו לא עובדים באופן ישיר עם ג'ב. יש דרכים מתוחכמות להפעיל אותו, או כל מודל אחר, כדי לקבל ממנו את המיטב (מה שנקרא לסחוט ממנו את המיץ).

20:14
Regev

אם לא עוברים רף דיוק אפשר לזרוק לפח

והרף הוא בדרך כלל צפונה מ90 אחוז ולפעמים צפונה מ97

יש הרבה משימות שזה פחות חשוב (אבל כמעט תמיד בדיעבד הן העצמן לא היו ככ חשובות)

20:15
Shay

עכשיו פחות חשוב לי 90% כי בשביל למנוע כל מיני false positives, נקרא לזה, אז אם יש קנדידט גבוה, אני מעבר לרק לקבל תשובה של כן/לא — אני רוצה לקבל גם הסברים וגם הוכחות במערכת.

במקרים האלה בכל מקרה אני שולח את זה ל-LLM, אבל מה שיפה זה שאפשר להכין את כל המידע מראש: לא צריך לתת ל-LLM לקרוא לכלים, לא צריך כלום. אפשר לזרוק עליו ברמת דאטה ורק לבקש ממנו תשובה. ואז אתה יכול להשתמש במודלים כמו Gemini 1.5 Flash, שמחזיר תשובה גם מאוד מהר וגם תשובה איכותית בסופו של דבר.

20:16
Regev

בגלל זה אנחנו מחזירים תמיד evidence from the text

20:17
Shay

כמובן שג'מיני 3.8 פלאש

20:17
Regev

ומתנגדים בתוקף לתת confidence כי כל שיטה לזה קרובה לרנדום (בדיוק כמו שמי שבדק לעומק את הconfidence של jev גילה)

זה מכוייל רק בדברים טריויאליים

20:17
Shay

אגב, כשאתה אומר ביזנס דאטה, למה אתה מתכוון? כי האמת היא שגם זה לא מקשה אחת, יש דאטאות מכל מיני סוגים.

20:19
Regev

email / calls / documents / crm notes / surveys/ chats / etc

20:19
Shay

בדיוק חשבתי על קטע מטורף, איפה שאפוק פרסמו את הבנצ'מרקים של המודלים שלהם, והם אומרים שהפער בין מודלים סיניים למודלים אמריקאים הוא בעצם בין חמישה לשבעה חודשים. המודלים הסיניים הם בין חמישה לשבעה חודשים מאחורי הדגמים האמריקאים.

עכשיו, הקטע המטורף הוא שזה בדיוק כמו שכתבו פה: הקפיצה הגדולה הייתה בין אופוס 4 ל-4.5, ואז הקפיצות נהיו יותר ויותר קטנות כל הזמן. אותו דבר היה גם ב-OpenAI.

אם מסתכלים על זה, הקפיצות עכשיו נהיו כבר מה שנקרא קפיצות של אופטימיזציה. כשמסתכלים על זה ככה, זה אומר שהפער בין הסינים לאמריקאים תוך לא יודע מה, חמישה-שבעה חודשים, אולי שנה, כבר ייסגר אסימפטוטית. זה פשוט קטע מטורף לגמרי.

20:33
Stas Oskin

הכוונה ש-5-7 חודש לוקח לעשות distill 🙂

20:48
Regev

אני בעיקר בהלם מxiaomi mimo ששוחרר אתמול - במשהו כמו 30 צעדים של. אופטימיזציה של RL המודל השתפר כמו משוגע.. לא חשבתי שאפשר לעשות את זה בכ״כ מעט סבבים

(זה גם עלה להם איזה 3 מיליון דולר)

https://mimo.xiaomi.com/rl/

20:50
Shay

כל הרעש הזה של הדיסטילציה (distill) — בסופו של דבר, קודם כל אנתרופיק (Anthropic) בעצמם אמרו שהיו בערך כמה מיליונים של בקשות דיסטילציה ושרובן הגיעו מאליבאבא (Alibaba).
המודל כרגע שמדברים עליו כהכי רציני זה DeepSeek. אני לא יודע כמה כבר אפשר לדסטל; אתה יכול לעשות פיין-טיונינג (fine-tuning) עם דיסטילציה, אבל אני לא חושב שרוב בניית המודלים שלהם מגיעה מדיסטילציה.

20:50
Stas Oskin

מה הכוונה?

20:52
Regev

הייתי בטוח שהם עושים משמעותית יותר צעדים (אלפים)

לקבל מבט פנימה לאיך frontier model מאומן זה חריג למדי

המודל הזה מנצח את kimi k3 , glm 5.3

לפחות לפי הבנצמרקים..

20:53
Uriel

ממש מעניין, יש מלא details על איך עשו RL, אפילו עשו live stream😂

https://mimo.xiaomi.com/mimo-v2-6

21:36
Michael

זה מצויין

05:09
Tomer Cohen

https://www.instagram.com/reel/DdndjwXj6SI/?stkn=MTZtdHU0aG12Mm0zNg==

הטייק שלי - רוב האנשים פשוט צריכים לשדרג את המודל ולהמשיך בחיים שלהם. הפוקוס צריך להיות במקום אחר

06:32
Michael

נראה לי הם לא חרבנו את הדיבור שלו במודל הזה!

מעניין אם הם חזרו לעשות rlhf בשביל זה

06:37
Maayan Levy

ככה זה נראה. אני עם concise ונראה שזה משפיע הכי טוב שראיתי בינתיים. המבחן האמיתי יהיה עוד שבועיים שלשה..

06:37
Michael

קונסייס זה setting של קלוד קוד?

06:38
Maayan Levy

כן
/output-style

הם הוסיפו כמה דיפולטיים. זה היחיד שנסבל 😅

בעצם אני רואה עכשיו ששינו את זה.
/config
ואז זה אחת האופציות

06:40
Michael

לא יודע הharness שלהם גרוע

06:41
Maayan Levy

יאפ

06:41
Shay

לפני איזה שבועיים-שלושה הם עשו סוג של update push — זה משהו ספציפי שהם עובדים עליו כדי לסדר את הדיבור שלו, כי באמת נהיה לו דיבור נגוע, יותר מנגוע.

הדבר השני, הייתה לי מכונה, קיצור במקלדת שכאילו לוחצים עליו ופשוט מדבביק in english

כלום לא עוזר לו — לא Output Style, לא ELI5, לא כל ההגדרות. הוא פעמיים-שלוש מדבר כמו שצריך, ואז חוזר להיות המטומטם שהוא.
שוכח מאוד מהר את ה-Output Style שמבקשים ממנו.

ומה עם הרווח בין שורה לשורה, שזה בכלל מחרפן אותי? בשביל לקרוא משהו צריך לגלול חצי מסך רק כי הוא מחליט לשים שורה ריקה בין כל שתי שורות טקסט, שזה מחרפן אותי ברמות!

06:53
Maayan Levy

הפסקתי לעבוד איתו בשלב הזה לגמרי.
בינתיים opus 5.5 מחזיק. אני בסשן מורכב מאד מאתמול.. אבל באמת מוקדם לדעת בוודאות.

06:54
Michael

לי לגמרי עובד ASD-STE100

כל הזמן צריך לכתוב את זה אבל זה עובד

06:59
Shay

זה עובד, הבעיה היא שהוא שוכח את זה ואז כל הזמן צריך להזכיר לו. מרוב שכבר התייאשתי מהדבר הזה — כי זה מבזבז לי כל כך הרבה זמן — חשבתי אולי לעשות hook שבכל ה-output שלו מעביר את זה דרך ג'וב כזה או משהו דומה. ה-hook יבדוק אם האאוטפוט ניתן לקריאה על ידי בן אדם, ואם לא, יגיד לו לתקן את הסטייל והפורמטינג.

כי זו לא רק בעיה של communication style, דרך אגב. יש לו גם בעיה מאוד קשה של פורמטינג:
• הוא כותב עם יותר מדי רווחים בין שורות
• השורות לפעמים ארוכות מדי
• לפעמים הוא שם פסקה שלמה בשורה אחת
• הוא מוסיף כותרות מיותרות

אלו כל מיני דברים כאלה שמאוד מקשים על הקריאה של מה שהוא מוציא.

07:00
Michael

יש לנו לינטר שאוכף את זה

אז לפחות לדקומנטציה וprים וכו אפשר להכריח אותו

https://github.com/shift-labs-ai/bluepencil

07:02
Shay

לא, לא בתחום הדוקומנטציה. דוקומנטציה אני מעדיף לכתוב עם מודלים יותר חזקים בדרך כלל, וזה גם מאוד זול לכתוב דוקומנטציה עם מודלים חזקים כמו אסטרה למשל.

אני מתכוון לכשהוא מדבר איתי והוא עכשיו נתקל באיזושהי בעיה, והוא מוציא לי פלט שאני צריך לקרוא. ב-90% מהפעמים זה קורה אחרי שהוא רץ תקופה והוא כבר שכח מה ההנחיות שלו, למרות שאני עובד עם Oh My Pi וב-Oh My Pi יש rules שמוזרקים אוטומטית מדי פעם לתוך הקונטקסט, ועדיין זה לא עוזר.

הוא שוכח את ה-communication style שלו, הוא שוכח את ה-formatting rules שביקשתי ממנו, ומוציא לי דברים לא קריאים בעליל. ואז צריך להתווכח איתו: "תוציא לי את זה עכשיו בצורה שאני יכול לקרוא", ואז הוא קורא את ה-rules ומוציא לי את זה כמו שצריך.

אז אמרתי, אולי אני פשוט אקח איזה hook בתוך הסביבה, ששנייה לפני שהוא מוציא לי output פשוט יעביר את זה דרך classifier. הקלסיפייר יגיד לו אם זה טוב או לא טוב, ואם זה לא טוב אז זה יתקן.

07:03
Michael

כאילו באותה מידה אתה יכול לכתוב hook בcc או reminder בpi

07:04
Shay

ה-rules ב-Oh My Pie זה דומה ל-reminders ב-Pie. זה פשוט מנגנון אוטומטי שלוקח את ה-rules ומזריק אותם לתוך הקונטקסט אחת לכמה זמן.

זה בדיוק אותו מנגנון, אבל הוא לפעמים עובד ולפעמים לא — תלוי מתי הוא יזריק את זה ותלוי כמה קונטקסט נאכל על הפעולה הקודמת. זה פשוט לא אמין.

מצד שני, יש שתי אפשרויות:

1. לשים את זה בהוק פשוט בהוצאה ולהזריק לו את הקונטקסט הזה.
2. להעביר את זה דרך classifier לפני שהוא מוציא החוצה. זה כנראה יהיה יותר זול בעיניי, כי ה-classifier יעלה פחות מלהזריק את כל הקונטקסט, ואז גם לא נצטרך את ההזרקה הזו בכלל.

כלומר, חששתי באמת שאולי בכלל כל ה-rules האלה... לא צריך אותם ברגע שאתה רק מעביר את האאוטפוטים שלו דרך חוק ובודק איזה עומדים בסטנדרטים שלך. אז יכול גם לשמור על קונטקסט יותר נקי.

07:06
Michael

כאילו להדליק classifier על כל output זה קצת קיצוני

שיתקנו את המודלים המטופשים שלהם

07:08
Shay

יש הבדל ב-OpenAI בין output שהוא רק output של חשיבה לבין output שהוא בשבילך לקרוא — אפשר להבדיל ביניהם.

זאת אומרת, יש דברים שהמודל סתם מוציא תוך כדי עבודה, ויש את הדברים שהוא מוציא כשהוא עוצר. בעצם אפשר לזהות את העצירות האלה, כשהוא כאילו מחכה ממך לעשות משהו.

את ה-output של הדבר הזה אפשר להעביר דרך classifier, כך שלא כל מה שיוצא החוצה יעבור, אלא רק ה-outputs שלו שדורשים פעולה מצדך.

Ohmypi כמובן

07:09
Michael

כן יש את הבלוק סיכום

זה עדין להדליק classifier על כל output

07:09
Shay

לדעתי שווה לנסות את זה, כי בעיניי ההזרקות – הרימיינדרים האלה וההזרקות של הקונטקסט וכל הדברים האלה – יכולים להיות יותר יקרים מלהעביר את הדברים האלה דרך קלאסיפייר. קלאסיפייר הוא זול.

העמסתי על כמה קלאסיפיירים בימים האחרונים כמויות מטורפות של דאטה. עוד לא אכלתי חצי דולר, ואני טוחן אותם מהבוקר עד הערב. אז וואלה, אני מוכן לשלם דולר בחודש בשביל שזה יעבוד לי כמו שצריך, למרות שאני לא חושב שאני אגיע אפילו ל-30 סנט.

07:10
Michael

כן אולי jev משנה קצת את המשוואה שם, עדין מעצבן, שיוציאו מודלים שעובדים ויפסיקו לעשות שטויות. הם כבר שנתיים עסוקים בלגרום לך לשרוף טוקנים במקום לשחרר מוצרים טובים

אני בטוח שכל הpmים שם מתחרפנים

07:13
Itamar Zabari

זה מודל חדש?

08:06
Shay

מישהו שיתף פה לא מזמן CRAWLER מהיר / מחלץ מידע, אפשר לשתף שוב?

08:11
Regev

יצא לפני יומיים

09:01
Shay

מרגיש לי שהאלבום החדש טוחן תופים יותר מהאלבום הקודם.
ממש בזבזני

09:04
ניצן מגדל

באנלוגיה הזו אנטרופיק היא להקת רוק/מטאל?

09:21
Shay

לא, זה הוויספר שלי פישל, לא שמתי לב. מרגיש שהקלאוד החדש טוחן טוקנים כמו משוגע.

09:21
ניצן מגדל

דווקא אהבתי את שלו יותר..

09:23
Shay

בגדול, אם הייתי משווה את זה, אז הייתי משווה את זה דווקא לא לאלבום רוק אלא להופעה של מדונה.

בהתחלה הכל יפה, אבל אחרי כמה זמן אתה מקבל זקנה רוקדת על הבמה, מכבים לך את האוטוטיון, והמחיר של ההופעות רק עולה.

09:30
Maayan Levy

יותר השירים של שלמה ארצי
או המלמול של בוב דילן

09:31
ניצן מגדל

למישהו יש ניסיון עם עבודה עם PI על גבי COPILOT SUBSCRIPTION ?

10:25
Michael

נדמה לי שהם תומכים לא?

10:26
ניצן מגדל

תומכים. אני רוצה לדעת איך ההרגשה אם זה מחזיק את החודש או נגמר אחרי שתי בקשות

מתכנן להשתמש ב KIMI 3 שם לדעתי..

10:26
ofekron89

מה הקטע של אינסטינקט איך זה חינם

יש שם רייט לימיט מישהו הגיע?

10:49
Maayan Levy

מסובסד

10:49
ניצן מגדל

הם רוצים את המידע שלך.. ולהראות שיש להם יוזרים

10:50
Vulkan Roee

לא בטוח שיוכלו לגבות על זה. הם לא היחידים ומניח שיש מודלים בהם הם מרוויחים מקשרים עסקים... איפה הוא מזמין טיסות ומלונות למשל...

11:21
Tomer

שהרסו לגרוק :)

12:15
Shay

אינסטינקט של אופן אי אי מגיע

14:57
SJ

GrokBot Also

עד שנראה את אסטרה ופייבל מתעדכנים אז כן. זה האטה.

15:07
Rivka Zafrir

Grokbot looks like two 😅

15:09
SJ

זה מי שמוביל את מטא בבינה מלאכותית. יקבל שיחה מ HR?

15:10
· +2 short messages
Next thread אולי פשוט תעלו את אסטרה, והוא חכם אז הוא מחסל את התחרות