אני מת פה😂😂😂😂
גאוני הספקתי לשלוח את זה לכל חבר שהתחבר לשירות
כרגיל יתפקד נורמלי בימים הקרובים, ואז הולכים לסרס אותו כמו תמיד.
פיבל התייצב יפה יפה בשבועיים האחרונים
אני מקווה שאופוס 5.5 יהיה יציב, אבל time will tell
זה פשוט כי דהה לך ההתחלה ואתה כבר לא יודע להשוות למה שהיה, זו דעתי. הם פשוט כל מודל בהתחלה נותנים לו 100%, אחר כך מסרסים וגמרנו.
לצערי גם התחילו לעשות את זה במודלים של GPT. פעם לא היו עושים, עכשיו גם הם עושים את זה.
לדעתי מה שהם עושים זה נותנים בהתחלה 100 אחוז, אחר כך מורידים את זה ל-50 אחוז, נותנים לזה שבוע שאנשים מתלוננים, ואז מחזירים את זה ל-70 אחוז – ואופס, כולם מבסוטים תיקנו!!
אבל זה אף פעם לא חוזר למה שהיה בהתחלה.
כן...
מדויק מאוד. ועצוב
אצלי זה מאוד ברור, זה בהחלט לא היה פיבל בתחילת דרכו, אבל הוא התייצב על 80%. אם לא, הייתי בקלות מאבד עוד כמה שנים טובות....
רמת המורכבות אצלי כל כך גבוהה, שקל לי מאוד לראות מתי זה הופך לזבל.
אבל פיבל בתחילת דרכו, היה מטורף, האקסטרה 20% הפך אותו לכלי מאוד אמין ושיטתי.
אני עדיין מאמין שהאופוס של לפני שנה וחצי עבד פי 10 יותר טוב מכל מה שאנחנו מכירים היום
חחחחח
המניוקים חיקו לאנטרופיק להרוס להם את המסיבה.
יללה מסיבר ריסטים חחחח
“We need to slow down” they said
Fah
סייקל דופמינים
אני חושב שאופוס 4.5 פשוט יצר את השינוי..
במקום ש ai יבנה 1 ויהרוס 2, הוא עבר למצב של לבנות 2 ולהרוס 1
מאז דווקא אני חושב שהייתה התקדמות גדולה ביחס של בונה-הורס
פשוט בנקודה הזו נגמר הסיפור של לכתוב קוד. או לפחות התחיל הסוף.
4.5 זה הרגע שזה התחיל לעבוד
השינוי הכי גדול
בדיוק
אחרי זה השינוי פחות משמעותי כי זה מ0 ל1 בערך
אם יש מישהו שעובד על business data ומעניין אותו jev-like tool אנחנו עובדים על משהו כזה ברמה גבוהה עכשיו, אשמח לשמוע על היוז קייס ולתת גישה לשחק עם זה אחר כך.. current jev לא כזה טוב ולא ככ calibrated מהבדיקות שלנו באיזורים האלה
4.6 היה מדהים ביחס ל 4.5, ו4.5 היה טירוף ביחס ל 4.
הקפיצות היו משמעותיות.
אני חושב שכולם מתמקדים בביצועים ובכל מיני יוז קייסים שטותיים, ובגלל זה כולם מאוד מתלהבים שיש כל מיני מודלים פתוחים שיכולים לרוץ אצלך על המחשב (לפעמים אפילו על ה-CPU) ומציגים ביצועים יותר טובים ממודל כמו ג'מיני.
הבעיה היא, בעיניי לפחות, זה הדיוק. בסוף יש הבדל: מה שמיוחד בג'מיני זה שאימנו אותו על כמות דאטה אדירה, לפחות לפי מה שהם טוענים, ויש לו ידע ואינטליגנציה גבוהה ביחס לידע עולם. בינתיים, אולי ל-Qwen יש את זה, אבל חוץ מזה לא ראיתי עוד מתחרה אמיתי בתחום הזה.
בסוף מהירות זה נחמד, אבל אני יכול לחיות עם חצי שנייה במקום עשר מילישניות אם הדיוק שאני מקבל יותר גבוה. זה לפחות יותר חשוב לי.
אני לא עושה אלגו טריידינג, אבל אני חייב לקבל תשובות מאוד מאוד מדויקות.
אני כבר עובד על לשלב את הדבר הזה במוצר, כי אפשר לעשות עם זה דברים מאוד מאוד יפים והוא נותן תוצאות מאוד מדויקות. עשיתי בדיקות מול כמה מודלים, ובינתיים הוא נותן לי את התוצאות הכי מדויקות.
אני הולך להחליף את מה שיש לנו בjev, כי פשוט התוצאות שלו הרבה יותר אמינות ביחס עם מהירות שמאוד גבוהה ביחס לללם
אנחנו עושים structuring למחחיתנו כבר 4 שנים - תמיד הסדר עדיפויות של הלקוחות:
preceision
recall
cost and scale
latency
ב99 אחוז מהמקרים זה מה שחשוב
אני דווקא עובד עם ביזנס דאטה ומקבל תוצאות לא רעות מג'יפיטי.
לצערי, בינתיים אני לא יכול כל כך לחלוק מה בדיוק אנחנו עושים, אבל אנחנו לא עובדים באופן ישיר עם ג'ב. יש דרכים מתוחכמות להפעיל אותו, או כל מודל אחר, כדי לקבל ממנו את המיטב (מה שנקרא לסחוט ממנו את המיץ).
אם לא עוברים רף דיוק אפשר לזרוק לפח
והרף הוא בדרך כלל צפונה מ90 אחוז ולפעמים צפונה מ97
יש הרבה משימות שזה פחות חשוב (אבל כמעט תמיד בדיעבד הן העצמן לא היו ככ חשובות)
עכשיו פחות חשוב לי 90% כי בשביל למנוע כל מיני false positives, נקרא לזה, אז אם יש קנדידט גבוה, אני מעבר לרק לקבל תשובה של כן/לא — אני רוצה לקבל גם הסברים וגם הוכחות במערכת.
במקרים האלה בכל מקרה אני שולח את זה ל-LLM, אבל מה שיפה זה שאפשר להכין את כל המידע מראש: לא צריך לתת ל-LLM לקרוא לכלים, לא צריך כלום. אפשר לזרוק עליו ברמת דאטה ורק לבקש ממנו תשובה. ואז אתה יכול להשתמש במודלים כמו Gemini 1.5 Flash, שמחזיר תשובה גם מאוד מהר וגם תשובה איכותית בסופו של דבר.
בגלל זה אנחנו מחזירים תמיד evidence from the text
כמובן שג'מיני 3.8 פלאש
ומתנגדים בתוקף לתת confidence כי כל שיטה לזה קרובה לרנדום (בדיוק כמו שמי שבדק לעומק את הconfidence של jev גילה)
זה מכוייל רק בדברים טריויאליים
אגב, כשאתה אומר ביזנס דאטה, למה אתה מתכוון? כי האמת היא שגם זה לא מקשה אחת, יש דאטאות מכל מיני סוגים.
email / calls / documents / crm notes / surveys/ chats / etc
בדיוק חשבתי על קטע מטורף, איפה שאפוק פרסמו את הבנצ'מרקים של המודלים שלהם, והם אומרים שהפער בין מודלים סיניים למודלים אמריקאים הוא בעצם בין חמישה לשבעה חודשים. המודלים הסיניים הם בין חמישה לשבעה חודשים מאחורי הדגמים האמריקאים.
עכשיו, הקטע המטורף הוא שזה בדיוק כמו שכתבו פה: הקפיצה הגדולה הייתה בין אופוס 4 ל-4.5, ואז הקפיצות נהיו יותר ויותר קטנות כל הזמן. אותו דבר היה גם ב-OpenAI.
אם מסתכלים על זה, הקפיצות עכשיו נהיו כבר מה שנקרא קפיצות של אופטימיזציה. כשמסתכלים על זה ככה, זה אומר שהפער בין הסינים לאמריקאים תוך לא יודע מה, חמישה-שבעה חודשים, אולי שנה, כבר ייסגר אסימפטוטית. זה פשוט קטע מטורף לגמרי.
הכוונה ש-5-7 חודש לוקח לעשות distill 🙂
אני בעיקר בהלם מxiaomi mimo ששוחרר אתמול - במשהו כמו 30 צעדים של. אופטימיזציה של RL המודל השתפר כמו משוגע.. לא חשבתי שאפשר לעשות את זה בכ״כ מעט סבבים
(זה גם עלה להם איזה 3 מיליון דולר)
כל הרעש הזה של הדיסטילציה (distill) — בסופו של דבר, קודם כל אנתרופיק (Anthropic) בעצמם אמרו שהיו בערך כמה מיליונים של בקשות דיסטילציה ושרובן הגיעו מאליבאבא (Alibaba).
המודל כרגע שמדברים עליו כהכי רציני זה DeepSeek. אני לא יודע כמה כבר אפשר לדסטל; אתה יכול לעשות פיין-טיונינג (fine-tuning) עם דיסטילציה, אבל אני לא חושב שרוב בניית המודלים שלהם מגיעה מדיסטילציה.
מה הכוונה?
הייתי בטוח שהם עושים משמעותית יותר צעדים (אלפים)
לקבל מבט פנימה לאיך frontier model מאומן זה חריג למדי
המודל הזה מנצח את kimi k3 , glm 5.3
לפחות לפי הבנצמרקים..
ממש מעניין, יש מלא details על איך עשו RL, אפילו עשו live stream😂
https://mimo.xiaomi.com/mimo-v2-6
זה מצויין
https://www.instagram.com/reel/DdndjwXj6SI/?stkn=MTZtdHU0aG12Mm0zNg==
הטייק שלי - רוב האנשים פשוט צריכים לשדרג את המודל ולהמשיך בחיים שלהם. הפוקוס צריך להיות במקום אחר
נראה לי הם לא חרבנו את הדיבור שלו במודל הזה!
מעניין אם הם חזרו לעשות rlhf בשביל זה
ככה זה נראה. אני עם concise ונראה שזה משפיע הכי טוב שראיתי בינתיים. המבחן האמיתי יהיה עוד שבועיים שלשה..
קונסייס זה setting של קלוד קוד?
כן
/output-style
הם הוסיפו כמה דיפולטיים. זה היחיד שנסבל 😅
בעצם אני רואה עכשיו ששינו את זה.
/config
ואז זה אחת האופציות
לא יודע הharness שלהם גרוע
יאפ
לפני איזה שבועיים-שלושה הם עשו סוג של update push — זה משהו ספציפי שהם עובדים עליו כדי לסדר את הדיבור שלו, כי באמת נהיה לו דיבור נגוע, יותר מנגוע.
הדבר השני, הייתה לי מכונה, קיצור במקלדת שכאילו לוחצים עליו ופשוט מדבביק in english
כלום לא עוזר לו — לא Output Style, לא ELI5, לא כל ההגדרות. הוא פעמיים-שלוש מדבר כמו שצריך, ואז חוזר להיות המטומטם שהוא.
שוכח מאוד מהר את ה-Output Style שמבקשים ממנו.
ומה עם הרווח בין שורה לשורה, שזה בכלל מחרפן אותי? בשביל לקרוא משהו צריך לגלול חצי מסך רק כי הוא מחליט לשים שורה ריקה בין כל שתי שורות טקסט, שזה מחרפן אותי ברמות!
הפסקתי לעבוד איתו בשלב הזה לגמרי.
בינתיים opus 5.5 מחזיק. אני בסשן מורכב מאד מאתמול.. אבל באמת מוקדם לדעת בוודאות.
לי לגמרי עובד ASD-STE100
כל הזמן צריך לכתוב את זה אבל זה עובד
זה עובד, הבעיה היא שהוא שוכח את זה ואז כל הזמן צריך להזכיר לו. מרוב שכבר התייאשתי מהדבר הזה — כי זה מבזבז לי כל כך הרבה זמן — חשבתי אולי לעשות hook שבכל ה-output שלו מעביר את זה דרך ג'וב כזה או משהו דומה. ה-hook יבדוק אם האאוטפוט ניתן לקריאה על ידי בן אדם, ואם לא, יגיד לו לתקן את הסטייל והפורמטינג.
כי זו לא רק בעיה של communication style, דרך אגב. יש לו גם בעיה מאוד קשה של פורמטינג:
• הוא כותב עם יותר מדי רווחים בין שורות
• השורות לפעמים ארוכות מדי
• לפעמים הוא שם פסקה שלמה בשורה אחת
• הוא מוסיף כותרות מיותרות
אלו כל מיני דברים כאלה שמאוד מקשים על הקריאה של מה שהוא מוציא.
יש לנו לינטר שאוכף את זה
אז לפחות לדקומנטציה וprים וכו אפשר להכריח אותו
https://github.com/shift-labs-ai/bluepencil
לא, לא בתחום הדוקומנטציה. דוקומנטציה אני מעדיף לכתוב עם מודלים יותר חזקים בדרך כלל, וזה גם מאוד זול לכתוב דוקומנטציה עם מודלים חזקים כמו אסטרה למשל.
אני מתכוון לכשהוא מדבר איתי והוא עכשיו נתקל באיזושהי בעיה, והוא מוציא לי פלט שאני צריך לקרוא. ב-90% מהפעמים זה קורה אחרי שהוא רץ תקופה והוא כבר שכח מה ההנחיות שלו, למרות שאני עובד עם Oh My Pi וב-Oh My Pi יש rules שמוזרקים אוטומטית מדי פעם לתוך הקונטקסט, ועדיין זה לא עוזר.
הוא שוכח את ה-communication style שלו, הוא שוכח את ה-formatting rules שביקשתי ממנו, ומוציא לי דברים לא קריאים בעליל. ואז צריך להתווכח איתו: "תוציא לי את זה עכשיו בצורה שאני יכול לקרוא", ואז הוא קורא את ה-rules ומוציא לי את זה כמו שצריך.
אז אמרתי, אולי אני פשוט אקח איזה hook בתוך הסביבה, ששנייה לפני שהוא מוציא לי output פשוט יעביר את זה דרך classifier. הקלסיפייר יגיד לו אם זה טוב או לא טוב, ואם זה לא טוב אז זה יתקן.
כאילו באותה מידה אתה יכול לכתוב hook בcc או reminder בpi
ה-rules ב-Oh My Pie זה דומה ל-reminders ב-Pie. זה פשוט מנגנון אוטומטי שלוקח את ה-rules ומזריק אותם לתוך הקונטקסט אחת לכמה זמן.
זה בדיוק אותו מנגנון, אבל הוא לפעמים עובד ולפעמים לא — תלוי מתי הוא יזריק את זה ותלוי כמה קונטקסט נאכל על הפעולה הקודמת. זה פשוט לא אמין.
מצד שני, יש שתי אפשרויות:
1. לשים את זה בהוק פשוט בהוצאה ולהזריק לו את הקונטקסט הזה.
2. להעביר את זה דרך classifier לפני שהוא מוציא החוצה. זה כנראה יהיה יותר זול בעיניי, כי ה-classifier יעלה פחות מלהזריק את כל הקונטקסט, ואז גם לא נצטרך את ההזרקה הזו בכלל.
כלומר, חששתי באמת שאולי בכלל כל ה-rules האלה... לא צריך אותם ברגע שאתה רק מעביר את האאוטפוטים שלו דרך חוק ובודק איזה עומדים בסטנדרטים שלך. אז יכול גם לשמור על קונטקסט יותר נקי.
כאילו להדליק classifier על כל output זה קצת קיצוני
שיתקנו את המודלים המטופשים שלהם
יש הבדל ב-OpenAI בין output שהוא רק output של חשיבה לבין output שהוא בשבילך לקרוא — אפשר להבדיל ביניהם.
זאת אומרת, יש דברים שהמודל סתם מוציא תוך כדי עבודה, ויש את הדברים שהוא מוציא כשהוא עוצר. בעצם אפשר לזהות את העצירות האלה, כשהוא כאילו מחכה ממך לעשות משהו.
את ה-output של הדבר הזה אפשר להעביר דרך classifier, כך שלא כל מה שיוצא החוצה יעבור, אלא רק ה-outputs שלו שדורשים פעולה מצדך.
Ohmypi כמובן
כן יש את הבלוק סיכום
זה עדין להדליק classifier על כל output
לדעתי שווה לנסות את זה, כי בעיניי ההזרקות – הרימיינדרים האלה וההזרקות של הקונטקסט וכל הדברים האלה – יכולים להיות יותר יקרים מלהעביר את הדברים האלה דרך קלאסיפייר. קלאסיפייר הוא זול.
העמסתי על כמה קלאסיפיירים בימים האחרונים כמויות מטורפות של דאטה. עוד לא אכלתי חצי דולר, ואני טוחן אותם מהבוקר עד הערב. אז וואלה, אני מוכן לשלם דולר בחודש בשביל שזה יעבוד לי כמו שצריך, למרות שאני לא חושב שאני אגיע אפילו ל-30 סנט.
כן אולי jev משנה קצת את המשוואה שם, עדין מעצבן, שיוציאו מודלים שעובדים ויפסיקו לעשות שטויות. הם כבר שנתיים עסוקים בלגרום לך לשרוף טוקנים במקום לשחרר מוצרים טובים
אני בטוח שכל הpmים שם מתחרפנים
זה מודל חדש?
מישהו שיתף פה לא מזמן CRAWLER מהיר / מחלץ מידע, אפשר לשתף שוב?
יצא לפני יומיים
מרגיש לי שהאלבום החדש טוחן תופים יותר מהאלבום הקודם.
ממש בזבזני
באנלוגיה הזו אנטרופיק היא להקת רוק/מטאל?
לא, זה הוויספר שלי פישל, לא שמתי לב. מרגיש שהקלאוד החדש טוחן טוקנים כמו משוגע.
דווקא אהבתי את שלו יותר..
בגדול, אם הייתי משווה את זה, אז הייתי משווה את זה דווקא לא לאלבום רוק אלא להופעה של מדונה.
בהתחלה הכל יפה, אבל אחרי כמה זמן אתה מקבל זקנה רוקדת על הבמה, מכבים לך את האוטוטיון, והמחיר של ההופעות רק עולה.
יותר השירים של שלמה ארצי
או המלמול של בוב דילן
למישהו יש ניסיון עם עבודה עם PI על גבי COPILOT SUBSCRIPTION ?
נדמה לי שהם תומכים לא?
תומכים. אני רוצה לדעת איך ההרגשה אם זה מחזיק את החודש או נגמר אחרי שתי בקשות
מתכנן להשתמש ב KIMI 3 שם לדעתי..
מה הקטע של אינסטינקט איך זה חינם
יש שם רייט לימיט מישהו הגיע?
מסובסד
הם רוצים את המידע שלך.. ולהראות שיש להם יוזרים
לא בטוח שיוכלו לגבות על זה. הם לא היחידים ומניח שיש מודלים בהם הם מרוויחים מקשרים עסקים... איפה הוא מזמין טיסות ומלונות למשל...
שהרסו לגרוק :)
אינסטינקט של אופן אי אי מגיע
GrokBot Also
עד שנראה את אסטרה ופייבל מתעדכנים אז כן. זה האטה.
Grokbot looks like two 😅
זה מי שמוביל את מטא בבינה מלאכותית. יקבל שיחה מ HR?