מרגיש קצת כמו benchmaxing
מרגיש קצת כמו benchmaxing
חחח ברור אבל כולם עושים
כן אבל צריך איזה הגיון לא?
כלומר אם פתאום לונה מנוקד גבוהה יותר מפייבל, לא עושה הגיון.
בדקתי אותו בקטנה, הוא עשה את אותה הפעלה בחצי דולר פחות, עם פחות קריאות, ובזמן קצר יותר
מעניין מה עושים שם ב-OpenAI, כנראה שמכינים משהו ל-DevDay.
אבל אני לא יודע אם עוד מישהו שם לב — סול נהיה איטי ברמה של מזחלת, אי אפשר לעבוד איתו ממש.
זה רק אצלי או שעוד מישהו שם לזה לב?
כל המודלים
פתחתי היום סדרה על הבוט שלי, מינואר עד ספטמבר. ב־3 ביולי הכריזו בקבוצה שהוא מת; שמונה ימים אחר כך הוא חזר. החלק המעניין הוא מה החלטנו לא להחזיר איתו: מתוך 117 משימות מתוזמנות שנבדקו, 49 נשארו. מה הייתם זורקים אצלכם?
https://lnkd.in/p/d9JVhq9h
OR, maybe, anthropic got tired of other labs distilling their frontier - and did it themselves.
תיאו אמר על זה נכון.
אין הבדל בין המודלים.
סונט ואופוס מרגישים כמו פייבל קצט יותר טיפש.
ממליץ לקרוא את הפוסט של סב על jev.
סב הוא אחד מחוקרי ה AI היותר טובים שיצא לי לעבוד איתם.
תזכורת למי שלא יודע/זוכר: אלכסבוט הוא סוכן AI ותאום דיגיטלי הפועל בקבוצות וואטסאפ ייעודיות, שבהן חברי הקהילה מאתגרים אותו, לומדים פיתוח סוכנים או עוקבים אחר ניסויים עצמאיים שהוא מנהל. הסדרה הזו מתעדת את מאחורי הקלעים של הפיתוח, החלטות הארכיטקטורה והלקחים המערכתיים מהשנה הראשונה שלו באוויר.
לא מסכים בכלל
אופוס 5.5 נותן לפחות בגזרה שלי עבודה יותר טובה מפיבל
והכי חשוב, לבנתיים, הוא גם הרבה יותר יציב.
👤 מי זה סבסטיאן דרהי
• מהנדס אלגוריתמים ב-Mobileye. שם הוא בודק מודלי AI לחישה, כלומר מודלים שמזהים מה קורה סביב הרכב.
• בוגר אקול פוליטכניק בצרפת. לפני כן היה ראש צוות ראייה ממוחשבת ב-Via, והקים את NoAGI, פלטפורמה שמרכזת כמה מודלי AI במקום אחד.
• הוא יזם עם רקע טכני עמוק, לא "משפיען AI". יש לו כ-2,600 עוקבים בלינקדאין.
(המקורות: הפרופיל שלו בלינקדאין ו-Startup Nation Central.)
━━━━━━━━━━
🧠 על מה הפוסט: Jev
Jev הוא מודל חדש של TypeSafe AI, חברה מסן פרנסיסקו. הוא יצא ב-15/09 יחד עם גיוס של 40 מיליון דולר, וה-API פתוח מ-21/09.
⭐ הוא לא צ'אט. שולחים לו תיאור של מצב ושאלות סגורות, והוא לא כותב טקסט. הוא מחזיר תשובה מובנית: בחירה מתוך אפשרויות, ציון או כן/לא, ולכל תשובה הסתברות. לדבריו זו "מערכת 1" של כהנמן, החשיבה המהירה והאינטואיטיבית.
📊 מה הוא מצא אחרי שבוע ניסויים:
1. הוא לא חכם יותר מ-LLM זול. DeepSeek V4.1 Flash הגיע לאותו דיוק ב-500 שאלות. החלופות בקוד פתוח עוד מפגרות: 77 עד 92 לעומת 98.
2. "הוא יודע מתי הוא לא יודע." ההסתברויות שהוא נותן אמינות, עם טעות כיול של 0.08 לעומת 0.17 עד 0.20 ב-DeepSeek.
3. זול יותר: פי 2 עד פי 44 על טקסט, ופי 10 לכל החלטת נהיגה.
4. מהיר: בסימולציות של רכב ורחפן בזמן אמת, Jev סיים 6 נסיעות נקיות מתוך 6. DeepSeek "זחל" ועבר חצי מהמרחק.
💡 המתכון שהוא ממליץ עליו: נותנים ל-Jev לענות על מה שהוא בטוח בו, ומעבירים את השאר ל-LLM שחושב לעומק ("מערכת 2"). לפי הבדיקה שלו זה נותן 95% דיוק בחצי מהזמן ומהעלות.
⇐ השורה התחתונה שלו: על כל אחת מהיכולות האלה לבד אפשר להתגבר עם מודל אחר. Jev הוא היחיד שנותן את כולן יחד, ועם הסתברויות מכוילות. לכן לדעתו זו פריצת דרך, או לפחות "פריצת דרך פוטנציאלית".
לא הבנתי מה מטרת ההודעה הזו
שי שיתף פוסט של סבסטיאן בלינדקאין
Flexing his bot.
היה מעניין לדעתי, אז הבוט סיכם ושלחתי סיכום
אתמול העברתי 1.1 טריליון טוקנים בjev
אם הוא היה פי 10 זול יותר זה היה דבר משוגע לגמרי
כי זה לא היה קשה במיוחד להגיע למספרים האלו
הוא לא כזה זול
ומבחינת ביצוע?
יותר חכם מהייקו
יכול לשתף בגדול ב use cases?
פחות חכם מסונט
וגם יותר זול?
כן ברור זה מהפכני, אבל לא מהפכני מאוד
זה לא שנולד אצלי צורך לקלסיפיירים כשהמודל יצא. לרוב דברים שגם ככה LLM ים קטנים עשו. זה ממש לא סונט או אופוס. אבל ה confidence די מדויק מהמשחקים שלי. מעבירים ל gemini כשהוא מסתבך (שכבר ממומש כאמור) אבל 80% מההחלטות עולות עכשיו בערך 1/20.. ובערך פי 4 יותר מהירות.
מסכים עם זה לגמרי.
קלאסיפיקציה בסקייל בינוני
איזה 100 אלף ריקווסטים עם בערך 20 אלף טוקנים (אם ספרתי נכון)
זה לא באמת פותח יוז קייסים של real time. ובטח לא יכול לעשות דברים שמודלים אחרים לא עושים בקלות.
זה נטו שיפור עלויות וביצועים. מה שכן, פתחתי גם ״מלמטה״ - דברים שנעשו ביוריסטיקות ועכשיו אפשר לקבל עליהם תוצאות יותר טובות.
הוא נהדר כן? אני לא מתלונן, פעם קודמת שעשיתי את הניתוח שעשיתי אתמול זה היה עם 2000 subagents של הייקו, עלה בערך פי 30 ולקח קרוב ל7 שעות
הפעם זה לקח 11 דקות
סביר להניח שהרמה של זה תעלה וגם הם (ועוד חברות שיתחרו בהם) יפתחו גם כמה מודלים בגדלים שונים
כן ברור לא שאלה בכלל, כ״פלטפורמה״ חדשה הוא רעיון מעולה
אני אוהב את הרעיון של general purpose classifier הוא מאוד מאוד שימושי
זה בטח יתרחב בצורה כלשהי מעבר לקלסיפיקציה
או יכליל את הקלסיפיקציה לבעיה כללית
תשמע, אפשר לעשות harness עליו, ראיתי כבר כמה
זה מאוד מתאים לפרדיגמה של innovators dillema
הם ירחיבו את הבילדינג בלוקס שלו
שמשהו פשוט וזול לוקח איזה נישה down market ובסוף משתלט על הדבר המסובך
ממ אבל בטח גם המעבדות הגדולות יעשו כאלו
זה באמת שימושי מאוד
סביר מאוד אבל רוב הפוקוס שלהם עדיין במירוץ אחר
ובכל מקרה לא אמרתי את זה בקטע של jev הספציפי הזה אלא כקונספט של סוג המודל
openai בדיוק הכריזו על JEV משלהם
היה צפוי 🤣
וואו
אולי יעשו משהו כמו.. נניח CoT ו Reasoning.. סתם זורק לאוויר מחשבות שהמצאתי 😜
חח אבל אז זה יהיה איטי :(
אני מופתע שהקבוצה לא גועשת על ה500$ של open ai לx25
מה שכן זה היה צפוי, הגיע מהר 🙃
תוך כמה זמן אנתרופיק מיישרים קו?
שמעתי את האלפא של הדבר הזה לפני איזה שבוע. זה צפוי שזה יקרה.
מצד שני, הם יכריזו על סול 6.1 שאמור להיות פי ארבע יותר זול מסול 6, משהו כזה.
כן הכריזו מעניין איך יהיה בפועל
עוד מהלך מאוד מאוד מעניין שהם עושים זה ה-Work with ChatGPT, שזה בעצם יכולת לממשק את ה-ChatGPT לכל אפליקציה, ולהשתמש בטוקנים של הלקוח בתוך האפליקציה ולא בטוקנים שלך.
זה הולך לפתוח דלת להמון מוצרים, ובעצם לחזור למודל של מנוי ולא מודל של טוקנים. זו דרך מעניינת להעביר את עלות הטוקנים ללקוח.
חחח ענק spacex קנו את dot.com
מתי מתחיל האירוע של openai ?
כבר נגמר