יהיה מעניין לשים את הדברים על טיימליין ולראות את האקספוננציאליות שאני…
יהיה מעניין לשים את הדברים על טיימליין ולראות את האקספוננציאליות שאני מתחיל להרגיש מסביב 😅 החידושים נעשים צפופים יותר ויותר
Singularity
Sounds cool
וואלה אני מרגיש שאין ממש חידושים
צ׳ט גיפיטי יצא לפני כמעט 4 שנים והכל השתפר מאז אבל הכל אינקרמנטלי
אני מרגיש שקוד דיי פתור, שיתחילו לפתור מחלות ובעיות אמיתיות בעולם
עוד לא פתור לגמרי אבל לגמרי בדרך
שחרור מודלים זה לא מדד לחידוש. זה אולי מדד לתחרות בין החברות השונות או משהו בסגנון. דובר פה מלא על איך אנשים מרגישים שאופוס4.6 היה טוב יותר מ7 או 8. כנראה הייתה להם סיבה לשחרר (סביר שכלכלית( אבל זה לא חידש יותר מידי
רק חסר מהירות.
1000 טוקנים לשנייה
ולגמרי הלוואי ויפתרו כבר מחלות. בטוח שזה בדרך.
אולי זה יאיץ את החיסון של מודרנה לסרטן
לחלופין שהביצועים היו זהים אבל ללא thinking tokens
זה פשוט output tokens שנכנסים אליו חזרה כחלק מה CoT , שיהיה פשוט יותר מהר כבר חח
באופן כללי כל הסיפור של הreasoning מופרך
מראה שאנחנו עוד רחוקים
אני מריץ כבר איזה שבועיים Qwen ב- cerebras סביב 1300 TPS ל-use case ספיציפי.. זה מגיע..
ועדיין מדהים מה שזה כבר עושה
איזה gpu? כמה vRAM? או unified?
ב-cloud inference. ככה out of the box.. pay as you go
אאוץ
תחשב כמה יצא לך פר איקס זמן
לפעמים עדיף לוקל אינפרנס
לא חייב 128gb
אפשר להתחיל עם משהו צנוע יותר
זה ממש בגלל המהירות. וממש לnear real time calls מאד מאד ספציפיים לאייג’נט. לא עובד ככה לפיתוח.
זה היה רק כדי להגיד שזה טכנולוגית קרה כבר.. ואז שזה גם יהיה הסטנדרט מתישהו וכנראה בקרוב.
שום סט אפ לוקאלי לא נותן 1300 TPS… 😂
אמת
למטרת פיתוח, אין לחץ, שים הכל על webui ותעבוד עם הפרומפט שלו
העיקר שיהיה לך thread עם זיכרון
במידה ותעבוד ישירות עם ollama
אני מאמין שהקוד שלך יצטרך להיות כמו הסדרה של שושלת
400 פרקים
כן, כן, ברור. לא פיתוח.. וחוץ מזה שהוא לא ברמה של מה שאפשר לסבסד עוד.. אין שאלה בכלל.