הספארק פי 6 קומפיוט מהstrix halo?
הספארק פי 6 קומפיוט מהstrix halo?
אם לא יותר
ל Blackwell יש תמיכה בfp4 טבעית, מגיעים ל500 tops שם
זה היתרון הכי גדול
בfp16 ההבדל פחןת מורגש
שניה שאבין
המהירות של הBUS מהירה יותר בהרבה מהספארק. פי כמה. לפחות פי 4
זו אחת הסיבות שהספארק איטי יותר מכרטיסים כמו 5090
הכח מחשוב של הספארק עולה על האולטרה החדש? לא בדקתי אבל אתה אומר ככה
שתי דברים שונים
אבל הBUS הוא זה שגורם לספארק להיות איטי, לא?
אחד זה המהירות של הזיכרון השני כמות ה compute
בdecode
ב prefill אתה לא חסום בזכרון
וכמות הקומפיוט של הסטודיו כל כך רחוקה מהספארק? מה ההבדל, ליבות?
הבעיה בdecode שכדי לחזות token אתה צריך את כל הפרמטרים של הרשת ואז המהירות לרוב תלוייה בזיכרון שאיטי יותר מהcompute
אבל ב prefill אתה מחשב מאות אם לא אלפים של tokens במכה ואז אתה חסום ב compute כי על 4ותם מאות או אלפים אתה צריך את הפרמטרים ואז היחס בין זכרון ל compute יורד
הטכנולוגיה, זה משהו אחר לגמרי אחד זה npu והשני זה שילוב של cuda cores ו tensor cores. מעבר לזה התמיכה בfp4
הבנתי בגלל זה הספארק יותר מהיר למרות הבאס.. תודה
לדעתי nvidia יוציאו גם תמיכה הq2 בעתיד הקרוב
בprefill
למה אתה מפריד לי
זה רק מבלבל
מהיר יותר או לא
למה אני צריך לפרק את הפעולות ? אני מריץ משימה, מי יותר מהיר או שזה ממש תלוי באופי המשימה לפי ההפרדה הזו?
אופןאייאיי הודיעו היום על תמיכה בסטנדרט חדש שנקרא WebMCP. מאפשר לאתרים לחשוף ממשק שהוא דומה לMCP ולאפשר לסוכנים להפעיל אותם. זה מאוד מהיר ויעיל ביחס לכל שיטה אחרת (DOM etc), ואתרים יכולים להיות נגישים לסוכנים להפעלה.
החברה שלי בנתה הרבה כלים בתחום למי שמעוניין ללמוד:
https://x.com/0xidanlevin/status/2092410477707993417?s=46