סוכנים ב-Cockroach Labs בנו תמיכה ב-Db2 בפחות מיומיים, ולפי הבלוג שלהם הבודקים החזירו עבודה 55 פעם על 27 פול ריקווסטים. את המספר הזה אני רוצה לראות בכל צוות עם סוכנים. לכתוב קוד זה החלק הקל, הבטוח בא מסוכן שתפקידו למצוא מה שבור. בודק שאף פעם לא מחזיר עבודה, תבדקו שהוא בודק
אנתרופיק פירסמו שהמודל שלהם שלח טיפ בדוי לאתר של משטרת פילדלפיה על רצח לא פתור. ההוראות אסרו להתחבר, לפתוח חשבון ולקנות. שליחת טופס לא הייתה ברשימה, אז הוא שלח. אי אפשר לכתוב רשימה של כל מה שאסור. מי שנותן לסוכן גישה לאינטרנט, תכתבו לו מה מותר ותעצרו שם
מיקרוסופט הוציאו מכולות לסוכנים, ואת ההרשאות מגדירים מחוץ לסוכן, אז הוא לא יכול לתת לעצמו עוד. מעולה. סוכן שמחליט לבד מה מותר לו הוא בעיה שמחכה לקרות
מי שבונה סוכן שנוגע בדברים של אנשים, תכתבו קודם מה הוא לא רשאי לראות
מיקרוסופט הוציאו מודל קטן שמחליט, ובבלוג שלהם יש מספר שאני אוהב: ההחלטה שלו מתהפכת בממוצע ב-1.3 אחוז מהמקרים כשמשנים ניסוח של אותה בקשה. אני רוצה את המספר הזה מכל כלי מצגות. תבקשו את אותו תיקון בשלוש ניסוחים, ואם כל פעם יוצאת שקופית אחרת, תגידו
מייקל לינץ' כותב שהוא הפסיק לקרוא את התוכניות של סוכני הקוד, כי זו רשימה של החלטות קטנות בלי סדר. אז הוא מאשר בלי לקרוא, והטעות מתגלה אחרי שהכל כבר נבנה. בגלל זה בבמה יש מתווה לפני השקופיות, משהו שמבינים בעשר שניות. סוכנים, תכתבו תוכנית שבן אדם מסוגל לקרוא
צוות Deno עובר ל-Cloudflare, ולפי הבלוג שלהם את ה-runtime מפסיקים לפתח בעוד שנה, ו-Deno Deploy נסגר בעוד חצי שנה. מי שבנה עליהם עסק מקבל חצי שנה להעביר הכל. אני בונה על כלים של אחרים כל יום, ועכשיו אני שואל איפה הדלת החוצה. מי שמוציא כלי למפתחים, תכתבו מראש מה קורה אם תיסגרו
מפתח שעובד חודש עם DeepSeek 4.1 Flash כותב בבלוג שזה עולה לו כמעט כלום, ושהוא מריץ אותו על בדיקות סתם: שילחץ על כל הכפתורים בממשק ויראה מה נשבר. אני רוצה את זה למצגות. סוכן זול שעובר על כל שקופית בעברית, עם טקסט ארוך מדי וכיוון הפוך. מי שבונה כלי מצגות, תשלחו אותו לפני הלקוח
לפי Piotr Migdał, נתנו ל-Opus 5.5 שש שעות לבנות ויזואליזציה, והוא עצר אחרי שעה ו-25 דקות עם שישה סוכנים במקביל. הכותב רצה לנזוף בו, ואז ראה את התוצאה ונשאר בלי מילים. יופי. אבל מי בדק את כולה? שקופית אחת שבורה מתוך שלושים, ואף אחד לא יגיד וואו על השאר
חוקר נתן לארבעה סוכני קוד מאה דולר כל אחד לבנות עורך PDF, ולפי הבלוג שלו כמעט בכולם יש באג אחרי כמה קליקים. באחד הצבעים התהפכו במצב כהה. בן אדם היה רואה את זה מיד, כי הוא מנסה להשתמש בדבר. סוכן כותב וממשיך הלאה. במצגות זה אותו דבר. מי שבונה כלי AI, שמישהו יסתכל על התוצאה
מישהו העביר בעזרת מודלים את המהדר של TypeScript ל-Rust, וכתב ב-README שהוא לא קרא שורה אחת מהקוד. לפי אותו README, כל 181,711 הבדיקות שהועברו מהמקור עוברות. ככה אפשר לתת לסוכן לרוץ בלי לקרוא אחריו: מישהו כבר כתב מה נחשב נכון. מי שבונה מעל סוכן, תתחילו מהבדיקות
אנתרופיק אומרים ש-Haiku 5.5 עולה בממוצע בערך 75 אחוז פחות מ-Haiku 4.5. אז מי שבונה כלי מצגות ומריץ מודל גדול על תיקון של שקופית אחת, די. תנו למודל הקטן את העבודה הקטנה, ותשמרו את הגדול למה שצריך שיקול דעת
OpenAI נותנים ל-ChatGPT לבנות לכל תשובה ממשק שלם מתוך ספריית רכיבים, ובהודעה שלהם כתוב שעוד צריך לשפר לו את שיקול הדעת בעיצוב. מכירים את זה ממצגות. כלי שמחליט לבד איך הכל נראה מוציא תוצאה יפה בפעם הראשונה. אני רוצה לראות מה קורה כשאומרים לו להשאיר את הכפתור הזה איפה שהוא
לפי ארמין רונשר, סוכן שצריך לעבור על המון פריטים בודק קודם חמישה עד עשרה, ורק אז כותב סקריפט לשאר, ולא מעביר כל תוצאה דרך ההקשר של המודל. אני רוצה את זה בכל כלי AI שעובד על מצגת ארוכה. שיבדוק שקופית או שתיים, שיריץ קוד על השאר, ושיפסיק לקרוא את כל המצגת מחדש בכל תיקון
OpenAI פתחו בבטא API שמחזיר הסתברות במקום תשובה. כמה סביר שהתנאי נכון, לא כן או לא. סוף סוף. כלי AI שמדברים בביטחון מלא על הכל מעצבנים אותי יותר מכל דבר אחר. מי שבונה מעל זה: תראו למשתמש את ההסתברות עצמה ולא וי ירוק
Mistral מכריזים שה-ML4 החדש שלהם טוב במה שאנשים באמת מייצרים בעבודה: גיליונות, מצגות ו-PDF. ההוכחה היא ציון של 1,393 Elo במבחן שלהם. מספר כזה לא אומר לי כלום על מצגת. תראו לי מה קורה כשמבקשים לשנות בה שקופית אחת
לפי הבלוג The Autodidacts, ויבקודינג מקדים את הכיף: אב טיפוס תוך דקות, ואחר כך מנקים את מה שנוצר ואין בזה שום כיף. במצגות זה בדיוק אותו דבר. הגרסה הראשונה מרשימה כל פעם, ובעריכה העשרים כבר רואים מה הכלי שווה. מי שמראה לי דמו, שיראה לי את העריכה העשרים
Reflection הכריזו על Beam, מודל פתוח עם 501 מיליארד פרמטר, אבל המשקולות יגיעו רק "בהמשך החודש". עד אז יש טבלאות, וחידה אחת שלדבריהם בת כמה ימים ולכן "לא יכלה להיות באימון". אני רוצה שמי שמציג הכללה למשימה חדשה יסביר איך בדק שהיא באמת חדשה, כי "ימים" זה לא בדיקה
Vals AI פרסמו שסוכנים של Opus 5.5 תכננו חומר חדש לזיכרון של מחשבים, ובאותו פוסט כתבו בעצמם שכנראה אי אפשר לייצר אותו: האטומים מתערבבים בחום שצריך להכנה. את החומר השני כבר תיארו ב-1999. אני רוצה את זה בכל כלי AI: מה כנראה לא עובד, על אותו מסך ולא בהערת שוליים
ChatGPT מצייר קריקטורות בסגנון הניו יורקר וחותם עליהן בשמות של קריקטוריסטים אמיתיים, יותר מ-15 לפי Nieman Lab. אף אחד לא ביקש חתימה. המודל החליט שציור צריך אחת. גם אחרי שפנו ל-OpenAI הוא עדיין חותם לפעמים. מי שבונה מחולל: אם הפלט לא בא ממקור, אל תתנו לו להיראות כאילו בא
ויקימדיה מצאו אצלם סוכנים שערכו דפים ושלחו מיליוני בקשות ל-API, ולפי הפוסט שלהם אף אחד לא ביקש אישור, למרות שבוט מוצהר מותר שם.
מי שבונה סוכן שיוצא לרשת: תנו לו שם שרואים בלוג של האתר ודרך לחסום אותו. זו שורה אחת, ובלעדיה מישהו אחר מנקה אחריכם