המדריך מהריל · מילת הקוד: טוקנים
Headroom: איך לחסוך טוקנים ב־Codex וב־Claude, ומה לבדוק בדרך
פלט ארוך של כלי יכול למלא את השיחה לפני שהסוכן מתחיל לפתור את המשימה. Headroom מצמצם את המידע שנשלח למודל. בריל בדקנו כמה טוקנים נחסכו והאם הפרטים שסימנו מראש נשארו. כאן תמצאו את התוצאות, את הוראות ההתחלה ואת הבדיקות שכדאי לבצע על החומר שלכם.

1.מה Headroom עושה
טוקנים הם יחידות הטקסט שהמודל מעבד. גם תוצאות חיפוש בקוד, לוגים ותשובות של כלים תופסים מקום בחלון ההקשר. Headroom הוא פרויקט בקוד פתוח שמכווץ תוכן לפני שהוא מגיע למודל, באמצעות ספרייה או שרת תיווך מקומי.
היצרן מציג חיסכון של עד 95% בפלטים מסוימים, בעיקר נתונים חזרתיים כמו מערכי JSON. זו טענת היצרן לגבי סוגי קלט מסוימים, ולא הבטחה לחיסכון של 95% בכל שיחה, במשימות קוד או בחשבון החודשי שלכם.
2.מה מדדנו אצלנו
ב־17 בספטמבר 2026 בדקנו פלט חיפוש מקומי בקוד עם Headroom בגרסה 0.37.0. הפלט כלל 91 שורות ו־13,138 תווים. הדחיסה רצה עם מודל ONNX מקומי, ללא קריאת LLM חיצונית. ספירת הטוקנים נעשתה באמצעות Headroom עבור gpt-4o, ולא מתוך דוח החיוב של Codex או Claude.
בהגדרת יחס שמירה של 0.70 ירדה הספירה מ־4,123 ל־3,163 טוקנים: 960 טוקנים פחות, חיסכון של 23.3%. כל ששת העוגנים שסימנו מראש נשמרו, כלומר 6/6. עוגן הוא פרט מדויק שהגדרנו כחיוני לבדיקה, למשל מזהה בקוד שצריך להישאר בפלט.
זו בדיקת דחיסה ייעודית באמצעות הספרייה, ולא ריצה מלאה של סוכן דרך פקודת wrap. בבדיקה כובו הגנות על התוכן האחרון ועל תוכן שהסוכן התבקש לנתח, כדי לאפשר לדחיסה לפעול על הדוגמה. לכן אין להסיק שאלה התוצאות שתקבלו בהגדרות ברירת המחדל.
3.עוד קצת חיסכון, אבל פרט אחד נעלם
בהגדרה האגרסיבית יותר, יחס שמירה של 0.35, התקבלו 3,149 טוקנים וחיסכון של 23.6%. אלא שרק 5/6 עוגנים נשמרו: המזהה updatedAt נעלם מהפלט הדחוס. ביחס לגרסה ששמרה את כל העוגנים, חסכנו עוד 14 טוקנים ואיבדנו פרט שהוגדר מראש כחיוני.
גם יחס שמירה של 0.50 לא שיפר את התוצאה: התקבלו 3,204 טוקנים, חיסכון של 22.3%, ורק חמישה עוגנים נשמרו. יחס השמירה שהוגדר הוא פרמטר של האלגוריתם; הוא אינו מבטיח שיעור חיסכון מסוים בפועל.
בבדיקה הזאת בחרנו בהגדרה שהניבה חיסכון של 23.3%. שמירת 6/6 עוגנים אומרת שששת הפרטים שנבדקו עדיין נמצאים בטקסט. היא אינה מוכיחה שכל המשמעות נשמרה או שהסוכן יענה נכון בכל משימה. לשם כך צריך לבדוק גם את התשובה ואת תוצאת העבודה.
4.התקנה ראשונה: מכינים סביבת בדיקה
המדריך מתייחס ל־Codex CLI ול־Claude Code במסוף. ודאו שהכלי שבחרתם כבר מותקן ועובד בפני עצמו. התחילו בפרויקט ניסוי ושמרו עותק של הגדרות הסוכן לפני חיבור שרת התיווך.
פקודת headroom מגיעה מחבילת Python. לפי מדריך ההתקנה הרשמי אפשר להתקין את תוספת שרת התיווך בסביבת Python וירטואלית. חבילת npm בשם headroom-ai היא ספרייה ל־TypeScript ואינה מספקת את פקודת המסוף.
- צרו סביבת Python וירטואלית והפעילו אותה לפי מערכת ההפעלה שלכם.
- במסוף של הסביבה הפעילה הריצו: pip install "headroom-ai[proxy]". בדקו קודם בתיעוד הרשמי את דרישות Python והתלויות לגרסה שאתם מתקינים.
- ודאו שההתקנה זמינה באמצעות: headroom --version.
- קראו את האפשרויות של הכלי שלכם: headroom wrap codex --help או headroom wrap claude --help.
5.הפעלה עם Codex או Claude Code
מתוך תיקיית פרויקט הבדיקה, הפעילו את הפקודה שמתאימה לסוכן שלכם. אלה פקודות מסוף, ולא טקסט שמדביקים בשיחה עם המודל. שתי הפקודות אומתו בתפריט העזרה של גרסה 0.37.0 המותקנת אצלנו.
הפקודה מפעילה את הסוכן דרך שרת התיווך המקומי. היא יכולה גם לרשום כלי MCP בהגדרות הסוכן. בגרסה שנבדקה Serena נבחר כברירת מחדל לזיכרון קוד. לניסוי בלעדיו הוסיפו --code-memory none לפקודת ההפעלה; כלי האחזור של Headroom הוא רכיב נפרד.
- ל־Codex הריצו: headroom wrap codex.
- ל־Claude Code הריצו: headroom wrap claude.
- בקשו מהסוכן משימת קריאה קטנה עם תוצאה ידועה מראש. השוו אותה להרצה ללא הדחיסה.
- בדקו את החיבור באמצעות headroom doctor ואת המדדים באמצעות headroom perf. פלט שמציג אפס חיסכון אינו מוכיח שיש תקלה: בדקו גם את סוג התוכן ואת נתיב התעבורה.
- כדי לבטל התאמות קבועות של העטיפה, עיינו בתיעוד והריצו לכלי המתאים headroom unwrap codex או headroom unwrap claude. בדקו לאחר מכן שהסוכן פועל שוב בהגדרות הרצויות.
6.מתי יש טעם לבדוק את הכלי
כדאי לבדוק דחיסה כאשר משימה חוזרת מחזירה הרבה שורות דומות, למשל לוגים או רשימות תוצאות. אם חלק מהמידע חוזר שוב ושוב, יש יותר מקום לצמצום. בשיחה קצרה או בפלט שכבר כתוב בצפיפות, החיסכון עלול להיות קטן או אפסי.
היתרון שנמדד אצלנו הוא פחות טוקנים באותה דוגמת קלט. כדי לקבוע אם זה מועיל לעסק שלכם, בדקו גם כמה זמן נדרש לסיים את המשימה והאם נוספו קריאות חוזרות כדי להשלים מידע שחסר. אל תבחרו הגדרה רק משום שהיא מציגה את אחוז החיסכון הגבוה ביותר.
חיסכון בטוקנים של הקלט אינו שקול לאותו חיסכון בכסף. תשובות המודל, מטמון, קריאות חוזרות ואופן החיוב משפיעים על העלות הכוללת. הבדיקה המקומית לא מדדה ירידה בחיוב, שינוי במכסת מנוי או שיפור במהירות.
7.מה נשאר מקומי ומה צריך לבדוק
הדחיסה יכולה להתבצע מקומית, אבל הסוכן עדיין פונה לספק המודל כדי לקבל תשובה. בנוסף, התיעוד מתאר רכיב דיווח אנונימי בשם Beacon שמופעל כברירת מחדל. לפי היצרן הוא שולח מדדים ומזהים, ללא תוכן שיחות, קוד או נתיבי קבצים. לכן אל תתייחסו להתקנה רגילה כהבטחה ששום מידע אינו יוצא מהמחשב.
Headroom מציע אחזור של המקור דרך CCR. בדקו שהמקור עדיין זמין ושכלי האחזור מחובר ופועל לפני שמסתמכים עליו. האפשרות לבקש מידע בחזרה אינה מבטיחה שהסוכן יזהה בעצמו איזה פרט חסר לו.
8.כך בודקים את הכלי במשימה שלכם
בחרו משימה קטנה שאפשר לקבוע אם בוצעה נכון. השתמשו בנתוני דמה או בחומר שמותר לעבד בסביבה שלכם. הגדירו מראש מה חייב להישמר, כדי שלא תבחרו בדיעבד רק את הפרטים ששרדו.
בדיקת עוגנים היא סינון ראשון. אחריה בדקו את התוצר המלא: האם המסקנה נכונה, האם קוד שהשתנה עדיין עובר את הבדיקות, והאם הסוכן נאלץ לחפש שוב מידע שהיה זמין בקלט המקורי.
- שמרו קלט בסיס ללא דחיסה ורשימת פרטים שחייבים להישאר מדויקים.
- תעדו את גרסת Headroom, ההגדרות ושיטת ספירת הטוקנים.
- השוו מקור ופלט דחוס באותה שיטת ספירה, ובדקו כל עוגן מול שני הטקסטים.
- הריצו את אותה משימה עם הדחיסה ובלעדיה ובדקו את התוצאה בפועל.
- אם פרט נדרש נעלם, הפחיתו את הדחיסה או השאירו את הפלט הזה ללא דחיסה. חזרו על הבדיקה אחרי שינוי גרסה או הגדרות.
9.בודקים התאמה לתהליך בעסק
אם הצוות שלכם משתמש בסוכני קוד למשימות חוזרות, בחרו תהליך אחד למדידה לפני שמרחיבים את השימוש. השוו כמה מהעבודה הושלמה כראוי וכמה משאבים נדרשו לה, כולל תיקונים וקריאות חוזרות.
רוצים לבדוק תהליך כזה אצלכם? שלחו לי בוואטסאפ את המילה ״טוקנים״ וציינו באיזה כלי אתם עובדים ומה המשימה שחוזרת אצלכם. אפשר להתחיל מתיאור כללי, בלי לשלוח קוד פרטי או פרטי גישה.
בדיקה לפני מסירה
- טענת היצרן על עד 95% מופרדת מהמדידה המקומית של 23.3%.
- נשמרו הקלט המקורי, גרסת הכלי והגדרות הבדיקה.
- ספירת המקור והפלט הדחוס נעשתה באותה שיטה.
- כל העוגנים הנדרשים נבדקו, וגם תוצאת המשימה עצמה.
- נבדקו רישום כלי MCP, הגדרות הסוכן ואפשרות אחזור המקור.
- נבדקו נתיב התעבורה ודיווח המדדים בסביבה שבה עובדים.
- חיסכון בטוקנים אינו מוצג כחיסכון מוכח בחיוב או במכסת מנוי.
שאלות נפוצות
האם Headroom חוסך תמיד 95%?
לא. עד 95% היא טענת היצרן לפלטים מסוימים. בדוגמה המקומית שלנו נמדדו 23.3% חיסכון עם 6/6 עוגנים. צריך למדוד על סוג התוכן ועל המשימות שלכם.
למה בחרתם ב־23.3% ולא ב־23.6%?
הגרסה של 23.6% חסכה עוד 14 טוקנים, אבל המזהה updatedAt אבד ורק 5/6 עוגנים נשמרו. בבדיקה הזאת העדפנו לשמור את כל הפרטים שהגדרנו כחיוניים.
האם שישה עוגנים שנשמרו מוכיחים שלא אבד מידע?
לא. הם מוכיחים רק שששת הפרטים שסומנו נמצאים בפלט. מידע אחר יכול להשתנות או להיעלם. נדרשת גם בדיקה של תשובת הסוכן ושל התוצר.
האם 23.3% נמדדו בשימוש מלא ב־Codex או ב־Claude?
לא. זו בדיקת דחיסה מקומית באמצעות ספריית Headroom בגרסה 0.37.0, עם ספירה עבור gpt-4o והגדרות ייעודיות. היא לא כללה תשובת מודל חיצוני או מדידת חיוב של סוכן.
אפשר להשתמש בפקודות גם באפליקציות שולחן העבודה?
הפקודות במדריך מיועדות ל־Codex CLI ול־Claude Code במסוף. חיבור אפליקציה או הרחבת עורך דורש בדיקת הוראות נפרדת לגרסה שלכם. אין להסיק שהפעלת wrap מחברת כל חלון שכבר פתוח.
צריך להתקין גם את חבילת npm?
לא בשביל פקודת headroom. המדריך משתמש בחבילת Python עם תוספת שרת התיווך. חבילת npm היא ספרייה לשילוב בתוך קוד TypeScript.
האם הדחיסה מבטיחה מחיר מנוי נמוך יותר?
הבדיקה שלנו לא מדדה שינוי במחיר מנוי או בחיוב. כדי להעריך חיסכון כספי צריך להשוות נתוני שימוש וחיוב אמיתיים לצד איכות התוצאה.
רוצים לבדוק איך התהליך מתאים לעסק שלכם?
שלחו לי את המילה ״טוקנים״ בוואטסאפ וכתבו איזה סרטון אתם רוצים להכין.