עלויות LLM בפרודקשן: מה שאף אחד לא אומר לכם לפני שמשיקים
עלויות LLM API בפרודקשן: טבלת עלות-ל-1M-טוקן לכל המודלים, עד 80% חיסכון עם prompt caching, batching לעומסים אסינכרוניים ומתי self-hosting שווה.
הדמו לא עולה כלום. זו הבעיה.
כל טוטוריאל LLM עובד עם קומץ קריאות בדיקה שעולות שברי סנט. אתם משיקים, המשתמשים מגיעים, והחשבון שמגיע אחריהם הוא הפעם הראשונה שרוב המייסדים בודקים ברצינות את מחירי ה-LLM בפרודקשן. בשלב הזה כבר קיבלתם את ההחלטות הארכיטקטוניות היקרות.
זהו פוסט 5 בסדרת ה-AI pillar. הפוסטים הקודמים כיסו בחירת ה-LLM הנכון לסטארטאפ, מתי RAG שווה לבנות, סוכני AI לכלים פנימיים ואוטומציה עם AI לעסק. הפוסט הזה עוסק במה שהארכיטקטורה הזו באמת עולה כשמשתמשים אמיתיים מגיעים.
טבלת עלות-ל-1M-טוקן (המספר שכל צוות חייב להפנים)
מחירים משתנים תכופות — בדקו את התיעוד הרשמי לפני שמתחייבים. מחירים משוערים לאמצע 2026:
| מודל | קלט / 1M טוקן | פלט / 1M טוקן | הערות |
|---|---|---|---|
| Gemini 1.5 Flash | ~$0.075 | ~$0.30 | האפשרות הזולה ביותר לנפח גבוה |
| GPT-4o mini | ~$0.15 | ~$0.60 | מודל סיווג זול ונפוץ |
| Claude Haiku | ~$0.25 | ~$1.25 | מהיר + עדין; מתאים לצעדי agent |
| Gemini 1.5 Pro | ~$1.25 | ~$5.00 | מסמכים ארוכים, GCP-native; חלון הקשר רחב |
| Claude Sonnet | ~$3.00 | ~$15.00 | agents מורכבים, קוד, עיבוד מסמכים |
| GPT-4o | ~$5.00 | ~$15.00 | אקוסיסטם עמוק; הכי versatile |
| Claude Opus | ~$15.00 | ~$75.00 | איכות reasoning מקסימלית; השתמשו בצמצום |
הטבלה חושפת פער של 200× בעלות בין האפשרות הזולה לאפשרות היקרה. צוותים שמנתבים לפי מורכבות הבקשה משתמשים במודלים מתקדמים ל-10–20% מהבקשות שמצדיקות זאת, ובמודלים זולים לכל השאר. צוותים שמשתמשים במודל flagship אחד לכל דבר משלמים מחיר frontier על עבודה שלא צריכה אותו.
דוגמה מחושבת: 10,000 משתמשים ביום
נניח שיש לכם פיצ’ר AI שמייצר סיכום ממסמך שהמשתמש מגיש. כל בקשה: ~2,000 טוקני קלט (המסמך) ו-~500 טוקני פלט (הסיכום). ב-10,000 בקשות ביום:
עם GPT-4o:
- 20M טוקני קלט ביום × ($5 / 1M) = $100/יום
- 5M טוקני פלט ביום × ($15 / 1M) = $75/יום
- סה”כ: ~$175/יום → ~$5,250/חודש
עם Claude Haiku:
- 20M טוקני קלט ביום × ($0.25 / 1M) = $5/יום
- 5M טוקני פלט ביום × ($1.25 / 1M) = $6.25/יום
- סה”כ: ~$11.25/יום → ~$338/חודש
זה הבדל של 15× על אותה משימה. אם GPT-4o ו-Claude Haiku מספקים איכות שקולה בסיכום מסמכים — בדקו על 50 דוגמאות אמיתיות, לעתים קרובות הם כן — זה $4,900/חודש של עלות שניתן להימנע ממנה ב-10K משתמשים ביום, צומחת לינארית עם הצמיחה שלכם.
זו גם הסיבה שבחירת מודל היא החלטה ארכיטקטונית, לא סתם בחירת כלים. שינוי אחרי ההשקה אומר ביקורת על כל prompt, הרצה מחדש של האבלואציות ואולי בנייה מחדש של טיפול בשגיאות. לא עבודת אחר-צהריים.
Prompt caching: החיסכון שרוב הצוותים מפספסים
גם Anthropic (Claude) וגם Google (Gemini) מציעות prompt caching — יכולת לשמר את הטוקנים הראשוניים של הפרומפט ולעשות בהם שימוש חוזר ברמת עלות נמוכה משמעותית.
מתי זה רלוונטי? בכל פעם שיש לכם system prompt גדול, מסמך ייחוסי, או קטע בסיס ידע שמופיע בכל קריאה. בזרימות עבודה של agent, זה כמעט תמיד נכון — ההוראות וההקשר של ה-agent הם בדרך כלל החלק הגדול ביותר של הקלט.
מודל ה-caching של Claude (משוער):
- כתיבת cache: ~25% פרמיה על עלות קלט רגילה
- קריאת cache: ~90% הנחה מעלות קלט רגילה
- TTL של ה-cache: 5 דקות, מתרענן בכל שימוש בתוך החלון
ההשפעה בקנה מידה: agent של Claude Sonnet עם system prompt של 5,000 טוקן שרץ ב-10K בקשות ביום:
- ללא caching: 50M טוקני system-prompt ביום × ($3 / 1M) = $150/יום רק על ה-system prompt
- עם caching: משלמים מחיר מלא על write אחד לכל חלון cache, ואז
$0.30/1M על reads; עלות ה-system prompt יורדת ל-$16/יום
שיעורי cache hit מעל 80% יכולים להוריד עלויות inference של Claude ב-40–60% בזרימות עבודה עם הרבה פרומפטים. זה הופך את Claude לתחרותי יותר ממה שהמחיר לטוקן מרמז עליו — במיוחד ב-agent ועיבוד מסמכים שבהם אותו הקשר חוזר בכל קריאה.
Batching לעומסי עבודה אסינכרוניים
לא כל קריאת LLM צריכה לקרות בזמן אמת. עיבוד מסמכים, יצירת דוחות, ניתוח לילי ועבודות העשרה ברקע יכולים לרוץ כ-batch workloads — וה-Batch APIs זולים משמעותית יותר.
OpenAI Batch API: ~50% הנחה על מחיר רגיל; אסינכרוני, תוצאות מוחזרות תוך 24 שעות.
Anthropic Message Batches: הנחת מחיר ומודל אסינכרוני דומים.
לכל עומס עבודה שלא דורש תגובה בזמן אמת למשתמש, batching הוא חיסכון ללא עלות נוספת. pipeline ליצירת דוחות שעלה $300/חודש ב-GPT-4o בזמן אמת עשוי לעלות $150/חודש על ה-Batch API ללא שינוי באיכות.
עלות הפיתוח: צריך לטפל ב-async callbacks במקום בתגובות סינכרוניות. ברוב כלי ה-workflow (n8n, Make, worker queue פשוט), זו שינוי חד-פעמי.
שלוש טעויות עלויות שצוותים עושים אחרי השקה
1. מודל אחד לכל דבר. שימוש ב-GPT-4o לסיווג כרטיסי תמיכה זה כמו לשכור אדריכל בכיר לענות על כל מייל תמיכה. תקרת איכות הפלט לאותה משימה נמוכה מתקרת יכולת המודל — אתם משלמים מחירי frontier על עבודת commodity.
2. תשלום על טוקנים שאתם לא משתמשים בהם. קריאות LLM רבות מפיקות הרבה יותר טוקנים מהנדרש כי ה-prompt לא מגביל את אורך הפלט. “סכם את זה ב-2–3 משפטים” הוא גם UX טוב יותר וגם זול באופן דרמטי מ-prompt פתוח שמחזיר 1,000 טוקן.
3. אין observability על עלויות. אם אתם לא עוקבים אחרי שימוש בטוקנים לכל קריאה ומיפוי לפיצ’רים ומשתמשים, אין לכם אות על מקום האופטימיזציות בעלות הגבוהה ביותר. שימוש בטוקנים צריך להיות מטריקה ראשית ב-observability stack שלכם — לא מחשבה אחורית שמסתכלים עליה רק כשהחשבון מפתיע אתכם.
מתי self-hosting LLM כדאי כלכלית
השאלה שחוזרת בכל אבן דרך: האם כדאי לנו לאחסן בעצמנו?
התשובה הישרה: כמעט אף פעם לפני $50K/חודש בהוצאות API. אחסון עצמאי של מודל open-weight באיכות frontier (Llama 3.1, Mistral Large, Qwen 2.5) דורש:
- מכונות GPU: A100 80GB ב-
$3–4/שעה, או H100 ב-$5–8/שעה; הגשה אמינה של מודלים 70B בדרך כלל דורשת 2–4 GPUs - הקמה הנדסית: 2–4 שבועות להגדרת שרת inference (vLLM, TGI), ניטור, autoscaling ו-failover
- ops שוטף: עלות התשתית לא נעלמת — היא דורשת תחזוקה בכל עדכון מודל
ב-$10K/חודש בעלויות API, ה-API בענן הוא כמעט בוודאות זול יותר כשמחשבים שעות הנדסה להקמה ותחזוקה שוטפת. ב-$100K/חודש, החישוב לעיתים קרובות מתהפך — אבל אמתו עם דפוס השימוש ודרישות המודל הספציפיים שלכם.
האמצע: ספקי inference מנוהלים (Together.ai, Fireworks.ai, Replicate) מריצים מודלים open-weight במחירים תחרותיים עם ספקי ה-API הגדולים, ללא נטל ה-ops. שווה לבדוק לפני שמריצים בעצמכם.
שלוש שאלות לפני ההשקה
לפני שפיצ’ר ה-AI שלכם עולה לאוויר, שלוש שאלות שמונעות הפתעות יקרות:
-
מה נפח הבקשות הריאלי בהשקה לעומת תחזיות ל-6 חודשים? הריצו את חישוב הטוקנים על שניהם. וודאו שהתחזית ל-6 חודשים לא דורשת שיחת מחיר שלא קיימתם.
-
האם המקרה שלכם באמת צריך מודל frontier? בדקו את הגרסה הזולה על 50 דוגמאות אמיתיות מהמשתמשים שלכם. פער האיכות קטן יותר ממה שאתם מצפים במשימות מובנות.
-
האם יש הקשר גדול חוזר בכל קריאה? אם כן, prompt caching צריך להיות בתוכנית ההטמעה שלכם מהיום הראשון — תוספת ארכיטקטונית שקל יותר להוסיף מוקדם מאשר לשלב לאחר מכן.
הפער בין “עלות הדמו” ל”עלות הפרודקשן” הוא אמיתי, אבל לגמרי צפוי. המייסדים שמפספסים את ההפתעה עושים את החישוב לפני הבנייה, לא אחרי החשבון הראשון.
אם אתם בשלב הארכיטקטורה ורוצים חוות דעת שנייה על מבנה העלויות לפני שמתחייבים למחסנית, CTO חלקי יכול לעזור לכם לסגור את זה נכון. קבעו שיחה — ללא התחייבות, ללא מכירה.
זהו פוסט 5 בסדרת ה-AI pillar. התחילו באוטומציה עם AI לעסק, המשיכו דרך סוכני AI לכלים פנימיים, RAG, בחירת ה-LLM הנכון, ואז לפוסט הזה. הבא בסדרה: הנדסת פרומפטים בפרודקשן — 6 הדפוסים שמשפרים אמינות ועקביות פלט ה-LLM בקנה מידה. אחר כך: בדיקות ומעקב לאפליקציות AI בפרודקשן — 5 מדדים וכלים שהופכים את הפיצ’רים ה-AI שלכם לגלויים כשמשהו משתבש בשעה שתיים לפנות בוקר.