דילוג לתוכן
Visibelo

סוכני AI6 דקות קריאה

llms.txt ו־robots.txt לסורקי AI: מה באמת משנה

אילו סורקי AI לאשר ב־robots.txt, אילו לחסום, מה llms.txt עושה ומה לא, וקובץ robots.txt לאתר עסקי שאפשר להעתיק.

מאת פורסם

במילים פשוטות

סוכני AI כמו ChatGPT ו־Perplexity שולחים תוכנות שקוראות אתרים, וקובץ הגדרות קטן באתר שלכם קובע למי מהן מותר להיכנס. יש עסקים שסוגרים את הדלת בטעות ואז לא מופיעים בתשובות של AI. המאמר מסביר למי כדאי לתת להיכנס, והאם קובץ היכרות ל־AI שווה את המאמץ (הוא זול, אבל לא ישנה הרבה).

המאמר הזה נכנס לפרטים הטכניים. לא צריך אותם כדי לפעול לפי הסיכום שלמעלה; הם כאן בשבילכם או בשביל מי שבונה לכם את האתר.

לנסות בחינם: קובץ היכרות ל־AI
בעמוד הזה

בקצרה: קובץ robots.txt קובע אילו סורקים רשאים לגשת לעמודים שלכם, ובחיפוש מבוסס AI זה משנה הרבה: חוסמים את OAI-SearchBot ונעלמים מתשובות החיפוש של ChatGPT, חוסמים את PerplexityBot והאינדקס של Perplexity מאבד אתכם. סורקי האימון (GPTBot, ClaudeBot, Google-Extended) הם החלטה נפרדת, וחסימה שלהם לא מוציאה אתכם מפיצ'רי החיפוש. llms.txt הוא הצעה לקובץ סיכום למודלי שפה, ואף מנוע חיפוש AI גדול לא אמר שהוא קורא אותו. רוצים אחד? הכלי החינמי קובץ היכרות ל־AI מכין אותו בדקה. את המאמץ האמיתי תשקיעו ב־robots.txt.

מבין שני הקבצים בכותרת, אחד קובע אם סוכני AI רואים את האתר שלכם בכלל, והשני הוא בעיקר נושא לשיחה. נחשו על מי כותבים יותר פוסטים בלינקדאין.

מה robots.txt שולט בו?

robots.txt הוא קובץ טקסט פשוט בשורש הדומיין, שאומר לסורקים לאילו נתיבים מותר להם לגשת, בקבוצת חוקים לכל User agent. הוא הפך לתקן ב־2022 כ־RFC 9309, וגוגל מתעדת איך היא קוראת אותו במדריך ה־robots.txt שלה. יש לו שתי מגבלות חשובות. הראשונה: הוא שולט בסריקה, לא באינדוקס. כתובת חסומה עדיין יכולה להופיע בגוגל אם עמודים אחרים מקשרים אליה, רק בלי תיאור, ולכן כדי להוציא עמוד מהחיפוש משתמשים בתגית noindex ומשאירים אותו פתוח לסריקה. השנייה: זו בקשה שסורקים מנומסים מכבדים, לא בקרת גישה. חברות ה־AI הגדולות מתעדות שהסורקים שלהן מכבדים אותו, ולכן הוא הכלי הנכון להחליט מי נכנס, והכלי הלא נכון להגן על משהו סודי. סורק פועל לפי הקבוצה הספציפית ביותר שמזכירה אותו בשם, ורק אם אין כזו, לפי קבוצת ה־*.

אילו סורקי AI קיימים, ומה כל אחד עושה?

כל חברה מפרידה היום בין הסורקים שלה לפי תפקיד, וזה טוב, כי זה מאפשר להגיד כן לחיפוש ולא לאימון. אלה ה־User agents כמו שהחברות עצמן מתעדות אותם.

User agent חברה תפקיד מקור
OAI-SearchBot OpenAI מוצא עמודים לחיפוש של ChatGPT OpenAI
ChatGPT-User OpenAI ניגש לעמוד כשמשתמש מבקש מ־ChatGPT OpenAI
GPTBot OpenAI אוסף מידע לאימון OpenAI
Claude-SearchBot Anthropic משפר את תוצאות החיפוש ב־Claude Anthropic
Claude-User Anthropic ניגש לעמוד כשמשתמש מבקש מ־Claude Anthropic
ClaudeBot Anthropic אוסף מידע לאימון Anthropic
PerplexityBot Perplexity בונה את האינדקס של Perplexity Perplexity
Perplexity-User Perplexity ניגש לעמוד כשמשתמש מבקש Perplexity
Google-Extended גוגל קובע שימוש באימון Gemini ובעיגון תשובות גוגל
Applebot-Extended אפל קובע שימוש באימון המודלים של אפל אפל
CCBot Common Crawl בונה סריקה פתוחה שמודלים רבים מתאמנים עליה Common Crawl

Google-Extended ו־Applebot-Extended הם לא סורקים נפרדים שמבקרים באתר. הם שמות שכותבים ב־robots.txt כדי לקבוע מדיניות לתוכן שהסורק הראשי כבר הביא.

חסימת סורקי אימון פוגעת בנראות בחיפוש AI?

לפי התיעוד של החברות עצמן, לא. OpenAI כותבת שכל הגדרה שלה עומדת בפני עצמה, כך שאתר יכול לחסום את GPTBot ולאשר את OAI-SearchBot ועדיין להופיע בחיפוש של ChatGPT. גוגל כותבת של־Google-Extended אין השפעה על ההופעה או על הדירוג בחיפוש, ו־AI Overviews ו־AI Mode הם פיצ'רים של החיפוש שמשתמשים במה ש־Googlebot סורק. גם Anthropic ו־Perplexity מפרידות בין סורקי האימון לסורקי החיפוש.

אז ההחלטה מתפצלת לשתיים. לאשר את סורקי החיפוש ואת הגישה ביוזמת משתמש זו הדרך להישאר גלויים בתשובות AI, ולאתר עסקי אין הרבה סיבות לסרב. לאשר את סורקי האימון זו שאלה אם אתם רוצים שהטקסט שלכם ישמש לאימון מודלים, וזו החלטה עסקית וערכית, לא החלטת SEO. ברירת המחדל שלנו באתרים של לקוחות: לאשר את סורקי החיפוש, ולהשאיר את האימון כהחלטה מפורשת של בעל האתר.

איזה robots.txt מתאים לאתר עסקי?

זה הקובץ שממנו אנחנו מתחילים באתרים עסקיים. הוא מכניס את כל סורקי החיפוש והגישה ביוזמת משתמש, משאיר נתיבים פרטיים בחוץ, ומשאיר את החלטת האימון כבלוק מסומן שאפשר להפוך:

# Search engines and AI search: welcome
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /cart/

User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
Allow: /
Disallow: /admin/
Disallow: /cart/

# Model training: your choice. Delete this block to allow it.
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
Disallow: /

Sitemap: https://example.co.il/sitemap.xml

לפי RFC 9309 מותר לקבץ כמה שורות User-agent מעל אותם חוקים. שימו לב שסורק שמוזכר בקבוצה ספציפית מתעלם לגמרי מקבוצת ה־*, ולכן הנתיבים הפרטיים חוזרים גם בקבוצת החיפוש. ההערות בקובץ באנגלית בכוונה, כי חלק מהכלים לא מתמודדים טוב עם עברית ב־robots.txt. את התוצאה אפשר לבדוק בבדיקת הנראות ב־AI החינמית, שקוראת את הקובץ כמו שכל בוט קורא אותו.

איפה robots.txt צריך לשבת?

בשורש של כל מארח, בדיוק. https://example.co.il/robots.txt חל על https://example.co.il ועל שום דבר אחר: www.example.co.il, shop.example.co.il וגרסת http:// צריכים כל אחד קובץ משלו, או הפניה לקובץ שחל עליהם. הנתיבים בחוקים רגישים לאותיות גדולות וקטנות, כך ש־Disallow: /Admin/ לא חוסם את /admin/. גוגל קוראת רק את 500 הקילובייט הראשונים של הקובץ ושומרת אותו במטמון עד יום בדרך כלל, אז תיקון שפרסמתם בצהריים אולי ייכנס לתוקף רק מחר. תשמרו על קובץ קצר שנקרא במסך אחד, ותכתבו הערה מעל כל קבוצה שמסבירה למה היא שם, כי מי שיערוך אותו אחריכם לא יזכור. ב־Search Console יש דו"ח robots.txt שמראה את הגרסה האחרונה שגוגל הביאה ושורות שהיא לא הצליחה לפענח.

למה סורקי AI חסומים כש־robots.txt מאשר אותם?

כי robots.txt הוא לא שומר הסף היחיד. הסיבה הנפוצה ביותר שאנחנו מוצאים בבדיקות היא שכבת CDN או אבטחה שדוחה בוטים עוד לפני שמישהו קרא את robots.txt. ב־Cloudflare, למשל, יש חסימה של סורקי AI בלחיצה אחת, ותוספי אבטחה לוורדפרס עושים דברים דומים. הסורק מקבל 403 או עמוד אתגר, ה־robots.txt אומר "ברוכים הבאים", ואף אחד לא שם לב כי בדפדפן האתר עובד מצוין.

עוד חשודים קבועים: Disallow: / מסביבת הבדיקות שעלה לאתר החי, קבוצת * שחוסמת הכול עם קבוצה ספציפית שאמורה לגבור עליה ויש לה שגיאת כתיב בשם הסורק, ו־robots.txt שמחזיר שגיאת 5xx. גוגל מתייחסת לשגיאת שרת בקובץ כסיבה לעצור סריקה, כמו שמוסבר בתיעוד שלה. בודקים את קוד התגובה ואת הגדרות הבוטים ב־CDN, בנוסף לקובץ עצמו.

מה זה llms.txt?

llms.txt הוא הצעה שפורסמה ב־llmstxt.org בספטמבר 2024 על ידי ג'רמי הווארד, לקובץ Markdown בכתובת /llms.txt שנותן למודלי שפה סיכום ערוך של האתר. הפורמט הוא כותרת H1 עם שם האתר, ציטוט (blockquote) עם סיכום קצר, ואז מקטעים של קישורים עם תיאור בשורה אחת:

# מרפאת השיניים הנמל

> מרפאת השיניים הנמל היא מרפאת שיניים משפחתית בקריית הנמל
> שמציעה בדיקות, סתימות, כתרים והלבנת שיניים.

## טיפולים
- [בדיקה וניקוי](https://example.co.il/check-ups): למבוגרים ולילדים, פעמיים בשנה
- [הלבנת שיניים](https://example.co.il/whitening): הלבנה במרפאה בביקור אחד או שניים

## יצירת קשר
- [יצירת קשר](https://example.co.il/contact): כתובת, טלפון ווואטסאפ

קובץ נלווה, llms-full.txt, יכול להכיל את הטקסט המלא של העמודים החשובים בקובץ אחד.

מנועי חיפוש AI באמת קוראים את llms.txt?

נכון לספטמבר 2026, אף אחד ממוצרי החיפוש הגדולים מבוססי AI לא תיעד שימוש ב־llms.txt כשהוא מחליט את מי לצטט. ההנחיות של גוגל לפיצ'רי AI אומרות שאין מה ליצור מעבר ל־SEO רגיל, וג'ון מולר מגוגל אמר בפומבי שאף מערכת AI לא משתמשת היום בקובץ, והשווה אותו לתגית ה־keywords הישנה. OpenAI, Anthropic ו־Perplexity מתעדות בפירוט את הסורקים שלהן ואת היחס ל־robots.txt, ולא אומרות מילה על קריאת llms.txt מאתרים אחרים.

איפה שכן משתמשים בו זה תיעוד למפתחים. סוכני קוד מבוססי AI טוענים קבצי llms.txt כדי להכניס להקשר את התיעוד של ספרייה, וכמה פלטפורמות תיעוד מייצרות אותו אוטומטית. אם יש לכם מוצר למפתחים, תפרסמו. אם יש לכם מרפאת שיניים, זה לא מזיק וכנראה גם לא ישנה כלום. אנחנו בודקים אם הוא קיים ולא נותנים לו משקל בציון.

אז מה עושים בפועל?

  1. פותחים את yoursite.co.il/robots.txt וקוראים. מחפשים Disallow: / תחת סורק חיפוש AI כלשהו או תחת *.
  2. מריצים אותו בבדיקת הנראות ב־AI כדי לראות איך כל בוט מפרש אותו.
  3. בודקים את ה־CDN, את חומת האש ואת תוסף האבטחה, ומיישרים אותם עם מה ש־robots.txt אומר.
  4. מחליטים במודע לגבי סורקי האימון, ורושמים את ההחלטה כהערה בקובץ.
  5. אם רוצים llms.txt, מכינים אותו בכלי קובץ היכרות ל־AI, שומרים עליו מדויק, וממשיכים הלאה.

לתמונה הרחבה של איך סוכני AI בוחרים מקורות, קראו מה זה GEO?. אם אתם רוצים שכל כלל סורקים, תגובת CDN ובדיקת מוכנות ל־AI ייבדקו על כל האתר, הדו"ח המלא עושה את זה ואומר לכם מה לשנות.

שאלות שחוזרות

חסימה של GPTBot מוציאה את האתר מ־ChatGPT?
לא. GPTBot אוסף מידע לאימון. החיפוש של ChatGPT נשען על OAI-SearchBot, ו־OpenAI כותבת שההגדרות בלתי תלויות, כך שאפשר לחסום את GPTBot ולאשר את OAI-SearchBot ולהמשיך להופיע בתשובות החיפוש של ChatGPT.
חסימה של Google-Extended מוציאה אותי מ־AI Overviews?
לא. גוגל כותבת ש־Google-Extended לא משפיע על ההופעה או על הדירוג בחיפוש. AI Overviews ו־AI Mode הם חלק מהחיפוש ומשתמשים בעמודים ש־Googlebot סרק, כך שהדרך היחידה לצאת מהם היא שליטה בתקצירים או יציאה מהחיפוש.
ChatGPT, Perplexity או גוגל קוראים את llms.txt?
אף אחד מהם לא תיעד שהוא קורא את הקובץ כשהוא בוחר מקורות. ג'ון מולר מגוגל אמר בפומבי שאף מערכת AI לא משתמשת בו, וההנחיות של גוגל לפיצ'רי AI אומרות שלא צריך קבצי AI מיוחדים. סוכני קוד כן משתמשים בו באתרי תיעוד.
robots.txt מספיק כדי למנוע מחברות AI להשתמש בתוכן?
זו בקשה, לא מנעול. חברות ה־AI הגדולות מתעדות שהסורקים שלהן מכבדים אותו, אבל גישה ביוזמת משתמש מטופלת אחרת: Perplexity כותבת ש־Perplexity-User בדרך כלל לא מציית ל־robots.txt, כי בן אדם ביקש את העמוד. אכיפה אמיתית עוברת דרך ה־CDN או חומת האש.
כמה זמן לוקח לשינוי ב־robots.txt להיקלט?
גוגל שומרת את robots.txt במטמון עד 24 שעות בדרך כלל, ו־OpenAI כותבת שלמערכות שלה לוקח בערך 24 שעות להתעדכן. תכננו יום עד שחוק חדש מכובד בכל מקום.

קובץ היכרות ל־AI

כותב קובץ קצר שמציג את העסק שלכם לסוכני AI. זול שיהיה, ומוכן תוך דקה.

לבדוק את האתר שלי

עוד בדיקות חינמיות

מהירות6 דקות קריאה

Core Web Vitals ב־2026: איך מתקנים LCP, INP ו־CLS, כולל מעבר על דו"ח PageSpeed

גוגל מודד כמה מהר האתר נטען, כמה מהר הוא מגיב כשנוגעים בו, והאם דברים קופצים בזמן הטעינה. אתר איטי או קופצני מאבד מבקרים עוד לפני שקראו מילה, וגוגל שם לב. המאמר מסביר את שלושת המדדים, איך נראית תוצאה טובה ומה בדרך כלל מתקן תוצאה גרועה. בדיקת המהירות החינמית נותנת לכם את המספרים שלכם תוך דקה.

בריאות האתר6 דקות קריאה

דוגמה: איך אתר של מרפאה שכונתית יכול לעבור משקוף לגלוי

זו דוגמה בדויה ולא לקוח אמיתי: מרפאת שיניים משפחתית עם אתר ישן שגוגל כמעט לא מציג. אנחנו עוברים על מה שבדיקה מוצאת, אילו תיקונים הכי חשובים ובאיזה סדר, ואיך הציון יכול לעלות מ־41 ל־82. המספרים להמחשה, אבל כל בעיה כאן היא בעיה שאנחנו רואים באתרים של עסקים קטנים כל הזמן.

בריאות האתר7 דקות קריאה

צ'קליסט בדיקת SEO ל־2026: הבדיקות שאנחנו מריצים על כל אתר

בדיקת אתר מסתכלת על שבעה דברים: האם גוגל מגיע לעמודים, האם הטקסט עונה על מה שלקוחות שואלים, איך כל עמוד מוצג בתוצאות, הסימונים הנסתרים שמסבירים לגוגל מה העסק, מהירות, האם סוכני AI יכולים לקרוא את האתר, והתמונות. כל תחום מקבל ציון, והסך הכול הוא מתוך 100. את רוב הבדיקות אפשר להריץ לבד בכלים חינמיים, או לקבל את כולן מוכנות בדו"ח.