كل الأسعار على هذا الموقع معروضة لكل مليون رمز، وذاكرة كل نموذج تُحسب بالرموز أيضًا. ومع ذلك نادرًا ما تُشرح الكلمة. الرمز (Token) قطعة من النص: كلمة كاملة حين تكون الكلمة شائعة، وجزء من كلمة حين تكون نادرة، أو مسافة أو علامة ترقيم. لا ترى النماذج حروفًا ولا كلمات أبدًا، بل هذه القطع فقط، التي تقطعها أداة تُسمّى أداة التقطيع (Tokenizer) قبل أن يصل النص إلى النموذج. فالكلمة الإنجليزية الشائعة مثل "house" تكون عادةً رمزًا واحدًا، أما الكلمة الطويلة أو النادرة فتُقسَّم إلى قطعتين أو ثلاث أو أكثر.
كم كلمة في الرمز؟
أحصينا ذلك على النصوص القصيرة نفسها في 15 لغة، بأداة التقطيع الخاصة بـ GPT-4o من OpenAI، وهي من أكثر الأدوات استخدامًا. في الإنجليزية، احتاجت 100 كلمة إلى 113 رمزًا. أي أن 1000 رمز تحتوي نحو 890 كلمة، وأن طول الرمز 5.2 حرف في المتوسط، مع احتساب المسافات. أما القاعدة الشائعة، 100 رمز مقابل 75 كلمة، فهي أقدم وأكثر تحفظًا: أدوات التقطيع الحالية أفضل قليلًا مع الإنجليزية اليومية.
اللغات الأخرى تحتاج إلى رموز أكثر
| اللغة | النص نفسه مقارنةً بالإنجليزية | الرموز لكل 100 كلمة | الأحرف لكل رمز |
|---|---|---|---|
| الإنجليزية | — | 113 | 5.2 |
| الصينية | +11% | — | 1.4 |
| البرتغالية | +15% | 127 | 4.8 |
| الإسبانية | +17% | 122 | 4.9 |
| الألمانية | +17% | 132 | 5.1 |
| الروسية | +19% | 160 | 4.4 |
| الفرنسية | +25% | 137 | 4.8 |
| الإندونيسية | +31% | 162 | 4.4 |
| العربية | +35% | 188 | 3.2 |
| التركية | +35% | 199 | 3.7 |
| الكورية | +39% | 219 | 1.8 |
| الفيتنامية | +45% | 121 | 3.6 |
| الإيطالية | +46% | 160 | 4.1 |
| الهندية | +57% | 155 | 3.3 |
| اليابانية | +61% | — | 1.4 |
تتعلم أدوات التقطيع من نصوص تدريبها، ومعظمها بالإنجليزية، لذا تبقى الكلمات الإنجليزية كاملة في الغالب، وتُقطَّع اللغات الأخرى إلى قطع أكثر: تحتاج العربية إلى 188 رمزًا لكل 100 كلمة، والكورية إلى 219. لكن الكلمات ليست كل شيء، لأن بعض اللغات تقول الشيء نفسه بكلمات أقل وأطول. والمهم في الفاتورة هو الرسالة كاملة، وهذا ما يعرضه العمود الأول: يحتاج النص نفسه إلى رموز أكثر بنسبة 61% في اليابانية، لكن بنسبة 11% فقط في الصينية. ولا تفصل الصينية واليابانية بين الكلمات بمسافات، لذا لا معنى لهما إلا بعدد الأحرف: نحو 1.4 حرف لكل رمز في الصينية.
نماذج مختلفة، وأدوات تقطيع مختلفة
لكل عائلة من النماذج أداة تقطيع خاصة بها، وقد قِسنا 7 منها. وهي في الإنجليزية شبه متطابقة: بين 218 و220 رمزًا للنص نفسه. أما في اللغات الأخرى فقد تختلف كثيرًا. والحالة القصوى هي الهندية: يحتاج Gemma إلى 284 رمزًا لنصّنا، وGLM إلى 1,123، أي 4× العدد. إن كنت تعمل بلغة غير الإنجليزية، فسعر الرمز ليس سوى نصف المقارنة: تكمل أداة أفضل ذكاء اصطناعي للغتك وتحليل ضريبة اللغة الباقي.
ما معنى ذلك لفاتورتك؟
بعض الأمثلة اليومية بالإنجليزية، بأداة التقطيع نفسها:
- رسالة بريد من 200 كلمة: نحو 230 رمزًا؛
- تقرير من 10 صفحات، أي 5000 كلمة: نحو 5,600 رمز؛
- رواية من 90 ألف كلمة: نحو 100,000 رمز. وبسعر دولار واحد لكل مليون رمز، تكلّف قراءتها مرة واحدة بنموذج نحو 0.10 US$.
ثلاثة أمور تجعل الفواتير الحقيقية أكبر مما توحي به هذه الأرقام. فما يكتبه النموذج يُحتسب أيضًا، وغالبًا بسعر يفوق سعر ما يقرؤه بعدة أضعاف. وتطبيقات المحادثة تعيد إرسال المحادثة كلها مع كل رسالة جديدة. ونماذج الاستدلال تكتب رموز "تفكير" مخفية تُحتسب مخرجات: راجع كم يكلّف التفكير. وتتولى حاسبة التكلفة الحساب عنك، ويحتفظ المسرد بالتعريف المختصر.
كيف قِسنا
مرّرنا 4 نصوص قصيرة من الحياة اليومية، مثل خبر ورسالة بريد، مترجمة إلى كل لغة، عبر أدوات التقطيع العامة لـ7 عائلات من النماذج، في 25 سبتمبر 2026. إنها عينة صغيرة، نحو 194 كلمة بالإنجليزية، فاعتبر الأرقام مؤشرًا جيدًا لا معدلًا دقيقًا: فالنصوص الأطول أو الأكثر تقنية أو الأقل رسمية قد تعطي أرقامًا مختلفة قليلًا. وتُعدّ الكلمات حسب المسافات التي تفصل بينها.
تُعاد حسابات أرقام هذا المقال من بياناتنا مع كل تحديث (آخر تحديث: 25 سبتمبر 2026). كيف نعمل