د مسار اصلي پاڼې ته د شا تګ
مصنوعي ذکاوت او اتومات

د LLM بنسټونه: روزنه او ټوکنایزېشن (LLM Foundations: Training and Tokenization)

د پوهې تخنیکي کارکوونکو لخوا جون ۲۰۲۶

د دې لوست په اوږدو کې به تاسو د دغې موضوع په اړه مفصل او عملي لارښود ترلاسه کړئ ترڅو خپل مسلکي مهارتونه لوړ کړئ.

مهم ټکي

  • لویې ژبني ماډلونه (LLMs) په ډیټاسیټونو (datasets) کې د ملیاردونو پیرامیټرونو (parameters) په تحلیلولو سره ژبني نمونې زده کوي.
  • ټوکنایزېشن (Tokenization) متني تارونه (text strings) په فرعي کلمو نښو (sub-word tokens) ویشي، چې د شمیري شاخصونو (numeric indexes) په توګه تحلیل کیږي.
  • پاملرنې پرتونه (Attention layers) د ګاونډیو نښو (neighboring tokens) احصایوي وزنونه (statistical weights) تحلیلوي ترڅو مفهوم (context) رامنځته کړي.

سریزه او ارزښت

> 📌 **د لوست خلاصه (Quick Summary):** په دغه درس کې به تاسو د د LLM بنسټونه: روزنه او ټوکنایزېشن (LLM Foundations: Training and Tokenization) بنسټیز مفاهیم، د کارولو مسلکي اوزارونه او عملي لارې زده کړئ.

مصنوعي ذهانت په هر سکتور کې د مسلکي کارونې په یوه اصلي وسیله بدل شوی دی. هغه کارمندان چې په د LLM بنسټونه: روزنه او ټوکنایزېشن (LLM Foundations: Training and Tokenization) پوهیږي، یوازې د AI اوزار نه کاروي، بلکې هغوی ته جوړښت ورکوي، تنظیموي یې او ځوابونه یې ارزوي. دا وړتیا ستاسو د مسلک د پرمختګ لپاره یو لوی توپیر رامنځته کوي.

دا لوست یو جوړښت لرونکی او څو پوړیز چلند تعقیبوي: موږ د اساساتو او جوړښت څخه پیل کوو ترڅو یو پیاوړی ذهني ماډل جوړ کړو، بیا عملي پړاوونو ته ځو چې تاسو یې سمدستي کارولی شئ، او په پای کې د مسلکي کچې تمرینونو سره پای ته رسوو چې اصلي کاري شرایط ښيي.

د ساحې مسلکي کسان په مسلکي مرکو، فریلانس پروژو او ورځني حلونو کې همدا موضوعات د اساس په توګه پیژني. د وخت پانګونه وکړئ ترڅو نه یوازې پر 'څه' بلکې پر 'ولې' هم پوه شئ — ځکه همدا د یو مسلکي او پیل کونکي ترمنځ توپیر دی.

بنسټیز مفاهیم او جوړښت

لویې ژبني ماډلونه (Large Language Models – LLMs) عصبي جوړښتونه (neural architectures) دي چې په پراخو متني ډیټاسیټونو (text datasets) باندې روزل شوي دي. د ځان څارل شوي زده کړې (self-supervised learning) له لارې، شبکه د املا، ګرامر، مفهوم (context) او سیمانټیکي (semantic) قواعد پیژني. دا ماډلونه په مستقیمه توګه توري (characters) نه لولي. پرځای یې، ټوکنایزرونه (tokenizers) تارونه (strings) په فرعي کلمو نښو (sub-word tokens) ویشي، چې ژبه په ریاضیکي نمایشونو (mathematical representations) بدلوي.

د بنسټیز جوړښت درک کول

د دې لپاره چې په ریښتیا په د LLM بنسټونه: روزنه او ټوکنایزېشن (LLM Foundations: Training and Tokenization) کې مهارت ترلاسه کړئ، دا مرسته کوي پوه شئ چې ولې دا قواعد شتون لري. دا ډیزاین نمونې د لسیزو ګډې انجینري تجربې څخه رامینځته شوي دي.

فکري موډلونه زده کړه ګړندۍ کوي: کله چې تاسو پر جوړښت پوه شئ، تاسو کولی شئ په نویو شرایطو کې د هغې د چلند اټکل وکړئ او ستونزې په اسانۍ سره حل کړئ.

مهمې اصطلاحګانې تعریف شوې

مسلکي چاپیریال ځانګړي او دقیق لغتونه لري. په درسي مسار کې خپل شخصي قاموس جوړولو ته لومړیتوب ورکړئ او د هر اصطلاح تعریف په سمه توګه زده کړئ.

دا مفهوم په مسار کې چېرته ځای لري

هیڅ مفهوم په یوازیتوب کې شتون نلري. په دې لوست کې ټول بحثونه د دې درسي مسار له نورو لوستونو سره تړلي دي. د وړاندې تګ دمخه ډاډ ترلاسه کړئ چې پر هر مهم ټکي په بشپړ ډول پوه شوي یاست.

flowchart TD A["User Prompt"] --> B["System Rules Context"] B --> C["LLM Processing Engine"] C --> D["Output Validation"] D --> E["Agent Action Result"] end

د مصنوعي ذکاوت مسلکي اوزار او سیستمونه

د مصنوعي ذکاوت د وسایلو ډګر خورا ګړندی وده کوي. د دې اوزارونو پېژندل او د APIs له لارې د هغوی نښلول، ستاسو مسلکي وړتیا لوړوي.

  • Gemini API / Google AI Studio — د ګوګل تر ټولو نوی او ځواکمن ماډل چې د غوښتنلیکونو د اتومات کولو او نویو کڅوړو د پروسس لپاره کارول کیږي.
  • Zapier / Make.com — پرته له کوډ لیکنې د مختلفو انټرنیټي خدماتو او مصنوعي ذکاوت د نښلولو اتومات وسیلې.
  • OpenAI Developer Platform — د GPT ماډلونو څخه د ګټې اخیستنې پرمختللی مرکز چې د کوډونو، انځورونو او متنونو په پروسس کې مرسته کوي.

د ځانګړې دندې لپاره د سم اوزار غوره کول پخپله یو مسلکي مهارت دی. د مسلک د پرمختګ سره به تاسو پوه شئ چې کله د چمتو شوي پلیټ فارمونو څخه کار واخلئ او کله خپل جوړ شوي حلونه وکاروئ. دا لوست تاسو سره د دې وسیلو په غوره تنظیم او کارولو کې مرسته کوي.

ګام په ګام د پلي کولو لارښود

نظري پوهه د عملي کار پرته نیمګړې ده. لاندې لارښود د اساساتو مفاهیم په عملي پړاوونو بدلوي. هر ګام په دقت سره تعقیب کړئ.

د پایتون (Python) کتابتونونو (libraries) لکه د Hugging Face `transformers` په کارولو سره د ټوکنایزر (tokenizer) جوړښتونه تحلیل کړئ. د ټوکنایزېشن (tokenization) اسانتیاوې وارد کړئ، متن په ټوکن ID (token IDs) بدل کړئ او بیا یې بیرته متن ته ډیکوډ (decode) کړئ. د دې پروسې پوهیدل د مفهوم کړکۍ (context window) محدودیتونه تشریح کوي، ځکه چې د ماډل (model) ساحې په ټولیزو ټوکن پیرامیټرونو (token parameters) پورې اړه لري.

د غلطیو اصلي ځایونه

د ساحې مسلکي کسان پوهیږي چې ځینې کارونه د نورو په پرتله د غلطیو ډیر چانس لري. مخکې له مخکې پر هغو پوهیدل ستاسو وخت خورا سپموي:

  • د کاري محیط تنظیمول — ستاسو د کمپیوټر او اصلي سرور ترمنځ توپیر د غلطیو یو لوی لامل دی.
  • د پروژې په پیل کې د کار پېچلي کول — لومړی تر ټولو ساده نسخه جوړه کړئ او بیا یې پرمخ بوځئ.
  • د اسنادو یا کمنټونو نه لیکل — د کوډ کولو سره جوخت د هغې په اړه توضیحات لیکل خورا مهم دي.

پلي کول او ارزونه

عملي کار هغه وخت بشپړیږي چې پایلې یې تایید شي. د ځان څخه پوښتنه وکړئ: څنګه پوه شم چې دا په سمه توګه کار کوي؟

غوره او مسلکي کړنې

د غوره لارو چارو پوهیدل د ستونزو او خطراتو مخنیوی کوي. د هغو تر شا پر فلسفه او منطق ځان پوه کړئ.

هغه داخلونه (inputs) کم کړئ چې ډیر توري (characters) لري، ځکه چې د تورو شمیر د ټوکن ډیروالي (token overhead) او لګښتونه زیاتوي. د پرامپټ ټیمپلیټونه (prompt templates) د لنډو لارښوونو په کارولو سره غوره کړئ ترڅو د ماډل (model) ټوکن محدودیتونو (token constraints) کې پاتې شئ.

د مسلکي او باکیفیته کاري ذهنیت جوړول

د غوره لارو چارو د یادولو تر ټولو غوره لار دا ده چې خپل ځان ته یو چک لیست جوړ کړئ او د کار په پای کې د هغې له مخې هر څه وڅارئ.

لکه څنګه چې ستاسو مهارتونه وده کوي، تاسو به وګورئ چې په یوه برخه کې غوره لارې چارې له نورو برخو سره مرسته کوي.

عملي او رښتیني کوډ بېلګې

لاندې کوډ بېلګه په عملي توګه د لوست اساسات ښيي. دا په غور سره وڅارئ او په خپل عملي کار کې ورڅخه ګټه واخلئ.

یو عام لامل دا دی چې کوډ له پوهېدو پرته کاپي شي. د کاپي کولو پر ځای، لومړی د کوډ په هره کرښه په غور سره فکر وکړئ او پر رول یې پوه شئ.

tokenization.py
# Using Hugging Face tokenization tools
from transformers import AutoTokenizer

tokenizer = AutoTokenizer.from_pretrained("gpt2")
tokens = tokenizer.encode("Poha Academy AI tutorial.")
print("Tokens:", tokens)
print("Decoded:", tokenizer.decode(tokens))

عملي تمرینونه او ارزونه

زده کړه د عمل په واسطه پیاوړې کیږي. د دې لپاره چې ډاډ ترلاسه کړئ چې تاسو د دې لوست مفاهیم په سمه توګه درک کړي، لاندې درې عملي تمرینونه ترسره کړئ:

  • د آنلاین ټوکن شمیرونکو (online token counters) په کارولو سره یو متني بلاک (text block) ټوکنایز (tokenize) کړئ ترڅو تحلیل کړئ چې د وقفي نښې (punctuation symbols) څنګه په ټوکنونو (tokens) ویشل کیږي.
  • د ژباړې پای ټکي (translation endpoint) په کارولو سره په مختلفو ژبو کې د تورو شمیرې او د ټوکن شمیرې پرتله کړئ.
  • په پایتون (Python) کې د منظمو څرګندونو (regular expressions) په کارولو سره د ټوکن اوږدوالي اټکل کونکي (token length estimator) ساده فنکشن (function) جوړ کړئ.

ځانګړې ارزونه

خپله پوهه په سمدستي ډول د دې پوښتنې په ځوابولو سره وڅارئ:

لویې ژبني ماډلونه (Large Language Models) خام متني تارونه (raw text strings) څنګه پروسس کوي؟


سرچینې او اضافي لوستل

  • د W3C رسمي ټیکنالوژیکي معیارونه او مشخصات (۲۰۲۶).
  • د ګوګل پرمختیايي اسناد: د فعالیت، سئو (SEO)، او امنیت غوره کړنې.
  • د موزیلا پرمختیايي شبکه (MDN Web Docs) — د ویب معیارونو اصلي سرچینه.
  • د پوهې اکاډمۍ درسي بورډ او د ساحې د مسلکي کسانو د بیاکتنې پینل.