Programming Fundamentals
কেন জরুরি: কম্পিউটার কীভাবে সমস্যা সমাধান করে তা বোঝাই বাকি সবকিছুর প্রথম ধাপ।
যা শিখবে
- Variables ও Data Types
- Conditions ও Loops
- Functions
- Debugging mindset
Getting Started
নিচের প্রতিটা ধাপ আগের ধাপের উপর নির্ভরশীল। মাইলস্টোন পার না করে পরের ধাপে যেও না।
Stage 01–04
প্রোগ্রামিং লজিক থেকে শুরু করে ডেটা নিয়ে কাজ করা পর্যন্ত — এটাই বাকি সব কিছুর ভিত্তি।
কেন জরুরি: কম্পিউটার কীভাবে সমস্যা সমাধান করে তা বোঝাই বাকি সবকিছুর প্রথম ধাপ।
কেন জরুরি: প্রায় সব ML/DL টুল Python-ভিত্তিক।
কেন জরুরি: এই ম্যাথ না বুঝলে ML/DL মডেল "ব্ল্যাক বক্স" মনে হবে সারাজীবন।
Vector, Matrix, Matrix Multiplication, Dot Product, Eigenvalue
Function, Derivative, Partial Derivative, Gradient, Optimization
Probability, Conditional Probability, Distributions, Bayes' Theorem
Mean, Median, Variance, Standard Deviation
কেন জরুরি: মডেল বানানোর আগে ডেটার সাথে কাজ করা শিখতেই হবে।
Stage 05–06
এখান থেকে "মডেল ট্রেইন করা" আসলে শুরু হয়। Regression থেকে Ensemble পর্যন্ত, এবং নিজের প্রথম প্রজেক্ট।
কেন জরুরি: Regression, Classification, Overfitting — ML-এর প্রতিটা ভবিষ্যৎ টপিকের ভিত্তি এখানেই।
Coursera-তে audit মোডে ফ্রি (সার্টিফিকেট চাইলে পেইড)। বিশ্বব্যাপী সবচেয়ে বিশ্বাসযোগ্য ML বিগিনার কোর্স, ৩টা কোর্স নিয়ে গঠিত — সিরিয়ালি শেষ করতে হবে।
| Order | Course | Focus | Approx. Duration | Status |
|---|---|---|---|---|
| 1 | Supervised Machine Learning: Regression and Classification | Linear/Logistic Regression, Gradient Descent | ~33 hours (3 সপ্তাহ) | Free audit |
| 2 | Advanced Learning Algorithms | Neural Networks, Decision Trees, ML best-practices | ~34 hours (4 সপ্তাহ) | Free audit |
| 3 | Unsupervised Learning, Recommenders, Reinforcement Learning | Clustering, Recommender Systems, RL Intro | ~3 সপ্তাহ | Free audit |
কেন জরুরি: কোর্সে শেখা আর নিজে হাতে-কলমে করা এক জিনিস না।
Stage 07–08
Backpropagation বোঝা থেকে শুরু করে PyTorch দিয়ে নিজের প্রথম নিউরাল নেটওয়ার্ক ট্রেইন করা পর্যন্ত।
কেন জরুরি: CNN, RNN, Transformer — সব কিছুর ভিত্তি backpropagation ও optimization বোঝা।
Coursera-তে audit মোডে ফ্রি। ৫টা কোর্স নিয়ে গঠিত, ইন্ডাস্ট্রি-স্ট্যান্ডার্ড — এই সিকোয়েন্সেই সম্পূর্ণ করতে হবে।
| Order | Course | Approx. Duration |
|---|---|---|
| 1 | Neural Networks and Deep Learning | ~25 hours |
| 2 | Improving Deep Neural Networks: Hyperparameter Tuning, Regularization and Optimization | ~24 hours |
| 3 | Structuring Machine Learning Projects | ~7 hours |
| 4 | Convolutional Neural Networks | ~36 hours |
| 5 | Sequence Models | ~37 hours |
কেন জরুরি: রিসার্চ কমিউনিটিতে PyTorch-ই সবচেয়ে বেশি ব্যবহৃত framework।
Stage 09
প্রথমে যেকোনো একটা track বেছে নাও — চারটা একসাথে শুরু করার দরকার নেই।
CNN → Transfer Learning → VGG/ResNet/DenseNet/EfficientNet → Attention → Grad-CAM → Object Detection (YOLO) → Segmentation (U-Net) → Vision Transformer → Vision-Language Models
YouTube: Andrej Karpathy, 3Blue1Brown
Text Processing → Tokenization → TF-IDF → Embeddings → RNN → LSTM/GRU → Attention → Transformer → BERT → LLM Fundamentals → RAG
Paper: "Attention Is All You Need"
Signal Fundamentals → Preprocessing → Classical Forecasting → ML → RNN/LSTM/GRU → 1D CNN → Attention → Transformer
Graph Fundamentals → Graph Representation → Message Passing → GCN → GraphSAGE → GAT → GNN Applications
Stage 10
এখান থেকেই "শেখা" থেকে "রিসার্চ করা"-তে transition শুরু হয়।
| দুর্বল চিন্তা | শক্তিশালী (রিসার্চ) চিন্তা |
|---|---|
| একটা প্রজেক্ট বানানো | একটা validated, generalizable insight খুঁজে বের করা |
| Higher Accuracy | Novelty (নতুন mechanism বা ব্যাখ্যা) |
| নতুন Model Combination | প্রকৃত Research Gap (একটা unanswered question) |
| শুধু Benchmark-এ নম্বর বাড়ানো | বাস্তব জগতের সমস্যা সমাধান (Contribution) |
| Correlation | Causation |
| Internal Validation (একই ডেটাসেট) | External Validation (ভিন্ন ডেটাসেট/সেটিং) |
| Statistical Significance (p<0.05) | Practical Significance (বাস্তবে গুরুত্বপূর্ণ পার্থক্য) |
| In-distribution Performance | Out-of-distribution (OOD) Performance |
Stage 1–9 (Foundation → ML → DL → Specialization) শেষ হলে তুমি রেডি paper পড়া শুরু করার জন্য। এর আগে paper শুধু জারগন মনে হবে।
Practical
প্রতিটা প্রজেক্ট/রিসার্চের জন্য দরকারি ডেটা ও কম্পিউট সোর্স — একটাই কেন্দ্রীয় তালিকায়।
| Platform | Best For | Free? | Typical Data | Link |
|---|---|---|---|---|
| Kaggle Datasets | General-purpose, সব ফিল্ড | ✅ Free | Tabular, image, text | kaggle.com/datasets |
| UCI Machine Learning Repository | ক্লাসিক বেঞ্চমার্ক ডেটাসেট | ✅ Free | Tabular | archive.ics.uci.edu |
| Hugging Face Datasets | NLP / মাল্টিমোডাল | ✅ Free | Text, audio, multimodal | huggingface.co/datasets |
| Google Dataset Search | যেকোনো টপিক খোঁজার সার্চ ইঞ্জিন | ✅ Free | সব ধরনের | datasetsearch.research.google.com |
| Papers with Code — Datasets | কোন paper কোন ডেটাসেট ব্যবহার করেছে | ✅ Free | Benchmark-linked | paperswithcode.com/datasets |
| Mendeley Data | একাডেমিক গবেষণা ডেটাসেট | ✅ Free | Cross-discipline | data.mendeley.com |
| Figshare | জার্নাল-লিংকড রিসার্চ ডেটা | ✅ Free | Cross-discipline | figshare.com |
| IEEE DataPort | ইঞ্জিনিয়ারিং/CS ডেটাসেট | কিছু ফ্রি, কিছু সাবস্ক্রিপশন | Engineering, CS | ieee-dataport.org |
| Nature Scientific Data | পিয়ার-রিভিউড ডেটা পেপার | Open Access | Peer-reviewed datasets | nature.com/sdata |
| Platform | Best Use | GPU | Setup দরকার? | Best For | Link |
|---|---|---|---|---|---|
| Google Colab | দ্রুত পরীক্ষা, নোটবুক শেয়ার | ✅ ফ্রি (quota-সীমিত) | না | বিগিনার, প্রথম মডেল ট্রেইনিং | colab.research.google.com |
| Kaggle Notebooks | Competition + built-in dataset | ✅ ফ্রি GPU/TPU quota | না | Kaggle প্রজেক্ট, ডেটাসেট-ভারী কাজ | kaggle.com/code |
| VS Code (লোকাল) | সিরিয়াস, দীর্ঘমেয়াদী প্রজেক্ট | নিজের হার্ডওয়্যার-নির্ভর | হ্যাঁ | কোড organization, রিসার্চ কোডবেস | code.visualstudio.com |
| GitHub | ভার্সন কন্ট্রোল, শেয়ারিং | — | হ্যাঁ (git) | যেকোনো প্রজেক্ট, প্রথম দিন থেকেই | github.com |
বিগিনার হিসেবে প্রথমে কী ব্যবহার করবে: Google Colab দিয়ে শুরু করো — কোনো সেটআপ ছাড়াই ফ্রি GPU পাবে। প্রজেক্ট বড় হলে GitHub-এ কোড রাখো, আর Kaggle-এর নিজস্ব ডেটাসেট নিয়ে কাজ করলে Kaggle Notebooks ব্যবহার করো।
Stage 10–13
| সোর্স | বিশেষত্ব | Link |
|---|---|---|
| arXiv | ফ্রি, সবচেয়ে বড় preprint সংগ্রহ | arxiv.org |
| Google Scholar | সবচেয়ে ব্যাপক একাডেমিক সার্চ | scholar.google.com |
| Semantic Scholar | AI-powered সামারি ও citation graph | semanticscholar.org |
| IEEE Xplore | Engineering/CS conference ও journal | ieeexplore.ieee.org |
| ACM Digital Library | Computer Science conference ও journal | dl.acm.org |
| ScienceDirect | Elsevier জার্নাল | sciencedirect.com |
| SpringerLink | Springer জার্নাল ও কনফারেন্স | link.springer.com |
| Papers with Code | Paper + অফিসিয়াল কোড একসাথে | paperswithcode.com |
Title, Abstract, Figures, Conclusion — শুধু বোঝার চেষ্টা করো এটা কী নিয়ে।
Introduction, Related Work, Method overview, Experiments — deep math এড়িয়ে।
Equations, Architecture, Implementation, Experiments, Reproduction — যদি paper-টা তোমার কাজের জন্য দরকারি হয়।
প্রতিটা paper-এর জন্য একটা স্প্রেডশিটে এই কলামগুলো রাখো, এবং ৫টা → ১০টা → ২০-৩০টা পেপার পর্যন্ত বাড়াও। এতেই বুঝবে ফিল্ড এখন কী বিশ্বাস করে আর কোথায় সত্যিকারের গ্যাপ আছে।
| Paper | Year | Problem | Dataset | Method | Baseline | Result | Strength | Limitation | Research Opportunity |
|---|---|---|---|---|---|---|---|---|---|
| উদাহরণ সারি — তোমার প্রতিটা পড়া পেপারের জন্য এই ফরম্যাটে একটা row যোগ করো। | |||||||||
Stage 14–17
প্রতিটা ধাপে নিজেকে জিজ্ঞেস করো: "আমি কি এই সিদ্ধান্তটা একজন কড়া সমালোচকের সামনে defend করতে পারব?"
| Section | মূল প্রশ্ন | কী লিখবে | সাধারণ ভুল |
|---|---|---|---|
| Title | এক লাইনে কী নিয়ে? | স্পষ্ট, নির্দিষ্ট, বিভ্রান্তিহীন শিরোনাম | খুব সাধারণ/অস্পষ্ট টাইটেল |
| Abstract | পুরো পেপার ৪-৬ লাইনে কী? | Background → Problem → Method → Dataset → Main Result → Significance | খুব আগে লেখা — পুরো manuscript শেষ করার পর লেখাই সহজ |
| Keywords | কোন টার্মে অন্যরা খুঁজে পাবে? | ৪-৬টা নির্দিষ্ট টেকনিক্যাল টার্ম | খুব সাধারণ শব্দ ব্যবহার |
| Introduction | কেন এটা গুরুত্বপূর্ণ? | Context → Importance → Existing Research → Limitation → Gap → Proposed Solution → Contributions | Literature review-এর সাথে গুলিয়ে ফেলা |
| Related Work | অন্যরা কী করেছে? | Theme অনুযায়ী synthesize — শুধু paper-by-paper তালিকা না | "Paper A did X. Paper B did Y." — এভাবে লেখা |
| Methodology | তুমি কী করেছো? | Dataset → Preprocessing → Architecture → Formulation → Training → Hyperparameters — reproducible ভাবে | এত অস্পষ্ট যে অন্য কেউ reproduce করতে পারবে না |
| Results | কী হয়েছে? | Table/figure, শুধু best-run না, statistical test সহ | শুধু সবচেয়ে ভালো রান রিপোর্ট করা |
| Discussion | কেন হয়েছে, গুরুত্ব কী? | Result ব্যাখ্যা, কোথায় fail করে, কেন গুরুত্বপূর্ণ | Results আর Discussion গুলিয়ে ফেলা |
| Ablation Study | কোন অংশ আসলে কাজ করছে? | একে একে component খুলে দেখানো | এমন ablation যা claim isolate করে না |
| Limitations | কোথায় সীমাবদ্ধতা? | সততার সাথে স্বীকার করা | Limitation section বাদ দেওয়া |
| Conclusion | মূল টেকঅ্যাওয়ে কী? | Problem → Solution → Findings → Significance → Limitations → Future Direction | Abstract-ই কপি-পেস্ট করা |
| References | সোর্স যাচাইযোগ্য কি? | Zotero দিয়ে সঠিক ফরম্যাটে | AI-generated ভুয়া রেফারেন্স |
Results: কী হয়েছে? (সংখ্যা, টেবিল, ফিগার — Confusion Matrix, ROC/PR)
Discussion: কেন হয়েছে? গুরুত্ব কী? মডেল কোথায় ফেল করে?
Overleaf (LaTeX) — overleaf.com — বিশ্বব্যাপী স্ট্যান্ডার্ড ফরম্যাট, ফ্রি টিয়ার আছে।
Stage 18–20
মনে রাখো: AI সহায়তা করতে পারে, কিন্তু গবেষক নিজেই বুঝে, যাচাই করে এবং দায়ী থাকতে হবে।
Journal: সাধারণত দীর্ঘ review process, deeper/extended কাজের জন্য উপযুক্ত। Conference: দ্রুত review cycle, CS/AI ফিল্ডে অনেক সময় জার্নালের সমান বা বেশি গুরুত্বপূর্ণ (যেমন top-tier ML conferences)।
Scopus, Web of Science, Q1/Q2/Q3/Q4 quartile, Impact Factor, CiteScore, APC (Article Processing Charge), Open Access বনাম Subscription Journal।
Centralized
উপরে ব্যবহৃত সব রিসোর্স ক্যাটাগরি অনুযায়ী একসাথে — ফিল্টার করে খুঁজে নাও।
Approximate
সপ্তাহে ~১০-১৫ ঘণ্টা সময় দিলে। এটা আনুমানিক — নিজের গতি অনুযায়ী সমন্বয় করো।
| মাস | ফোকাস |
|---|---|
| ১–২ | Programming + Python + Math শুরু |
| ২–৩ | Math শেষ + Data Analysis (NumPy/Pandas/Matplotlib) |
| ৩–৪ | Machine Learning Specialization + First Project |
| ৪–৫ | Deep Learning Specialization + PyTorch |
| ৫–৭ | একটা Specialization Track |
| ৭–৮ | Research Methodology + Paper Reading + Literature Review |
| ৮–৯ | Paper Reproduction |
| ৯–১১ | নিজের Full Research Pipeline (Gap → Experiment → Validation) |
| ১১–১২ | Paper Writing + Venue বাছাই + Submission |
Interactive
প্রতিটা বক্স তোমার ব্রাউজারে সেভ থাকবে (localStorage), তাই পরে ফিরে এসেও progress দেখতে পাবে।
Common Questions
হ্যাঁ। এই রোডম্যাপ একদম Programming Fundamentals (Stage 01) থেকে শুরু হয়েছে বিশেষভাবে zero-background শিক্ষার্থীদের জন্য। প্রতিটা স্টেজ আগেরটার উপর নির্ভর করে গড়ে উঠেছে।
ML আগে। Deep Learning-এর বেশিরভাগ কনসেপ্ট (loss function, gradient descent, overfitting, evaluation) ML fundamentals-এর উপর ভিত্তি করে তৈরি। ML স্কিপ করে সরাসরি DL শুরু করলে অনেক কিছু "ম্যাজিক" মনে হবে।
রিসার্চ কমিউনিটিতে বর্তমানে PyTorch বেশি ব্যবহৃত, এবং বেশিরভাগ নতুন paper-এর official code PyTorch-এ থাকে। তাই এই রোডম্যাপ PyTorch-কেই priority দিয়েছে।
Foundation (Stage 01-04), ML (Stage 05-06), DL (Stage 07-08) এবং একটা Specialization Track শেষ করার পর। এর আগে paper-এর ভাষা ও কনসেপ্ট বোঝার মতো ভিত্তি তৈরি হয় না।
এটা ফিল্ড-নির্ভর। Computer Science/AI-তে top-tier conference (যেমন NeurIPS, CVPR, ACL) প্রায়ই journal-এর সমান বা বেশি গুরুত্বপূর্ণ, কারণ review cycle দ্রুত এবং ফিল্ড দ্রুত এগোয়। journal সাধারণত গভীরতর, বিস্তৃত কাজের জন্য উপযুক্ত।
সবসময় না। "কেউ ট্রাই করেনি" আর "এটা গুরুত্বপূর্ণ unanswered question" এক জিনিস না। Research Fundamentals সেকশনে Project বনাম Research টেবিলটা দেখো — একটা আসল gap সবসময় একটা প্রশ্নের সাথে যুক্ত থাকে, শুধু একটা মডেল কম্বিনেশনের সাথে না।
না, বাধ্যতামূলক না। প্রথম কয়েকটা রিসার্চের জন্য existing public dataset ব্যবহার করাই ভালো — Datasets সেকশনে দেওয়া চেকলিস্ট অনুযায়ী যাচাই করে নিও (license, bias, leakage)।
সপ্তাহে ~১০-১৫ ঘণ্টা সময় দিলে আনুমানিক ৮-১২ মাস (Timeline সেকশন দেখো)। প্রোগ্রামিং/ম্যাথ ব্যাকগ্রাউন্ড আগে থেকে থাকলে এটা আরও কম সময়ে সম্ভব।