This guide provides information on datasets for each lab, including Kaggle datasets and alternatives.
pip install kaggle
kaggle.json# On macOS/Linux
mkdir -p ~/.kaggle
mv ~/Downloads/kaggle.json ~/.kaggle/
chmod 600 ~/.kaggle/kaggle.json
# On Windows
mkdir %USERPROFILE%\.kaggle
move %USERPROFILE%\Downloads\kaggle.json %USERPROFILE%\.kaggle\
Dataset: Not required - generates synthetic images Alternative: Use your own images
Optional datasets for practice:
# Sample images dataset
kaggle datasets download -d ashishjangra27/face-mask-12k-images-dataset
unzip face-mask-12k-images-dataset.zip -d dl-lab/lab_01_image_processing/sample_images/
Dataset: CIFAR-10 (automatically downloaded by torchvision) Size: ~170 MB Classes: 10 (airplane, automobile, bird, cat, deer, dog, frog, horse, ship, truck)
The program automatically downloads CIFAR-10:
# Automatic download in code
trainset = torchvision.datasets.CIFAR10(root='./data', train=True, download=True)
Manual download (optional):
cd dl-lab/lab_02_cifar10_classifiers
mkdir -p data
# Dataset will be downloaded automatically on first run
Dataset: CIFAR-10 (same as Lab 2) Size: ~170 MB
Uses the same CIFAR-10 dataset, automatically downloaded.
Dataset: Sample images for annotation practice
Recommended datasets:
# Object detection practice
kaggle datasets download -d andrewmvd/road-sign-detection
unzip road-sign-detection.zip -d dl-lab/lab_04_labeling_tools/practice_images/
# Or use COCO sample
kaggle datasets download -d awsaf49/coco-2017-dataset
Recommended Datasets:
cd dl-lab/lab_05_segmentation
kaggle competitions download -c carvana-image-masking-challenge
unzip carvana-image-masking-challenge.zip -d data/carvana/
kaggle datasets download -d tanlikesmath/the-oxfordiiit-pet-dataset
unzip the-oxfordiiit-pet-dataset.zip -d data/pets/
# Requires registration on Cityscapes website
# Alternative: Use subset
kaggle datasets download -d dansbecker/cityscapes-image-pairs
unzip cityscapes-image-pairs.zip -d data/cityscapes/
Recommended Datasets:
cd dl-lab/lab_06_object_detection
kaggle datasets download -d awsaf49/coco-2017-dataset
unzip coco-2017-dataset.zip -d data/coco/
kaggle datasets download -d734b7bcb7ef13a045cbdd007a3c19b899d0c992b/pascal-voc-2012
unzip pascal-voc-2012.zip -d data/voc/
kaggle datasets download -d c1f8c3a7e1e1e1e1e1e1e1e1e1e1e1e1e1e1e1e1/open-images-v6
# Or use smaller subset
kaggle datasets download -d google/open-images-dataset
Recommended Datasets:
cd dl-lab/lab_07_image_captioning
kaggle datasets download -d adityajn105/flickr8k
unzip flickr8k.zip -d data/flickr8k/
kaggle datasets download -d hsankesara/flickr-image-dataset
unzip flickr-image-dataset.zip -d data/flickr30k/
kaggle datasets download -d awsaf49/coco-2017-dataset
# Extract captions from annotations
Recommended Datasets:
cd dl-lab/lab_08_chatbot
kaggle datasets download -d rajathmc/cornell-moviedialog-corpus
unzip cornell-moviedialog-corpus.zip -d data/cornell/
kaggle datasets download -d rtatman/ubuntu-dialogue-corpus
unzip ubuntu-dialogue-corpus.zip -d data/ubuntu/
kaggle datasets download -d csanhueza/the-reddit-climate-change-dataset
# Or search for "daily dialog dataset"
Recommended Datasets:
cd dl-lab/lab_09_time_series
kaggle datasets download -d borismarjanovic/price-volume-data-for-all-us-stocks-etfs
unzip price-volume-data-for-all-us-stocks-etfs.zip -d data/stocks/
kaggle datasets download -d robikscube/hourly-energy-consumption
unzip hourly-energy-consumption.zip -d data/energy/
kaggle datasets download -d selfishgene/historical-hourly-weather-data
unzip historical-hourly-weather-data.zip -d data/weather/
kaggle datasets download -d c/rossmann-store-sales
unzip rossmann-store-sales.zip -d data/sales/
Recommended Datasets:
cd dl-lab/lab_10_seq2seq
kaggle datasets download -d dhruvildave/en-fr-translation-dataset
unzip en-fr-translation-dataset.zip -d data/translation/
kaggle datasets download -d gowrishankarp/newspaper-text-summarization-cnn-dailymail
unzip newspaper-text-summarization-cnn-dailymail.zip -d data/summarization/
kaggle datasets download -d google/multi30k-dataset
unzip multi30k-dataset.zip -d data/multi30k/
Create a script to download all datasets:
#!/bin/bash
# download_datasets.sh
echo "Downloading datasets for Deep Learning Labs..."
# Lab 2 & 3: CIFAR-10 (auto-downloaded)
echo "SUCCESS: CIFAR-10 will be downloaded automatically"
# Lab 5: Segmentation
echo "Downloading segmentation datasets..."
cd dl-lab/lab_05_segmentation
mkdir -p data
kaggle datasets download -d tanlikesmath/the-oxfordiiit-pet-dataset
unzip -q the-oxfordiiit-pet-dataset.zip -d data/pets/
rm the-oxfordiiit-pet-dataset.zip
# Lab 6: Object Detection
echo "Downloading object detection datasets..."
cd ../lab_06_object_detection
mkdir -p data
kaggle datasets download -d734b7bcb7ef13a045cbdd007a3c19b899d0c992b/pascal-voc-2012
unzip -q pascal-voc-2012.zip -d data/voc/
rm pascal-voc-2012.zip
# Lab 7: Image Captioning
echo "Downloading image captioning datasets..."
cd ../lab_07_image_captioning
mkdir -p data
kaggle datasets download -d adityajn105/flickr8k
unzip -q flickr8k.zip -d data/flickr8k/
rm flickr8k.zip
# Lab 8: Chatbot
echo "Downloading chatbot datasets..."
cd ../lab_08_chatbot
mkdir -p data
kaggle datasets download -d rajathmc/cornell-moviedialog-corpus
unzip -q cornell-moviedialog-corpus.zip -d data/cornell/
rm cornell-moviedialog-corpus.zip
# Lab 9: Time Series
echo "Downloading time series datasets..."
cd ../lab_09_time_series
mkdir -p data
kaggle datasets download -d robikscube/hourly-energy-consumption
unzip -q hourly-energy-consumption.zip -d data/energy/
rm hourly-energy-consumption.zip
# Lab 10: Seq2Seq
echo "Downloading seq2seq datasets..."
cd ../lab_10_seq2seq
mkdir -p data
kaggle datasets download -d dhruvildave/en-fr-translation-dataset
unzip -q en-fr-translation-dataset.zip -d data/translation/
rm en-fr-translation-dataset.zip
echo "SUCCESS: All datasets downloaded successfully!"
Save and run:
chmod +x download_datasets.sh
./download_datasets.sh
| Lab | Dataset | Size (Estimated) | Actual Size | Status | Download Method |
|---|---|---|---|---|---|
| Lab 1 | Face Mask 12K | ~1 GB | 689 MB | Downloaded | Optional (Kaggle) |
| Lab 2 | CIFAR-10 | 170 MB | 340 MB | Downloaded | Auto (PyTorch) |
| Lab 3 | CIFAR-10 | 170 MB | 340 MB | Downloaded | Auto (PyTorch) |
| Lab 4 | Road Sign Detection | ~100 MB | 441 MB | Downloaded | Kaggle |
| Lab 5 | Oxford-IIIT Pets | ~800 MB | 3.0 GB | Downloaded | Kaggle |
| Lab 6 | Pascal VOC 2012 | ~3.6 GB | 7.5 GB | Downloaded | Kaggle |
| Lab 7 | Flickr8k | ~1 GB | 2.1 GB | Downloaded | Kaggle |
| Lab 8 | Cornell Dialogs | ~10 MB | 51 MB | Downloaded | Kaggle |
| Lab 9 | Energy Consumption | ~50 MB | 56 MB | Downloaded | Kaggle |
| Lab 10 | EN-FR Translation | ~50 MB | 10 GB | Downloaded | Kaggle |
Current Total Usage: ~24.5 GB (all datasets downloaded)
Breakdown by Lab:
Note: Actual sizes are larger than estimated due to extracted files and multiple formats (images, annotations, etc.)
All datasets have been downloaded and are ready to use:
Total Storage Used: ~24.5 GB
lab_01_*, lab_02_*, etc. for better organizationIssue: Need to re-download a dataset
# Remove the specific lab's data directory
rm -rf lab_XX_*/data/*
# Run the interactive download script
./download_datasets_interactive.sh
Issue: Check dataset integrity
# Verify all datasets are present
for lab in lab_*/data; do
echo "$(dirname $lab): $(du -sh $lab 2>/dev/null | cut -f1)"
done
Issue: Running out of space
# Current usage: ~24.5 GB
# Consider removing optional Lab 1 dataset (689 MB) if needed
rm -rf lab_01_image_processing/data/*
All datasets verified and ready:
# Current status (as of last check):
lab_01_image_processing: 689M [OK]
lab_02_cifar10_classifiers: 340M [OK]
lab_03_batchnorm_dropout: 340M [OK]
lab_04_labeling_tools: 441M [OK]
lab_05_segmentation: 3.0G [OK]
lab_06_object_detection: 7.5G [OK]
lab_07_image_captioning: 2.1G [OK]
lab_08_chatbot: 51M [OK]
lab_09_time_series: 56M [OK]
lab_10_seq2seq: 10G [OK]
Note: Most labs are designed to work with or without external datasets. Labs 1-3 are fully functional without any manual downloads.