cd /home/daytona/workspace/attachments/2125e522-5501-47ab-82ea-4634e45277b3 && python3 -c " import pdfplumber with pdfplumber.open('Untitled design_20260623_233123_0000.pdf') as pdf: print(f'Pages: {len(pdf.pages)}') for i, page in enumerate(pdf.pages): print(f'--- Page {i+1} ---') text = page.extract_text() print(text) print('Images:', len(page.images)) "
cd /home/daytona/workspace/attachments/2125e522-5501-47ab-82ea-4634e45277b3 && python3 -c " from pypdf import PdfReader import json reader = PdfReader('Untitled design_20260623_233123_0000.pdf') print(f'Total pages: {len(reader.pages)}') print(f'Metadata: {reader.metadata}') # Check first page images page = reader.pages[0] if '/Resources' in page: resources = page['/Resources'] if '/XObject' in resources: xobjects = resources['/XObject'] for key in xobjects: obj = xobjects[key] print(f'Object key: {key}, type: {obj.get(\"/Subtype\", \"unknown\")}') if obj.get('/Subtype') == '/Image': print(f' Width: {obj.get(\"/Width\")}, Height: {obj.get(\"/Height\")}') print(f' ColorSpace: {obj.get(\"/ColorSpace\")}') print(f' Filter: {obj.get(\"/Filter\")}') "
cd /home/daytona/workspace/attachments/2125e522-5501-47ab-82ea-4634e45277b3 && python3 -c " import fitz # PyMuPDF import os doc = fitz.open('Untitled design_20260623_233123_0000.pdf') os.makedirs('/home/daytona/workspace/pdf_pages', exist_ok=True) # Render first few pages as images for inspection for i in range(min(3, len(doc))): page = doc[i] mat = fitz.Matrix(1.5, 1.5) # 1.5x zoom pix = page.get_pixmap(matrix=mat) pix.save(f'/home/daytona/workspace/pdf_pages/page_{i+1}.png') print(f'Saved page {i+1}: {pix.width}x{pix.height}') doc.close() print('Done') "
cd /home/daytona/workspace/attachments/2125e522-5501-47ab-82ea-4634e45277b3 && mkdir -p /home/daytona/workspace/pdf_pages && pdftoppm -jpeg -r 100 -f 1 -l 3 'Untitled design_20260623_233123_0000.pdf' /home/daytona/workspace/pdf_pages/page && ls /home/daytona/workspace/pdf_pages/
python3 -c " from pypdf import PdfReader import io reader = PdfReader('/home/daytona/workspace/attachments/2125e522-5501-47ab-82ea-4634e45277b3/Untitled design_20260623_233123_0000.pdf') # Extract images from first page page = reader.pages[0] resources = page['/Resources'] xobjects = resources['/XObject'] import os os.makedirs('/home/daytona/workspace/pdf_images', exist_ok=True) count = 0 for key in list(xobjects.keys())[:2]: obj = xobjects[key] if obj.get('/Subtype') == '/Image': data = obj.get_data() fname = f'/home/daytona/workspace/pdf_images/page1_img{count}.jpg' with open(fname, 'wb') as f: f.write(data) print(f'Saved: {fname}, size: {len(data)} bytes') count += 1 "
python3 -c " from pypdf import PdfReader import os reader = PdfReader('/home/daytona/workspace/attachments/2125e522-5501-47ab-82ea-4634e45277b3/Untitled design_20260623_233123_0000.pdf') os.makedirs('/home/daytona/workspace/pdf_images', exist_ok=True) # Extract one image (img0) from each page for page_num in range(len(reader.pages)): page = reader.pages[page_num] resources = page['/Resources'] xobjects = resources['/XObject'] keys = list(xobjects.keys()) if keys: obj = xobjects[keys[0]] if obj.get('/Subtype') == '/Image': data = obj.get_data() fname = f'/home/daytona/workspace/pdf_images/page{page_num+1}.jpg' with open(fname, 'wb') as f: f.write(data) print('Done extracting all pages') ls_out = os.listdir('/home/daytona/workspace/pdf_images') print(f'Total images: {len(ls_out)}') "
| Feature | Detail |
|---|---|
| File type | PDF (Canva export) |
| Pages | 34 |
| Language | Russian (with English instructions) |
| Content | Classroom quiz photos on a Samsung monitor |
| Topic | Basic Russian grammar (cases, pronouns, adverbs, vocabulary) |
| Level | Beginner/elementary Russian |
| Author | ANGOTHU SUMAN |