ویژگیهای کلیدی
درک عملکرد داخلی معماریهای مختلف شبکه عصبی و پیادهسازی آنها، از جمله طبقهبندی تصویر، تشخیص شیء، قطعهبندی، شبکههای مولد تخاصمی، مبدلها و مدلهای انتشار
ساخت راهحل برای مشکلات بینایی کامپیوتر در دنیای واقعی با استفاده از PyTorch
تمام فایلهای کد در GitHub موجود است و میتوان آنها را در Google Colab اجرا کرد.
شرح کتاب
چه مبتدی باشید و چه به دنبال پیشرفت در حرفه بینایی کامپیوتر خود باشید، این کتاب شما را در اصول شبکههای عصبی (NN) و PyTorch و نحوه پیادهسازی معماریهای پیشرفته برای وظایف دنیای واقعی راهنمایی میکند.
ویرایش دوم بینایی کامپیوتر مدرن با PyTorch به طور کامل بهروزرسانی شده است تا نمونههای عملی از جدیدترین مدلهای چندوجهی، CLIP و انتشار پایدار را توضیح داده و ارائه دهد.
شما بهترین شیوهها را برای کار با تصاویر، تنظیم پارامترهای فرامتنی و انتقال مدلها به مرحله تولید کشف خواهید کرد. با پیشرفت، موارد استفاده مختلفی را برای تشخیص نقاط کلیدی چهره، تشخیص چند شیء، قطعهبندی و تشخیص حالت انسان پیادهسازی خواهید کرد. این کتاب با بررسی معماریهای مختلف GAN، پایه محکمی در تولید تصویر ارائه میدهد. شما از معماریهای مبتنی بر ترانسفورماتور مانند ViT، TrOCR، BLIP2 و LayoutLM برای انجام وظایف مختلف در دنیای واقعی و ساخت یک مدل انتشار از ابتدا استفاده خواهید کرد. علاوه بر این، از قابلیتهای مدلهای پایه برای انجام تشخیص شیء بدون نیاز به شات و قطعهبندی تصویر استفاده خواهید کرد. در نهایت، بهترین شیوهها را برای استقرار یک مدل در مرحله تولید خواهید آموخت.
در پایان این کتاب یادگیری عمیق، شما با اطمینان از معماریهای مدرن NN برای حل مشکلات بینایی کامپیوتر در دنیای واقعی استفاده خواهید کرد.
آنچه خواهید آموخت
با معماریهای مختلف مبتنی بر ترانسفورماتور برای بینایی کامپیوتر، CLIP، Segment-Anything و Stable Diffusion آشنا شوید و کاربردهای آنها، مانند in-painting و pose transfer را آزمایش کنید.
CV را با NLP ترکیب کنید تا OCR، استخراج کلید-مقدار از تصاویر سند، پاسخ به سوالات بصری و وظایف هوش مصنوعی مولد را انجام دهید.
تشخیص و تقسیمبندی چند شیء را پیادهسازی کنید.
از مدلهای پایه برای انجام تشخیص و تقسیمبندی شیء بدون هیچ داده آموزشی استفاده کنید.
بهترین شیوهها را برای انتقال یک مدل به مرحله تولید بیاموزید.
این کتاب برای چه کسانی مناسب است؟
این کتاب برای مبتدیان PyTorch و متخصصان یادگیری ماشین سطح متوسط است که میخواهند تکنیکهای بینایی کامپیوتر را با استفاده از یادگیری عمیق و PyTorch یاد بگیرند. این کتاب برای کسانی که تازه با شبکههای عصبی شروع به کار کردهاند مفید است، زیرا خوانندگان را قادر میسازد تا از موارد استفاده در دنیای واقعی همراه با دفترچههای یادداشت در GitHub یاد بگیرند. دانش پایه از زبان برنامهنویسی پایتون و ML تنها چیزی است که برای شروع کار با این کتاب نیاز دارید. برای دانشمندان باتجربهتر بینایی کامپیوتر، این کتاب شما را با مدلهای پیشرفتهتر در بخش پایانی کتاب آشنا میکند.
فهرست مطالب
مبانی شبکه عصبی مصنوعی
مبانی PyTorch
ساخت یک شبکه عصبی عمیق با PyTorch
معرفی شبکههای عصبی کانولوشن
یادگیری انتقالی برای طبقهبندی تصویر
جنبههای عملی طبقهبندی تصویر
مبانی تشخیص شیء
تشخیص شیء پیشرفته
قطعهبندی تصویر
کاربردهای تشخیص و قطعهبندی شیء
خودرمزگذارها و دستکاری تصویر
تولید تصویر با استفاده از GANها






























