AI ইমেজ ডিটেক্টর কীভাবে কাজ করে: দ্বি-স্তর বিশিষ্ট কাঠামো

ImageSizeFinder-এর ফ্রি AI ইমেজ ডিটেক্টরের প্রযুক্তিগত কৌশল জানুন: ব্রাউজারে C2PA বিশ্লেষণ, পিক্সেল নয়েজ ভ্যারিয়েন্স এবং বাস্তব সীমাবদ্ধতা।

5 min read

কৃত্রিম বুদ্ধিমত্তার দ্রুত অগ্রগতির ফলে ডিজিটাল ভিজ্যুয়াল মিডিয়ার ক্ষেত্রে এক বৈপ্লবিক পরিবর্তন এসেছে। Midjourney v6, OpenAI DALL-E 3, Stable Diffusion XL, Flux.1 এবং Google Imagen-এর মতো শক্তিশালী মডেলগুলো কয়েক সেকেন্ডের মধ্যে নিখুঁত বাস্তবসম্মত ছবি তৈরি করতে সক্ষম।

এই প্রযুক্তি যেমন সৃজনশীলতার অপার দিগন্ত উন্মোচন করেছে, তেমনই ভুয়া খবর ছড়ানো, ডিপফেক অপব্যবহার, স্টক ছবির অপবিত্রতা এবং কপিরাইট সংক্রান্ত নানান জটিল সমস্যার সৃষ্টি করেছে।

এই চ্যালেঞ্জগুলোর একটি স্বচ্ছ ও উন্মুক্ত সমাধান দেওয়ার লক্ষ্যে ImageSizeFinder তৈরি করেছে ফ্রি AI ইমেজ ডিটেক্টর। অস্পষ্ট শতাংশ স্কোরের জন্য অর্থ দাবি করা বাণিজ্যিক প্ল্যাটফর্মগুলোর মতো নয়, আমাদের টুলটি তৈরি হয়েছে গোপনীয়তা-অগ্রাধিকার ভিত্তিক দ্বি-স্তর বিশিষ্ট সনাক্তকরণ কাঠামোর ওপর। এটি আপনার ব্রাউজারের ভেতরেই সরাসরি গাণিতিক পরীক্ষা চালায় এবং যাচাইযোগ্য সুস্পষ্ট প্রমাণ সরবরাহ করে।

এই নির্দেশিকায় আমরা এর মূল বৈশিষ্ট্য, কাঠামোগত কর্মপদ্ধতি, গাণিতিক ভিত্তি এবং ব্যবহারিক সীমাবদ্ধতাগুলো বিস্তারিত তুলে ধরছি।

চিত্র ১: একাধিক উৎস থেকে আপলোড, ব্যাচ প্রসেসিং এবং শতভাগ গোপনীয়তা রক্ষার সুবিধা সহ ImageSizeFinder ফ্রি AI ইমেজ ডিটেক্টর ইন্টারফেস।চিত্র ১: একাধিক উৎস থেকে আপলোড, ব্যাচ প্রসেসিং এবং শতভাগ গোপনীয়তা রক্ষার সুবিধা সহ ImageSizeFinder ফ্রি AI ইমেজ ডিটেক্টর ইন্টারফেস।


১. AI ইমেজ ডিটেক্টরের প্রধান বৈশিষ্ট্যসমূহ

টুলটি গতি, তথ্যের নিরাপত্তা এবং বিশ্লেষণাত্মক নিখুঁততার সমন্বয়ে তৈরি করা হয়েছে:

  • সম্পূর্ণ বিনামূল্যে ও সীমাহীন ব্যবহার: কোনো অ্যাকাউন্ট তৈরি, সাবস্ক্রিপশন ফি বা ব্রাউজার স্ক্যানের ওপর কৃত্রিম দৈনিক সীমা নেই।
  • ডিভাইসের ভেতরেই পূর্ণ গোপনীয়তা (Zero-Upload): মেটাডেটা বিশ্লেষণ এবং পিক্সেল নয়েজ পরিমাপ WebAssembly এবং HTML5 Canvas API-এর মাধ্যমে সম্পূর্ণভাবে আপনার ব্রাউজারে সম্পাদিত হয়। আপনি নিজে ক্লাউড বিশ্লেষণ নির্বাচন না করলে ছবি কোনো সার্ভারে পাঠানো হয় না।
  • ছবি ইনপুট করার একাধিক সুবিধা:
    • একটি বা একাধিক ছবি ড্র্যাগ অ্যান্ড ড্রপ করুন।
    • ফাইল এক্সপ্লোরার থেকে সরাসরি ছবি বাছাই করুন।
    • ক্লিপবোর্ড থেকে পেস্ট: ব্রাউজারের যেকোনো স্থানে Ctrl+V (macOS-এ Cmd+V) চেপে কপি করা স্ক্রিনশট তাত্ক্ষণিকভাবে স্ক্যান করুন।
    • সরাসরি ওয়েব URL: ডাউনলোড না করেই ওয়েবে থাকা যেকোনো ছবির https:// লিংক পেস্ট করে বিশ্লেষণ করুন।
  • একীভূত ব্যাচ ওয়ার্কস্পেস: একসাথে বহু ছবি যুক্ত করুন, তালিকায় তাদের স্থিতি পর্যবেক্ষণ করুন এবং এক ক্লিকে সবগুলোর বিশ্লেষণ সম্পন্ন করুন।
  • স্বচ্ছ প্রমাণভিত্তিক ড্যাশবোর্ড: স্ক্যান করা যেকোনো ছবি বিস্তারিত দেখে নিন এবং জানুন কেন এই স্কোরটি দেওয়া হয়েছে—সফটওয়্যারের নাম, IPTC ট্যাগ, প্রম্পটের বিবরণ এবং অবশিষ্ট নয়েজের মান।

২. সনাক্তকরণ প্রক্রিয়া: দ্বি-স্তর বিশিষ্ট পাইপলাইন

AI দ্বারা তৈরি ছবি নির্ভরযোগ্যভাবে সনাক্ত করা বেশ জটিল, কারণ কোনো একক সূচকই চূড়ান্ত নয়। মেটাডেটা মুছে ফেলা সম্ভব এবং কম্প্রেশনের ফলে পিক্সেল কাঠামো পরিবর্তিত হয়।

তাই আমাদের প্ল্যাটফর্ম একটি পর্যায়ক্রমিক দ্বি-স্তর বিশিষ্ট পাইপলাইন অনুসরণ করে:

চিত্র ২: ত্রি-স্তর বিশিষ্ট প্রগতিশীল আর্কিটেকচার: WebAssembly দ্বারা মেটাডেটা যাচাই, Canvas-এ উচ্চ-ফ্রিকোয়েন্সি পিক্সেল নয়েজ কনভোলিউশন এবং ক্লাউড ভিশন মডেলের সহায়তা।চিত্র ২: ত্রি-স্তর বিশিষ্ট প্রগতিশীল আর্কিটেকচার: WebAssembly দ্বারা মেটাডেটা যাচাই, Canvas-এ উচ্চ-ফ্রিকোয়েন্সি পিক্সেল নয়েজ কনভোলিউশন এবং ক্লাউড ভিশন মডেলের সহায়তা।


৩. প্রযুক্তিগত বিবরণ: প্রতিটি স্তর কীভাবে কাজ করে

১ম স্তর: নির্দিষ্ট মেটাডেটা ও উৎসের সত্যতা যাচাই

অধিকাংশ AI ছবি তৈরির সফটওয়্যার ফাইল সংরক্ষণ করার সময় নির্দিষ্ট ডিজিটাল স্বাক্ষর যুক্ত করে। প্রথম স্তরটি ব্রাউজার-ভিত্তিক বাইনারি পার্সিং লাইব্রেরির (যেমন ExifReader) মাধ্যমে বাইট স্ট্রিম পরীক্ষা করে:

  1. IPTC Digital Source Type:
    • আন্তর্জাতিক মানদণ্ড যেখানে AI তৈরি ছবিকে trainedAlgorithmicMedia অথবা compositeSynthetic হিসেবে চিহ্নিত করা হয়।
    • Google Imagen এবং Adobe Firefly প্রতিনিয়ত এই তথ্য যুক্ত করে।
  2. IPTC Credit এবং Software ট্যাগ:
    • Midjourney প্রায়শই Credit বা Software ফিল্ডে Midjourney কথাটি লিখে দেয়।
    • DALL-E 3-এর ফাইলে OpenAI-এর নিজস্ব সনাক্তকারী চিহ্ন থাকে।
  3. PNG টেক্সট চাঙ্ক (tEXt, iTXt, zTXt):
    • Stable Diffusion নির্ভর সফটওয়্যারগুলো (Automatic1111, ComfyUI, Forge) PNG হেডারেই ছবি তৈরির সমস্ত পরামিতি সংরক্ষণ করে।
    • আমরা সেখান থেকে ইতিবাচক ও নেতিবাচক প্রম্পট, সিড (Seed) মান, CFG scale, স্যাম্পলার এবং LoRA মডেলের নাম বের করে নিই।
  4. C2PA কনটেন্ট প্রমাণপত্র:
    • Content Authenticity Initiative-এর মান অনুসরণ করে ডিজিটালি স্বাক্ষরিত JUMBF কনটেইনার (c2pa মার্কার) আছে কিনা তা যাচাই করা হয়।

যদি এই স্তরে সুস্পষ্ট প্রমাণ পাওয়া যায়, তবে সিস্টেমটি বাড়তি জটিল হিসাব ছাড়াই সরাসরি উচ্চ আত্মবিশ্বাস (High Confidence) ফলাফল প্রদান করে।

চিত্র ৩: প্রমাণ ড্যাশবোর্ডের বিস্তারিত রূপ: যেখানে সনাক্ত হওয়া প্রম্পটের পরামিতি (স্টেপ, স্যাম্পলার, CFG) এবং নয়েজ ভ্যারিয়েন্সের মান প্রদর্শিত হচ্ছে।চিত্র ৩: প্রমাণ ড্যাশবোর্ডের বিস্তারিত রূপ: যেখানে সনাক্ত হওয়া প্রম্পটের পরামিতি (স্টেপ, স্যাম্পলার, CFG) এবং নয়েজ ভ্যারিয়েন্সের মান প্রদর্শিত হচ্ছে।


২য় স্তর: ব্রাউজারে পিক্সেল নয়েজ ভ্যারিয়েন্স বিশ্লেষণ

যখন কোনো ছবিতে মেটাডেটা থাকে না (যেমন JPEG রূপান্তর বা সচেতনভাবে তথ্য মুছে ফেলা হলে), তখন ব্রাউজার OffscreenCanvas এবং HTML5 Canvas-এর মাধ্যমে স্থানিক পরিসংখ্যানিক বিশ্লেষণ শুরু করে।

চিত্র ৪: বিচ্ছিন্ন ৩x৩ ল্যাপলাসিয়ান কনভোলিউশনের মাধ্যমে উচ্চ-ফ্রিকোয়েন্সি অবশিষ্টাংশ R(x, y) পৃথকীকরণ এবং ক্যামেরা সেন্সরের সাথে ডিফিউশন মডেলের তুলনা।চিত্র ৪: বিচ্ছিন্ন ৩x৩ ল্যাপলাসিয়ান কনভোলিউশনের মাধ্যমে উচ্চ-ফ্রিকোয়েন্সি অবশিষ্টাংশ R(x, y) পৃথকীকরণ এবং ক্যামেরা সেন্সরের সাথে ডিফিউশন মডেলের তুলনা।

ভৌত ও গাণিতিক মূলনীতি

  • বাস্তব ক্যামেরা সেন্সর: অপটিক্যাল সেন্সর (CMOS/CCD) ফোটন কণা গ্রহণ করে যা কোয়ান্টাম শট নয়েজ এবং তাপীয় পরিবর্তনের কারণে পয়সন-গাউসিয়ান বিন্যাস (Poisson-Gaussian Distribution) অনুসরণ করে। মসৃণ এলাকায় ক্যামেরা সেন্সরের নয়েজ একটি স্বাভাবিক আইসোট্রপিক ধারাবাহিকতা বজায় রাখে।
  • ডিফিউশন জেনারেটিভ মডেল: Stable Diffusion বা Midjourney-এর মতো মডেলগুলো এলোমেলো গাউসিয়ান নয়েজ থেকে ক্রমান্বয়ে রিভার্স ডিনয়েজিং প্রক্রিয়ার মাধ্যমে ছবি তৈরি করে। এই প্রক্রিয়ায় ক্ষুদ্রাতিক্ষুদ্র পিক্সেল স্তরে এক ধরণের বিশেষ স্থানিক সম্পর্ক থেকে যায়: মসৃণ জায়গাগুলো অস্বাভাবিকভাবে বেশি পরিষ্কার দেখায় এবং টেক্সচারযুক্ত অংশে অস্বাভাবিক উচ্চ-ফ্রিকোয়েন্সির শক্তি জমা হয়।

অ্যালগরিদমের ধাপসমূহ

  1. ছবিটিকে মূল আকারে একটি OffscreenCanvas-এ আঁকা হয়।
  2. getImageData ব্যবহার করে মনোক্রোম উজ্জ্বলতার মান Y(x, y) নেওয়া হয়।
  3. একটি বিচ্ছিন্ন ৩x৩ ল্যাপলাসিয়ান কনভোলিউশন ফিল্টার প্রয়োগ করে উচ্চ-ফ্রিকোয়েন্সি অবশিষ্টাংশ R(x, y) আলাদা করা হয়:
    ┌             ┐
    │  0  -1   0  │
    │ -1   4  -1  │
    │  0  -1   0  │
    └             ┘
    
  4. উচ্চ কনট্রাস্টের ধারগুলো বাদ দিয়ে মসৃণ এলাকায় অবশিষ্টাংশের ভ্যারিয়েন্স σ² নির্ণয় করা হয়:
    σ² = (1/N) · Σ (Rᵢ − R̄)²
    
  5. প্রাপ্ত মানকে আসল ক্যামেরা সেন্সরের স্ট্যান্ডার্ড রেফারেন্স ডেটাবেসের সাথে মেলানো হয়।

যেহেতু পুরো হিসাবটি আপনার কম্পিউটারে ব্রাউজারের জাভাস্ক্রিপ্টে সম্পন্ন হয়, তাই প্রতি ছবিতে মাত্র ৫০ থেকে ১৫০ মিলি-সেকেন্ড সময় লাগে এবং কোনো ইন্টারনেট ব্যান্ডউইথ খরচ হয় না।


৩য় স্তর: ক্লাউড ডিপ ভিশন মডেল (ঐচ্ছিক)

যদি মেটাডেটা না থাকে এবং নয়েজের মান সন্দেহজনক সীমায় অবস্থান করে, তবে ব্যবহারকারী ক্লাউড ডিপ লার্নিং মডেলের সাহায্য নিতে পারেন:

  • লক্ষ লক্ষ আসল ও কৃত্রিম ছবির ওপর প্রশিক্ষিত Vision Transformer মডেলের ভিত্তিতে তৈরি।
  • ওয়েব URL পরীক্ষার ক্ষেত্রে SSRF আক্রমণ প্রতিরোধ এবং সর্বোচ্চ ১০ মেগাবাইট ফাইল সীমার মতো নিরাপত্তা ব্যবস্থা বজায় রাখা হয়।

৪. প্রযুক্তিগত সীমাবদ্ধতা ও ব্যবহারের সতর্কতা

পৃথিবীর কোনো AI ডিটেক্টরই শতভাগ নির্ভুল হতে পারে না। ফলাফল মূল্যায়নের সময় এই বাস্তব বিষয়গুলো খেয়াল রাখুন:

১. সোশ্যাল মিডিয়া প্ল্যাটফর্মে মেটাডেটা মুছে যাওয়া

WhatsApp, Instagram বা X-এর মতো প্ল্যাটফর্মগুলো আপলোডের সময় ফাইল সংকুচিত করে এবং সমস্ত EXIF, IPTC ও C2PA মেটাডেটা স্থায়ীভাবে মুছে ফেলে। সোশ্যাল মিডিয়া থেকে সংগৃহীত ছবিতে ১ম স্তরের কোনো তথ্য পাওয়া যাবে না।

২. অতিরিক্ত এডিটিং ও রি-কম্প্রেশন

ব্লার ফিল্টার ব্যবহার, কৃত্রিম ফিল্ম গ্রেইন যুক্ত করা অথবা নিম্নমানের JPEG কম্প্রেশন (কোয়ালিটি ৬০-এর নিচে) পিক্সেলের সূক্ষ্ম বিন্যাস নষ্ট করে দেয়, যা ফলাফলের নির্ভুলতা কমিয়ে দিতে পারে।

৩. ডিজিটাল চিত্রকর্ম এবং ৩D রেন্ডারিং

ডিজিটাল ইলাস্ট্রেশন, ভেক্টর আর্ট বা ৩D মডেলিংয়ের ছবিতে (Blender, Unreal Engine) ক্যামেরা সেন্সরের কোনো প্রাকৃতিক নয়েজ থাকে না। গাণিতিক অ্যালগরিদম এই মসৃণতাকে কৃত্রিম ছবির লক্ষণ হিসেবে ভুল করতে পারে। সর্বদা কাজের ধরন বিবেচনা করুন।

৪. অপ্রকাশ্য সুপ্ত জলছাপ (যেমন SynthID)

মডেলের সুপ্ত ভেক্টর স্পেসে সরাসরি যুক্ত করা অদৃশ্য জলছাপ (যেমন Google DeepMind-এর SynthID) সনাক্ত করতে বিশেষ চাবি ও সার্ভারের প্রয়োজন হয়, যা সাধারণ ব্রাউজারে অফলাইনে ডিকোড করা সম্ভব নয়।

💡 পরামর্শ: ডিটেক্টরের ফলাফলকে একটি সহায়ক যৌক্তিক প্রমাণ হিসেবে দেখুন। গুরুত্বপূর্ণ ছবির ক্ষেত্রে সবসময় ছবি প্রকাশের উৎস এবং দৃশ্যমান শারীরিক অসঙ্গতিগুলো (হাতের আঙুল, আলোর দিক, ছায়া) মিলিয়ে সামগ্রিক সিদ্ধান্ত নিন।


৫. এখনই যাচাই করে দেখুন

আপনার কোনো ছবি পরীক্ষা করে দেখতে চান?

  1. ভিজিট করুন ফ্রি AI ইমেজ ডিটেক্টর
  2. ছবি ড্রপ করুন, ক্লিপবোর্ড থেকে পেস্ট করুন বা ছবির সরাসরি লিংক দিন।
  3. সম্ভাবনার মাত্রা এবং আত্মবিশ্বাসের স্কোর লক্ষ্য করুন, আর বিস্তারিত দেখতে প্রমাণ ড্যাশবোর্ডটি খুলে পরীক্ষা করুন।

তথ্যসূত্র ও আরও পড়ুন

  1. 01.
  2. 02.
  3. 03.
  4. 04.
  5. 05.
    Canvas API & ImageData — MDN Web Docs
    developer.mozilla.org/en-US/docs/Web/API/Canvas_API
  6. 06.
    Discrete Laplace Operator in Digital Image Processing — Wikipedia
    en.wikipedia.org/wiki/Discrete_Laplace_operator
  7. 07.
  8. 08.
  9. 09.
    Stable Diffusion WebUI by AUTOMATIC1111
    github.com/AUTOMATIC1111/stable-diffusion-webui
  10. 10.