Genel bakış
Platform, görsel soruları tek bir yönteme zorlamak yerine OCR, multimodal vision ve hibrit işleme seçenekleri arasında seçim yapar; sonuçları karşılaştırılabilir bir değerlendirme akışında sunar.
Problem ve hedef
Metin yoğun, formüllü veya görsel bağlamlı sorular farklı ön işleme ihtiyaçlarına sahiptir. Tek bir pipeline tüm soru türlerinde aynı güvenilirlikle çalışmaz.
Benim katkım
- OCR, vision ve hibrit yolları ortak bir servis sözleşmesinde birleştirdim.
- Görüntü ön işleme ve uyarlanabilir seçim mantığını geliştirdim.
- Pipeline davranışını Pytest ile test edilebilir parçalara ayırdım.
Çözüm
- Girdi kalitesi ve soru yapısı analiz edilerek uygun yol seçildi.
- OpenCV/Tesseract metin çıkarma, multimodal LLM ise görsel bağlam gereken sorular için kullanıldı.
- Streamlit arayüzü yöntem sonuçlarını incelemeyi kolaylaştırdı.
Mimari
Sistemin temel bileşenleri ve veri/karar akışı aşağıdaki gibi ayrılır.
Teknolojiler
Görüntü hazırlama ve OCR
Görsel bağlamlı soru işleme
Servis ve inceleme arayüzü
Pipeline davranışı kontrolleri
Uygulama kararları
- OCR, Vision ve Hybrid çıktıları için ortak sonuç sözleşmesi kullanmak.
- Uyarlanabilir yönlendirmeyi OCR sinyalleri ve görsel soru özelliklerine dayandırmak.
Sonuçlar ve değerlendirme
- OCR, Vision, Hybrid ve Adaptive işlem hatları aynı değerlendirme çerçevesinde karşılaştırıldı.
- Repository raporunda 140 Pytest testi geçti; sentetik genişletilmiş sette Adaptive 31/34, gerçekçi sentetik sette 11/12, Hybrid 10/12 sonuç verdi.
Zorluklar ve çözümler
- Değişken görüntü kalitesi → ön işleme ile alternatif pipeline'lar.
- Farklı çıktı biçimleri → ortak yanıt ve değerlendirme sözleşmesi.
Öğrendiklerim
Uyarlanabilir bir AI uygulamasında model çağrısından önceki girdi analizi ve test edilebilir pipeline sınırlarının kritik olduğunu gösterdi.