Terry V2
Zuletzt geändert von René Schmidt am 2025/10/12 08:42
- 🖼️ Bilder analysieren (OCR Text erkennen, Bildbeschreibung mit KI)
- 🎤 Sprachnachrichten transkribieren (Speech-to-Text)
- 📄 Dokumente lesen (PDF, Word, TXT, etc.)
- 📊 Dateien verarbeiten (CSV, Excel, JSON)
Welche Tools willst du nutzen?
Für Bilder:
- Ollama mit llama3.2-vision (lokal, kostenlos) ← Empfohlen!
- OpenAI GPT-4 Vision (beste Qualität, kostet)
- Tesseract OCR (nur Text erkennen, kostenlos)
Für Sprachnachrichten:
- Whisper (lokal) mit Ollama oder eigenem Container ← Empfohlen!
- OpenAI Whisper API (kostet wenig)
Für Dokumente:
- PyPDF2 (PDF)
- python-docx (Word)
- Pandas (Excel, CSV)
- Alles lokal, kostenlos
Meine Empfehlung:
- Ollama llama3.2-vision für Bilder (kannst du gleich testen!)
- Whisper lokal für Sprache
- Python-Libraries für Dokumente