Wiki source code of Terry V2

Last modified by René Schmidt on 2025/10/12 08:42

Show last authors
1 * 🖼️ **Bilder analysieren** (OCR Text erkennen, Bildbeschreibung mit KI)
2 * 🎤 **Sprachnachrichten** transkribieren (Speech-to-Text)
3 * 📄 **Dokumente lesen** (PDF, Word, TXT, etc.)
4 * 📊 **Dateien verarbeiten** (CSV, Excel, JSON)
5
6 **Welche Tools willst du nutzen?**
7
8 === Für Bilder: ===
9
10 * **Ollama mit llama3.2-vision** (lokal, kostenlos) ← Empfohlen!
11 * **OpenAI GPT-4 Vision** (beste Qualität, kostet)
12 * **Tesseract OCR** (nur Text erkennen, kostenlos)
13
14 === Für Sprachnachrichten: ===
15
16 * **Whisper (lokal)** mit Ollama oder eigenem Container ← Empfohlen!
17 * **OpenAI Whisper API** (kostet wenig)
18
19 === Für Dokumente: ===
20
21 * **PyPDF2** (PDF)
22 * **python-docx** (Word)
23 * **Pandas** (Excel, CSV)
24 * Alles lokal, kostenlos
25
26 **Meine Empfehlung:**
27
28 * **Ollama llama3.2-vision** für Bilder (kannst du gleich testen!)
29 * **Whisper lokal** für Sprache
30 * **Python-Libraries** für Dokumente
31
32
33
34
35
36
37
38
39