TinySearch v0.2.0: Leichte Websuche für lokale LLMs jetzt mit SearXNG-Unterstützung

TinySearch v0.2.0 ist ein leichtgewichtiges Open-Source-MCP/FastAPI-Websuchtool für kleine lokale LLMs. Es durchsucht das Web, crawlt einige Seiten, chunked/retrievet/rerankt nützliche Teile und gibt einen kompakten Kontext-String aus, der auf 8k Tokens begrenzt ist – kein 30k-Token-Müll mehr aus gescraptem Unsinn in Agent-Prompts.
Wichtige Änderungen in v0.2.0
- SearXNG ist nun das standardmäßige Such-Backend (ersetzt DuckDuckGo)
- Du kannst TinySearch auf deine eigene SearXNG-Instanz verweisen
- Flexibler und weniger abhängig von einem einzigen Anbieter
- Ausgabe weiterhin auf 8k Tokens begrenzt, optimiert für LLM-Agenten
DuckDuckGo hat in den letzten Wochen häufiger Limits und CAPTCHAs eingeführt. Für ein MCP-Tool, auf das Agenten angewiesen sind, war das inakzeptabel. SearXNG bringt etwas Overhead mit sich – Aufrufe dauern jetzt etwa 10-15 Sekunden – aber der Autor sagt, es sei den Komfort wert.
Für wen es gedacht ist
Entwickler, die kleinere lokale Modelle mit Cline, Roo, OpenCode, MCP-Agenten oder anderen Konfigurationen verwenden, bei denen das Kontextbudget knapp ist. Der Autor nutzt TinySearch täglich mit Qwen3.5-9B für Fragen zu Bibliotheksversionen, Funktionsaufrufen und Azure/GCP-API-Details.
Repository: github.com/MarcellM01/TinySearch
📖 Lies die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

AVP-Protokoll ermöglicht LLM-Agenten den Austausch von KV-Cache anstelle von Text für Token-Effizienz
AVP (Agent Vector Protocol) ermöglicht es LLM-Agenten, KV-Cache direkt untereinander weiterzugeben anstatt Text, wodurch die Token-Verarbeitung um 73-78% reduziert und 2-4-fache Geschwindigkeitssteigerungen bei Qwen-, Llama- und DeepSeek-Modellen erreicht werden. Das Protokoll funktioniert mit HuggingFace- und vLLM-Connectoren und ist als Python-Paket verfügbar.

Auto Router vs Sonnet: Kosteneinsparungen vs Antwortqualität
Die Auto Router-Funktion von Open Router wählt LLMs dynamisch basierend auf der Kontextkomplexität aus und bietet erhebliche Kosteneinsparungen (0,8 Cent vs. 0,00071 Cent pro Anfrage), aber Nutzer berichten von einer verschlechterten Antwortqualität im Vergleich zu Sonnet 4.6.

SigMap v8.9: Deterministische Kontextebene reduziert Token-Nutzung um 97 % für KI-Code-Agenten
SigMap v8.9 erreicht 97% Token-Reduktion, 88% hit@5-Retrieval und 49% weniger Prompts pro Aufgabe. Funktioniert mit Copilot, Claude Code, Cursor, Windsurf, Codex, OpenCode, Gemini CLI. Keine Abhängigkeiten, vollständig offline.

Claude-Code-Überprüfungsengpass und Browser-Automatisierungs-Plugin-Lösung
Ein Entwickler berichtet, dass die Überprüfung immer noch der langsamste Teil bei der Nutzung von Claude Code ist und manuelle Tests von Funktionen erfordert. Sie fanden ein Browser-Automatisierungs-Plugin, das es dem Agenten ermöglicht, echte Produktabläufe zu überprüfen, bevor Aufgaben als abgeschlossen markiert werden.