JetBrains über den Aufbau einer RAG-Pipeline für semantische Codesuche: Parsing, Chunking, Vektorisierung

✍️ OpenClawRadar📅 Veröffentlicht: 5. Oktober 2026🔗 Source
Ad

JetBrains hat den ersten Teil eines Entwicklertagebuchs über den Aufbau von Air Context veröffentlicht, ihrer Plattform für semantische Codesuche – eine RAG-Pipeline, die LLM-Agenten „präzise, zitierbare Belege aus echten Repositories liefert, statt auf das zurückzugreifen, was grep gerade zutage fördert“. Geschrieben von Adam Malek und Ashot Kazaryan, behandelt Teil 1 Parsing, Chunking und Vektorisierung.

Warum semantische Suche statt grep

Der Beitrag argumentiert, dass Keyword-Suche und grep versagen, weil sie vom Agenten verlangen, den exakten Text im Voraus zu kennen. Das konkrete Beispiel: „Ein Agent, der sucht, wo Session-Tokens erneuert werden, kann sich nicht darauf verlassen, dass der Code hilfreicherweise das Wort ‚refresh‘ enthält.“ Um über abstrakte Domänen zu schließen, muss der Agent nach Bedeutung suchen. RAG indexiert Quellcode so, dass Semantik erfasst wird, und ermöglicht es dem Agenten, relevante Teile bei Bedarf per Freitextsuche abzurufen.

Ad

Parsing und Chunking

Parsing/Chunking ist der Vorverarbeitungsschritt, und JetBrains nennt ihn „oft übersehen“. Produktions-Repositories enthalten Tausende von Dateien mit jeweils Hunderte oder Tausende von Zeilen, und Agenten blähen Codebasen weiter auf, indem sie „produktive Schreiber“ sind. Dateien können viele Klassen, Felder und Methoden mit unterschiedlicher Verwandtschaft enthalten.

Die falschen Ansätze laut dem Beitrag:

  • Embedding ganzer Dateien – selbst wenn man die Datei in das Embedding-Modell passen könnte, würde die Suche die gesamte Datei zurückgeben, was das Ziel, eine bestimmte Funktion, ein Symbol oder ein Snippet zu finden, zunichtemacht.
  • Embedding pro Zeile – einzelne Zeilen sind „semantisch unbedeutend ohne den umgebenden Kontext“. Ein generischer Funktionsname oder Kommentar „verdient kein Embedding und führt zu falschen Abrufergebnissen“, was den Agenten mit unbedeutenden Mikro-Ergebnissen überlastet.

Das Ziel sind richtig abgegrenzte Einheiten: Der Explorations-Workflow des Agenten befasst sich hauptsächlich mit dem Finden einer bestimmten Funktion, eines Symbols oder eines Codeschnipsels, sodass Chunk-Grenzen mit diesen Einheiten übereinstimmen sollten (der „feine AST des Parsens und Chunkings“, um es im Beitrag auszudrücken).

Wie es weitergeht

Dies ist Teil 1 einer Serie. Die Autoren sagen, sie werden jede Phase von der Vorverarbeitung bis zur Speicherung und Agentenintegration behandeln, einschließlich der „Irrwege“, die sie eingeschlagen haben. Der Beitrag endet mitten im Satz, bevor die Details der Vektorisierungsphase erläutert werden. Man darf also eine Fortsetzung erwarten, die erklärt, wie Chunks in eine Embedding-Repräsentation umgewandelt werden.

Für wen es gedacht ist

Entwickler, die Retrieval für Coding-Agenten auf großen Codebasen erstellen, oder alle, die Chunking-Strategien für Code-RAG evaluieren.

📖 Read the full source: HN LLM Tools

Ad

👀 Siehe auch

TinyFish Web Agent übertrifft Wettbewerber bei der Web-Task-Benchmarking.
Werkzeuge

TinyFish Web Agent übertrifft Wettbewerber bei der Web-Task-Benchmarking.

Der Web-Agent von TinyFish erzielte eine Erfolgsquote von 81,9 % bei schwierigen Web-Aufgaben und übertraf damit deutlich Wettbewerber wie OpenAI Operator mit 43,2 %.

OpenClawRadar
200+ App-Design-Spezifikationen in Markdown – In Claude oder Cursor ziehen für exakte UI-Klone
Werkzeuge

200+ App-Design-Spezifikationen in Markdown – In Claude oder Cursor ziehen für exakte UI-Klone

Eine kuratierte Sammlung von über 200 beliebten Apps als strukturierte Markdown-Designspezifikationen mit exakten Hex-Codes, Schriftgrößen, Abständen, jedem Bildschirmzustand und Navigationsgraphen. In Claude, Cursor oder jeden anderen KI-Agenten einfügen, um SwiftUI-, Jetpack-Compose- oder Expo-UI-Klone zu generieren, ohne Farben oder Abstände raten zu müssen.

OpenClawRadar
dead-letter: Lokaler .eml-zu-.md-Konverter mit CLI, Web-UI und MCP-Server
Werkzeuge

dead-letter: Lokaler .eml-zu-.md-Konverter mit CLI, Web-UI und MCP-Server

dead-letter normalisiert E-Mail-Exporte in Markdown mit YAML-Frontmatter, anpassbar. Es bietet vier Zugriffsmodi: CLI, Python-Bibliothek, Web-UI und einen MCP-Server zur direkten Integration mit Claude Desktop, Claude Code und Codex.

OpenClawRadar
Open-Source-Claude-Code-Fähigkeit diagnostiziert Hindernisse bei der KI-Einführung
Werkzeuge

Open-Source-Claude-Code-Fähigkeit diagnostiziert Hindernisse bei der KI-Einführung

Eine MIT-lizenzierte Claude Code-Fähigkeit analysiert, wo Unternehmen bei der KI-Einführung stecken bleiben – bei Tools, Kultur oder Messung – und erstellt 90-Tage-Pläne mit benannten Verantwortlichen. Basierend auf Interviews mit über 100 Gründern und Vorstandsmitgliedern.

OpenClawRadar