Los complementos de LM Studio añaden análisis de imágenes web para LLMs con capacidades visuales.

✍️ OpenClawRadar📅 Publicado: 31 de marzo de 2026🔗 Source
Los complementos de LM Studio añaden análisis de imágenes web para LLMs con capacidades visuales.
Ad

Un desarrollador ha creado complementos para LM Studio que permiten a los LLM con capacidades visuales obtener imágenes de la web y analizarlas directamente dentro de la aplicación. Los complementos funcionan sin requerir MCP/APIs ni registro, utilizando scripts simples que se pueden instalar con un clic desde el sitio web de LM Studio.

Características Principales

El complemento principal, "analyze-images", permite a los LLM:

  • Obtener imágenes de la web para su análisis
  • Encadenar herramientas automáticamente según la tarea
  • Convertir las imágenes obtenidas en archivos de miniaturas más pequeños para incrustar en el chat y evitar desorden
  • Utilizar imágenes de resolución completa para el análisis cuando sea posible
  • Incrustar imágenes en las respuestas o usar galerías en tablas markdown cuando los usuarios soliciten múltiples imágenes

El desarrollador también actualizó complementos existentes:

  • El complemento Duck-Duck-Go ahora funciona con imágenes
  • El complemento Visitar Sitio Web ahora funciona con imágenes
Ad

Requisitos y Configuración

Para usar estos complementos, necesitas:

  • Un modelo con capacidades visuales (se recomiendan Qwen 3.5 9b o 27b)
  • LM Studio con soporte para complementos

El desarrollador compartió configuraciones específicas de Qwen 3.5 que funcionaron bien:

Temperatura: 1
Muestreo Top K: 20
Penalización de Repetición: 1
Penalización de Presencia: 1.9
Muestreo Top P: 0.95
Muestreo Min P: 0

Señaló que la configuración de Penalización de Presencia en 1.9 ayudó a solucionar problemas de repetición y evitar bucles.

El mensaje del sistema utilizado fue: "Eres un asistente capaz, reflexivo y preciso. Prioriza siempre ser veraz, matizado, perspicaz y eficiente, adaptando tus respuestas específicamente a las necesidades y preferencias del usuario. Investiga antes de responder las preguntas: utiliza tanto el razonamiento como las llamadas a herramientas para sintetizar una conclusión adecuada."

Enlaces de Complementos

  • Complemento Analizar Imágenes: https://lmstudio.ai/vadimfedenko/analyze-images
  • Duck-Duck-Go reworkeado: https://lmstudio.ai/vadimfedenko/duck-duck-go-reworked
  • Visitar Sitio Web reworkeado: https://lmstudio.ai/vadimfedenko/visit-website-reworked

El desarrollador también compartió una Plantilla de Mensaje Jinja en Pastebin que ayudó a solucionar errores en las llamadas a herramientas.

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Signet: Capa de Memoria de Código Abierto para Agentes de IA de Programación Alcanza 80% de F1 en LoCoMo
Herramientas

Signet: Capa de Memoria de Código Abierto para Agentes de IA de Programación Alcanza 80% de F1 en LoCoMo

Signet es un sistema de memoria de código abierto para agentes de IA de programación que logra un 80% de F1 en el benchmark LoCoMo, en comparación con el 41% del RAG estándar. Extrae recuerdos después de cada sesión e inyecta contexto relevante antes de los prompts, ejecutándose localmente con SQLite.

OpenClawRadar
Agente de IA Crea Video Autónomamente Usando Remotion Sin Herramientas Predefinidas
Herramientas

Agente de IA Crea Video Autónomamente Usando Remotion Sin Herramientas Predefinidas

Un desarrollador probó un agente de IA que creó de forma autónoma un breve video reel instalando Remotion, escribiendo código de composición, depurando problemas y entregando un archivo renderizado sin intervención humana.

OpenClawRadar
El Marco de Agentes Jork Desarrollado con Claude se Clasifica entre los 10 Mejores en un Hackatón de $4 Millones
Herramientas

El Marco de Agentes Jork Desarrollado con Claude se Clasifica entre los 10 Mejores en un Hackatón de $4 Millones

Un desarrollador construyó un framework agéntico llamado Jork usando modelos Claude y GLM que se ubicó entre los 10 primeros entre más de 2000 aplicaciones en un hackathon de 4 millones de dólares. El framework desarrolló de forma autónoma herramientas incluyendo un radar de lanzamientos en Solana y un juego funcional de búsqueda de palabras.

OpenClawRadar
memv: Sistema de Memoria de Código Abierto para Agentes de IA
Herramientas

memv: Sistema de Memoria de Código Abierto para Agentes de IA

memv es un sistema de memoria de código abierto diseñado para agentes de IA que solo almacena información inesperada de las interacciones, reduciendo el ruido y la redundancia.

OpenClawRadar