LamBench: AIコーディングエージェントのためのラムダ計算ベンチマークスイート

Victor Taelin氏がLamBench v1をリリースしました。これは、ラムダ計算問題におけるAIコーディングエージェントをテストするためのベンチマークフレームワークです。プロジェクトはGitHubのgithub.com/VictorTaelin/LamBenchでホストされており、ライブサイトはvictortaelin.github.io/lambench/にあります。
主な詳細
- 評価指標: ベンチマークは3つの軸(
:intelligence、:speed、:elegance)を測定します。 - 構成要素: 一連の
:problemsと結果をスコアリングするための:matrix。 - バージョン: v1(初回リリース)。
LamBenchは、Taelin氏による記号計算におけるAIシステムの厳密な評価を作成するための広範な取り組みの一部です。背景として、ラムダ計算は数理論理学とコンピューティングにおける形式システムであり、推論や関数型プログラミングの能力をテストするために頻繁に使用されます。そのため、このベンチマークは、記号操作、再帰、高階関数を扱う必要があるAIコーディングエージェントにとって特に重要です。
対象者
コーディングエージェントを構築または評価するAI研究者や開発者、特に関数型プログラミングや記号推論タスクに取り組んでいる方。
📖 出典全文を読む: HN AI Agents
👀 See Also

Compass Chrome拡張機能がClaudeとChatGPTにナビゲーションツールを追加
開発者が、長い会話でのナビゲーション問題を解決するため、ClaudeとChatGPTのインターフェースにプロンプトミニマップ、固定スクロールヘッダー、セッションチェックリスト、プロンプトビルダーテンプレートを追加する無料のChrome拡張機能「Compass」を構築しました。

OpenClawエージェントリレープラグインがマルチエージェント設定でのTelegram配信を修正
openclaw-agent-relayプラグインは、sessions_sendの応答がTelegramではなくwebchatに送信されてしまうという継続的な問題を解決します。これは、ゲートウェイWebSocket RPCを使用してdeliver:trueでエージェントターンをトリガーし、明示的なメッセージツールやアナウンスステップなどの回避策を不要にします。

OpenClawホスティングの簡素化:BestClawがSSHとユーザーフレンドリーな機能を維持
BestClawは、OpenClawホスティングにおけるシンプルな解決策として登場し、使いやすさと重要なSSHアクセスを両立させています。これはr/openclawで議論されています。

リレー:OpenClaw AIエージェントのためのオープンソース制御プレーン
Relayは、Claude CoworkのようなワークフローをOpenClawに提供するElectronデスクトップアプリです。お客様のインフラストラクチャ上で動作し、選択したLLMモデルを使用でき、承認ゲートやエクスポート可能な監査証跡などの組み込みガバナンス機能を備えています。