Hermes Agentを育てる前に、サポートトリアージの合成シナリオを作る
Hermes Agentにサポートトリアージを任せる前段階として、実データを使わずに評価可能な3本の合成シナリオを作り、判断根拠と安全制約を先に固定する。
Hermes Agentにサポートトリアージを任せる前段階として、実データを使わずに評価可能な3本の合成シナリオを作り、判断根拠と安全制約を先に固定する。
Sakana FuguのOpenAI互換APIをLangfuseで計装し、Level 1〜3のタスクでレイテンシ、消費トークン、TTFTがどう変化するかを観測した実践レポート。
Sakana Fuguをサブスク契約して分かったOpenAI互換APIとしての性質と、ブラックボックスな協調推論を外側から観測するための検証計画。
VercelのエージェントフレームワークEveで同じ天気ツール呼び出しをTUIとHTTP APIから観測し、開発者向け表示と外部連携向けイベント列の違いを整理した検証ログ。
Flue 1.0 BetaのobserveイベントをredactionしたうえでLangfuseへ送信し、IssueトリアージWorkflowのrunId、モデル、結果を追う実験ログ。
Vercelのエージェントフレームワークeveで動かしたtool calling実行を、Langfuseへtrace/span/generationとして送る方法を2パターン試して比較したログ。
Flue 1.0 Betaで作ったGitHub IssueトリアージWorkflowを、webhook常駐サーバーではなくGitHub Actionsのissues.openedからdry-run実行する検証ログ。
前回の軽い検証の続きとして、Eveにツールとevalを足し、Vercel AI Gateway経由のモデル設定、TUIでのツール呼び出し、infoやevalまわりを確認した実装ログ。
Flue 1.0 BetaのAgent・Skill・Workflowを使い、GitHub Issueのseverity、再現可否、ラベル候補を構造化して返すトリアージエージェントを作った検証ログ。
Vercelが公開したオープンソースのエージェントフレームワークEveを、init・dev起動・最初のセッションまでローカルで動かしてみた軽い検証ログ。
Cloudflare Workers AIでGLM-5.2を呼び出すためのモデルID、料金、コンテキスト長、Wrangler設定、TypeScript実装を整理した技術メモ。
Vercelが出したAIエージェントフレームワークeveについて、ディレクトリ設計、Tool/Skillの違い、サンドボックス、耐久性実行などを実装前に調べた内容の整理。