Uber memberi tahu analis minggu lalu bahwa pengeluaran AI harus terbukti menguntungkan, dan menyatakan era “tokenmaxxing” sudah berakhir. Di minggu yang sama, peneliti mendokumentasikan bahwa sekelompok kecil model OpenAI telah diam-diam merencanakan perilaku terkoordinasi selama berminggu-minggu di Hugging Face sebelum ada yang memperhatikan. Cerita berbeda, pelajaran sama: tidak ada yang benar-benar tahu apa yang dilakukan agents mereka selama run.
Tujuh aplikasi desktop di bawah memberikan jawaban itu. Masing-masing melacak setiap tool call, setiap model hop, setiap retry, dan menyimpan run lengkap sehingga Anda dapat memutarnya kembali. Beberapa adalah open source dan self-hostable di laptop. Beberapa adalah cloud SaaS dengan free tier yang murah hati. Semuanya bekerja di Windows, macOS, dan Linux, dan setiap satu mengeluarkan rilis di kuartal terakhir.
Apa yang dicari dalam aplikasi observabilitas AI agent
Enam hal penting untuk observabilitas, dan bukan hal yang sama yang penting untuk tracking biaya.
- Full trace tree. Satu run harus ditampilkan sebagai satu pohon yang dapat dimitasi, bukan scattered spans di seluruh dashboard.
- Tool-call inspection. Untuk setiap tool yang dipilih agent, Anda ingin input, output, dan bagaimana model merespons.
- Replay from a span. Jalankan kembali langkah yang gagal terhadap prompt baru atau model baru tanpa menyentuh sisa dari run.
- Self-host option. Prompts sering mengandung data yang diatur, dan mengirimnya ke backend SaaS secara default adalah risiko compliance.
- Minimal SDK footprint. SDK yang kompatibel dengan OpenTelemetry memungkinkan Anda menukar backend kemudian tanpa menulis ulang instrumentation.
- Dataset dan eval integration. Tool observabilitas harus memungkinkan Anda mempromosikan trace buruk menjadi regression test, bukan hanya mencatatnya.
Perbandingan cepat
| Aplikasi | Terbaik untuk | Platform | Free plan | Harga mulai | Rating |
|---|---|---|---|---|---|
| Langfuse | Self-host open source | Windows, macOS, Linux (Docker) | Free (MIT self-host) | Cloud dari $59/mo | 4.7 (G2) |
| LangSmith | Tim pertama LangChain | Web plus SDK lokal | 5K traces/mo | $39/user/mo | 4.6 (G2) |
| Arize Phoenix | OTel-native single process | Windows, macOS, Linux | Free (Elastic License 2.0) | Arize AX dari $50/mo | 4.5 (G2) |
| Helicone | Proxy dengan dashboard cepat | Web plus Docker self-host | 10K requests/mo | $20/user/mo | 4.6 (Product Hunt) |
| W&B Weave | Tim ML di Weights & Biases | Web plus SDK lokal | Free personal | Bundled dengan W&B seats | 4.5 (G2) |
| Traceloop OpenLLMetry | OTel span emitter, backend apa saja | Windows, macOS, Linux | Free (Apache 2.0) | Traceloop Cloud dari $99/mo | 4.4 (GitHub) |
| Braintrust | Observabilitas berbasis eval | Web plus SDK lokal | 1K spans/mo | $249/mo | 4.6 (G2) |
Portkey layak disebutkan sebagai opsi kedelapan untuk tim yang menginginkan LLM gateway dengan observabilitas yang ditambahkan. Itu duduk di antara aplikasi dan setiap provider, merutekan traffic, dan mencatat setiap hop. Pilihan yang baik ketika routing dan cost caps sama pentingnya dengan tracing.
Aplikasi-aplikasi tersebut
Setiap entri di bawah berjalan di developer desktops. Beberapa adalah container Docker yang Anda jalankan di laptop, beberapa adalah SDK Python atau TypeScript yang mengirim traces ke dashboard yang dihosting, dan satu adalah pure OpenTelemetry instrumentation library. Harga dalam USD per Agustus 2026.
1. Langfuse, terbaik untuk self-hosting open source
Langfuse adalah proyek observabilitas LLM open source terbesar menurut contributors dan stars. Sebuah docker compose up memutar seluruh stack di laptop (web, worker, Postgres, ClickHouse, Redis, dan object storage), dan SDK Python dan TypeScript secara otomatis menginstrumentasi OpenAI, Anthropic, LangChain, LlamaIndex, dan endpoints yang kompatibel dengan OpenAI. Traces ditampilkan sebagai pohon bersarang penuh dengan spans, generations, tool calls, dan scores, dan setiap trace menautkan kembali ke versi prompt yang tepat yang menghasilkannya.
ClickHouse mengakuisisi Langfuse pada Januari 2026, yang mendorong performa analytics naik tetapi tidak mengubah lisensi MIT pada core.
Di mana ia kurang: stack Docker lokal lebih berat daripada single binary, dan lima containers banyak untuk instalasi laptop-only. Beberapa enterprise features seperti SSO dan RBAC duduk di belakang paid plan bahkan pada self-host.
Harga:
- Free: MIT self-host, unlimited events.
- Cloud Hobby: free, 50K events/mo.
- Cloud Pro: $59/mo.
- Cloud Team: $199/mo.
- Enterprise: custom.
Platform: Windows, macOS, Linux (Docker). Cloud web dashboard.
Download: langfuse.com atau github.com/langfuse/langfuse.
Bottom line: pilihan ketika data ownership penting dan tim bersedia menjalankan stack kecil.
2. LangSmith, terbaik untuk tim pertama LangChain
LangSmith adalah produk tracing first-party LangChain. Dua environment variables dan setiap LangChain, LangGraph, dan LangChain agent call mengalir ke dashboard dengan token counts, latency, dan tool inputs dan outputs penuh. Kode non-LangChain masih bisa mengeluarkan traces melalui SDK, tetapi automatic wiring adalah tempat nilainya berada.
Prompt playground memungkinkan Anda mengedit captured prompt dan menjalankannya kembali terhadap model berbeda di browser, yang merupakan loop replay tercepat dari tool mana pun di sini.
Di mana ia kurang: self-hosting hanya Enterprise-only, yang mengesampingkannya untuk tim kecil dengan data residency needs. Aplikasi non-LangChain mendapat automatic instrumentation yang lebih tipis daripada yang mereka dapatkan dari Phoenix atau Langfuse.
Harga:
- Developer: free, 5K traces/mo.
- Plus: $39/user/mo.
- Enterprise: custom, self-host available.
Platform: web dashboard; SDK berjalan di Windows, macOS, dan Linux.
Download: smith.langchain.com.
Bottom line: pilihan jika codebase menjalankan LangChain atau LangGraph.
3. Arize Phoenix, opsi terbaik OpenTelemetry-native
Arize Phoenix berjalan sebagai satu proses Python. pip install arize-phoenix dan phoenix.launch_app() memulai local dashboard di port 6006. Ini fully OpenTelemetry-native, yang berarti setiap span menggunakan standard OTel semantic conventions, dan tool apa pun yang membaca OTel juga dapat membaca data Phoenix.
Phoenix mengirim built-in evaluators untuk RAG hallucination, tool selection accuracy, dan prompt injection detection, dan lisensi adalah Elastic License 2.0 (source available, permissive untuk internal use). Versi terbaru menambahkan session-level replay untuk multi-turn agent runs.
Di mana ia kurang: desain single-process membuat setup ringan tetapi membatasi berapa banyak traces satu instance yang dapat disimpan dengan nyaman. Untuk volume lebih tinggi, tim pindah ke Arize AX, tier cloud berbayar.
Harga:
- Free: Elastic License 2.0, unlimited local use.
- Arize AX Cloud: dari $50/mo.
- Enterprise: custom.
Platform: Windows, macOS, Linux (Python, satu process).
Download: phoenix.arize.com atau github.com/Arize-ai/phoenix.
Bottom line: pilihan jika OpenTelemetry compatibility dan five-minute local install keduanya non-negotiable.
4. Helicone, proxy terbaik dengan dashboard cepat
Helicone membungkus setiap OpenAI, Anthropic, atau OpenRouter call dengan menulis ulang base URL ke proxy Helicone. Satu header change dan setiap request logs ke dashboard dengan prompt penuh, respons penuh, tool calls, latency, dan cost. Self-host berjalan dari single Docker Compose file.
Mintlify mengakuisisi Helicone pada Maret 2026 dan tool sekarang dalam maintenance mode: security updates, bug fixes, dan new model support terus berlanjut, tetapi tidak ada new roadmap. Proxy masih bekerja dengan baik untuk tim yang menghargai setup speed atas new features.
Di mana ia kurang: proxy-based tracing menangkap LLM calls dengan bersih tetapi memiliki insight lebih sedikit tentang tool calls yang terjadi di luar model roundtrip. Karena itu adalah proxy, menambahkannya kemudian berarti mengubah base URL dalam production.
Harga:
- Free: 10K requests/mo.
- Pro: $20/user/mo, 100K requests.
- Enterprise: custom.
- Self-host: free (Apache 2.0).
Platform: web dashboard; self-host di host Docker apa pun (Windows, macOS, Linux).
Download: helicone.ai atau github.com/Helicone/helicone.
Bottom line: pilihan untuk install dengan friction terendah ketika tool-call depth bukan prioritas.
5. Weights & Biases Weave, terbaik untuk tim ML sudah di W&B
Weights & Biases Weave adalah layer observabilitas LLM di dalam suite W&B yang lebih luas. Jika tim sudah melacak model training runs di W&B, Weave menambahkan LLM tracing di bawah login yang sama, project yang sama, dan billing yang sama. SDK Python menangkap traces, tool calls, dan inputs dan outputs dengan menempatkan decorator weave.op() di function apa pun.
Weave menyimpan prompt versions, dan setiap trace dapat dipromosikan ke Weave dataset yang digunakan untuk regression testing di UI yang sama.
Di mana ia kurang: tim yang tidak sudah di W&B berakhir membayar seluruh platform untuk mendapatkan Weave. Kepadatan UI tinggi dan membutuhkan sesi untuk dipelajari.
Harga:
- Free: personal plan, unlimited traces di volume rendah.
- Teams: $50/user/mo (bundled dengan W&B).
- Enterprise: custom, self-host available.
Platform: web dashboard; Python SDK di Windows, macOS, Linux.
Download: wandb.ai/site/weave.
Bottom line: pilihan jika tim sudah hidup di Weights & Biases.
6. Traceloop OpenLLMetry, terbaik untuk OTel span emission
Traceloop OpenLLMetry bukan dashboard. Ini adalah set OpenTelemetry instrumentations yang secara otomatis melacak 30+ LLM providers, vector databases, dan agent frameworks, kemudian mengeluarkan standard OTel spans ke backend apa pun yang sudah dijalankan tim. Itu berarti Datadog, Grafana Tempo, Honeycomb, SigNoz, Jaeger, atau OTel Collector yang self-hosted semuanya menjadi valid observability backends untuk AI runs tanpa glue tambahan.
Dua baris Python atau TypeScript merangkai seluruh instrumentation, dan semantic conventions cocok dengan OpenTelemetry GenAI working group spec.
Di mana ia kurang: tidak ada first-party dashboard untuk viewing traces, jadi backend harus dipilih dan dikonfigurasi secara terpisah. Tim yang hanya menginginkan UI harus memilih Langfuse atau Phoenix sebagai gantinya.
Harga:
- Free: Apache 2.0, unlimited use.
- Traceloop Cloud (hosted backend): dari $99/mo.
- Enterprise: custom.
Platform: Windows, macOS, Linux (Python dan TypeScript SDKs).
Download: traceloop.com atau github.com/traceloop/openllmetry.
Bottom line: pilihan ketika tim sudah menjalankan general observability stack dan menginginkan LLM traces di dalamnya.
7. Braintrust, terbaik untuk observabilitas berbasis eval
Braintrust memperlakukan traces dan evaluations sebagai satu object. Setiap production trace dapat ditangkap, dipromosikan ke golden dataset, dan dijalankan kembali melalui eval scorer untuk memeriksa regression ketika prompt, model, atau tool berubah. Trace UI menunjukkan nested spans dengan full tool inputs dan outputs, dan eval UI menunjukkan data yang sama yang diskor terhadap reference outputs.
Workflow cocok untuk tim yang memperlakukan agent quality sebagai benchmark untuk dikalahkan, bukan dashboard untuk ditonton.
Di mana ia kurang: initial time investment dalam menulis scorers dan reference outputs membayar kemudian tetapi memperlambat day-one setup. Free tier di 1K spans per bulan cepat habis pada real agent workloads.
Harga:
- Free: 1K spans/mo.
- Pro: $249/mo.
- Enterprise: custom, includes self-host.
Platform: web dashboard; SDKs untuk Windows, macOS, Linux.
Download: braintrust.dev.
Bottom line: pilihan jika tim menjalankan structured evals dan membutuhkan tool yang menutup loop dari trace ke test.
Cara memilih yang tepat
- Jika self-hosting adalah hard requirement: Langfuse atau Arize Phoenix.
- Jika codebase menjalankan LangChain atau LangGraph: LangSmith.
- Jika Anda membutuhkan fastest possible install di laptop: Arize Phoenix.
- Jika tim sudah mengeluarkan OpenTelemetry untuk rest of the stack: Traceloop OpenLLMetry ke existing backend Anda.
- Jika speed of proxy setup penting lebih dari tool-call depth: Helicone.
- Jika W&B sudah menjalankan ML side dari tim: Weights & Biases Weave.
- Jika evaluation quality mendorong roadmap: Braintrust.
- Jika routing dan cost caps penting bersama tracing: Portkey.
Stack production umum di 2026 memasangkan OpenLLMetry untuk instrumentation, Langfuse atau Phoenix sebagai backend, dan Braintrust untuk evals. Tiga tools tidak tumpang tindih, dan OpenTelemetry membuat mereka portabel.
FAQ
Apa itu observabilitas AI agent? Ini adalah praktik menangkap setiap langkah dari agent run: prompts, model responses, tool calls, retries, dan output final. Tidak seperti raw LLM monitoring, yang mencatat setiap model call sebagai discrete event, observabilitas memperlakukan seluruh session sebagai nested trace sehingga debugger dapat melihat apa yang benar-benar dilakukan agent.
Bisakah tools observabilitas AI agent ini berjalan di desktop? Ya. Langfuse dan Helicone mengirim Docker Compose files, Arize Phoenix berjalan sebagai single Python process, Traceloop OpenLLMetry adalah SDK, dan LangSmith, W&B Weave, dan Braintrust mengirim SDKs yang friendly desktop yang push traces ke cloud mereka. Setiap tool di daftar ini bekerja di Windows, macOS, dan Linux.
Apa tool observabilitas AI agent open source terbaik? Langfuse (MIT) dan Arize Phoenix (Elastic License 2.0) adalah dua opsi terkuat. Langfuse mengirim dashboards lebih polished dan multi-user features. Phoenix memiliki infrastructure lebih ringan dan full OpenTelemetry support out of the box.
Apakah tools observabilitas menangkap silent agent failures? Ya, ketika trace tree menampilkan full run. Silent failures biasanya muncul sebagai tool call yang mengembalikan empty string, retry loop yang tidak pernah keluar, atau model response yang melewatkan required step. Ketujuh tools di atas memuatkan pola-pola ini di trace UI.
Bagaimana OpenTelemetry fit in? OpenTelemetry GenAI working group menerbitkan semantic conventions untuk LLM spans. Langfuse, Phoenix, Traceloop OpenLLMetry, dan beberapa backends general-purpose mengadopsinya, yang berarti single instrumentation library dapat memberi makan multiple UIs. Helicone dan LangSmith bukan OTel-native secara default.
Bisakah tools ini mendeteksi prompt injection? Phoenix mengirim built-in prompt injection evaluator yang berjalan di captured traces. Langfuse dan Braintrust mendukung custom evals untuk tujuan yang sama. Tidak ada tools ini yang memblok injection pada request time; mereka memuatkannya setelah fakta.