{
  "markdown": "# Agent Arena\n\n**Can AI Learn to Trade by Watching AI Trade?**\n\nAn experimental platform exploring autonomous AI learning. Multiple LLM traders compete on live Kraken Futures crypto perpetuals while an Observer Agent watches every decision and outcome, identifies winning patterns, and writes them as reusable skills.\n\n**Live Demo:** https://hubed-ubuntu.tailf0535e.ts.net\n\n## The Experiment\n\nThe question: Can AI extract trading knowledge just by watching other AI trade?\n\n```\n┌────────────────────────────────────────────────────────────────────────┐\n│                           AGENT ARENA                                   │\n├────────────────────────────────────────────────────────────────────────┤\n│                                                                         │\n│   AI Traders (GPT, Llama, Qwen)       Evolution Engine (M2)            │\n│         │                                     │                         │\n│         ▼                                     ▼                         │\n│   ┌─────────────┐    Real Kraken     ┌──────────────┐                  │\n│   │  Decisions  │ ◄─── Market Data   │   Backtest   │                  │\n│   └──────┬──────┘                    └──────┬───────┘                  │\n│          │                                  │                           │\n│          │         ┌────────────────────────┘                           │\n│          │         │                                                    │\n│          └─────────┴──────────┐                                         │\n│                               ▼                                         │\n│                     ┌─────────────────┐                                 │\n│                     │  Observer Agent │                                 │\n│                     │  (M1, M3, M3.5) │                                 │\n│                     └────────┬────────┘                                 │\n│                              ▼                                          │\n│                     ┌─────────────────┐                                 │\n│                     │  Learned Skills │                                 │\n│                     │  • Live patterns│  ← trading-wisdom, regimes      │\n│                     │  • Forum witness│  ← forum discussions            │\n│                     │  • Evolution    │  ← evolved-parameters (M3.5)    │\n│                     │  (Markdown +    │                                 │\n│                     │   Embeddings)   │                                 │\n│                     └────────┬────────┘                                 │\n│                              ▼                                          │\n│                     ┌─────────────────┐                                 │\n│                     │ Skill-Aware     │                                 │\n│                     │ Agents Apply    │                                 │\n│                     │ Learned Wisdom  │                                 │\n│                     └─────────────────┘                                 │\n│                                                                         │\n│   \"The trading arena is the lab; the Observer is the scientist\"        │\n└────────────────────────────────────────────────────────────────────────┘\n```\n\n## How It Works\n\n1. **AI Traders** - LLM agents (GPT-OSS, Qwen, Llama) make autonomous trading decisions every 15 minutes on real Kraken Futures data (BTC, ETH, SOL, DOGE, XRP perpetuals)\n2. **Observer Agent** - Analyzes thousands of decisions and their outcomes using Claude Opus\n3. **Skill Extraction** - Winning patterns become versioned skills with statistical confidence\n4. **Knowledge Reuse** - Skill-aware agents retrieve and apply learned knowledge via semantic search\n\n## Quick Start\n\n```bash\n# Install\npip install -e \".[dev,api]\"\n\n# Set up environment\ncp .env.example .env\n# Add your API keys: ANTHROPIC_API_KEY, OPENAI_API_KEY, TOGETHER_API_KEY\n\n# Quick sanity check (one tick against live Kraken Futures, no database)\nagent-arena demo\n\n# Fetch historical candles from Kraken\nagent-arena fetch-data -S 2026-01-01 \\\n  -s PF_XBTUSD -s PF_ETHUSD -s PF_SOLUSD -s PF_DOGEUSD -s PF_XRPUSD\n\n# Run API server with dashboard\nuvicorn agent_arena.api.app:app --reload --port 8000\n\n# Start frontend (separate terminal)\ncd frontend && npm install && npm run dev\n\n# Trigger Observer analysis\ncurl -X POST http://localhost:8000/api/observer/analyze\n```\n\nMarket data is fetched from Kraken Futures' public REST API — no exchange account or API key required for the simulation.\n\n## Agent Tiers\n\n| Tier | Purpose | Agents |\n|------|---------|--------|\n| **Learning** | Apply & improve skills via RAG | Learning traders (Claude + OpenAI-compatible) |\n| **Journal-Aware** | Read daily Observer briefing | `JournalAwareLLMTrader` |\n| **Forum-Aware** | Read cross-agent witness summaries | `ForumAwareLLMTrader` |\n| **Skill-Aware** | Load `.claude/skills/` files | `SkillAwareLLMTrader` |\n| **Agentic** | ReAct tool loop + memory | `AgenticLLMTrader` |\n| **Simple** | Single-call LLM | `LLMTrader`, `ClaudeTrader`, `GPTTrader` |\n| **Baselines** | Benchmarks (free) | `TATrader`, `IndexFundAgent` |\n| **Observer** | Extract patterns, write skills | Claude Opus (runs daily at 8 PM UTC) |\n\n## Tech Stack\n\n- **Backend:** Python, FastAPI, LangGraph\n- **LLMs:** Claude, GPT, Llama, Qwen (via Together AI)\n- **Database:** PostgreSQL + pgvector for semantic skill retrieval\n- **Frontend:** React, TypeScript, Tailwind, Recharts\n- **Real-time:** WebSockets for live updates\n- **Deployment:** Tailscale Funnel for public access\n\n## Skills System\n\nThe Observer Agent writes learned patterns as structured Markdown skills:\n\n```\n.claude/skills/\n├── trading-wisdom/      # Core insights from live competition (M1)\n├── market-regimes/      # Regime-specific strategies (M1)\n├── risk-management/     # Position sizing, stop-losses (M1)\n├── entry-signals/       # Entry patterns with success rates (M1)\n├── forum-witness/       # Insights from forum discussions (M3)\n└── evolved-parameters/  # Optimal parameters from evolution (M3.5)\n```\n\nSkills are:\n- Versioned in PostgreSQL with content hashes\n- Searchable via embeddings (pgvector)\n- Refined over time as patterns are confirmed or contradicted\n- Generated from three sources: live trading, forum discussions, and genetic evolution\n\n## Project Structure\n\n```\nagent_arena/\n├── core/               # Stable core (arena, runner, models)\n├── agents/             # Agent implementations\n│   ├── observer_agent.py    # Watches & learns\n│   ├── skill_aware_*.py     # Applies learned skills\n│   ├── learning_*.py        # RAG-based learning\n│   └── *_trader.py          # Data generators\n├── agentic/            # LangGraph tools & memory\n├── providers/          # Kraken Futures market data\n├── storage/            # SQLite & PostgreSQL\n└── api/                # FastAPI + WebSocket\n\nfrontend/               # React dashboard\n.claude/skills/         # Learned trading skills\nconfigs/                # Competition configurations\n```\n\n## Configuration\n\n- `configs/production.yaml` — 12-agent production fleet on Kraken Futures (GPT-OSS-120B + Qwen3.5 + Claude Observer), 15-min ticks, ~$79/month\n- `configs/local_inference.yaml` — local-inference-only setup (vLLM/Ollama), no per-token cost\n- `configs/quick_test.yaml` — single-symbol smoke test\n\n## Documentation\n\n- `CLAUDE.md` - Development guide with M3.5 evolution integration\n- `OPERATIONS.md` - Production deployment\n- `TAILSCALE_FUNNEL.md` - Public access setup\n- `docs/M3.5_IMPLEMENTATION_SUMMARY.md` - M3.5 implementation details\n- `docs/review-2026-02-07-m3.5.md` - Code review findings (44 issues identified)\n\n## Development Status\n\n**Current Phase**: M3.5 Complete (Evolution Integration)\n\n**Known Issues**: See `docs/review-2026-02-07-m3.5.md` for comprehensive code review\n- 1 Critical bug (None-type formatting)\n- 3 High-priority issues (quartile calculation, type safety, scalability)\n- 40 Medium/Low improvements (architecture, performance, code style)\n\n**Roadmap**:\n- M4: Regime-specific evolution analysis\n- M4: Transfer validation tracking (backtest → live)\n- M5: Multi-run synthesis and semantic character clustering\n- M6: Auto-tuning feedback loop\n\n## License\n\nMIT\n",
  "bytes": 8243,
  "sha": "40c2033eedd84de1e34158576a71207cd4277d366e3933ee8280401350eacd52",
  "repo_slug": "0xhubed/agent-trading-arena",
  "fonte": "repo",
  "truncated": false,
  "api": "https://agentalog.com/api/listings/skl_0xhubed_agent_trading_arena_risk_managem_a4924760/readme"
}