آرگو یک عامل یادگیری تقویتی مبتنی بر Double-DQN است که بهصورت شبانهروزی چهار بازار فیوچرز اهرمدار را رصد میکند و پیش از باز کردن، نگهداشتن یا بستن هر موقعیت، ۷۴ سیگنال زنده را میسنجد. ARGO is a Double-DQN reinforcement-learning agent that watches four leveraged futures markets around the clock, weighing 74 live signals before it opens, holds, or closes a position.
از دادهی خام کندل تا یک اقدام واحد و قابل توضیح.From a raw candle to a single, explainable action.
هر کندل ۴ساعته در بازارهای تتر/ریال، اتریوم، بیتکوین و سوی، پیش از هر اقدام دیگری دریافت و پاکسازی میشود.Every 4-hour candle across USDT/IRT, ETH, BTC and SUI is pulled and cleaned before anything else happens.
رفتار خام قیمت به ۶۶ اندیکاتور تکنیکال بهعلاوه ۶ ویژگی موقعیتآگاه — فاصله تا حد ضرر، سود و زیان باز، تعداد کندلهای نگهداشتهشده — تبدیل میشود.Raw price action becomes 66 technical indicators plus 6 position-aware features — distance to stop, unrealized P&L, bars held — so the model always knows exactly where it stands.
یک شبکهی Double-DQN چهار اقدام — لانگ، شورت، نگهداشتن، بستن — را امتیازدهی میکند؛ آموزشدیده روی بافری با بازپخش اولویتدار.A Double-DQN network scores four actions — open long, open short, hold, close — trained against a prioritized replay buffer that revisits its most instructive trades.
هر موقعیت با یک حد ضرر، حد سود و محافظ نقدشوندگی همراه است که در لحظهی ورود محاسبه میشود.Every position carries a stop-loss, take-profit and liquidation guard computed at entry — the model can be wrong without the account being ruined.
نتیجه دوباره در حافظه ثبت میشود و برای بازآموزی شبکه استفاده میشود؛ همان عاملی که دیروز معامله کرد، دقیقاً همان عاملی نیست که امروز معامله میکند.The outcome is written back into memory and used to retrain the network — the agent that traded yesterday isn't quite the one trading today.
شش مؤلفهای که رفتار عامل را قابلاتکا نگه میدارند.Six components that keep the agent's behavior dependable.
انتخاب اقدام را از ارزیابی آن جدا میکند تا بیشبرآورد رایج در Q-learning ساده کاهش یابد.Decouples action selection from evaluation to curb the overestimation that plagues plain Q-learning.
از انتقالهای غافلگیرکننده بیشتر میآموزد و فهرستی دائمی از بهترین اپیزودهای خود را نگه میدارد.Learns more from surprising transitions, and keeps a permanent shortlist of its best-performing episodes.
یک تابع پاداش واحد انگیزههای باز کردن، نگهداشتن و بستن را متعادل میکند.One reward function balances open, hold and close incentives so the agent isn't tempted to overtrade or freeze.
حد ضرر، حد سود، محافظ اضطراری نقدشوندگی و یک شبکهی ایمنی بازگشتی برای واگرایی نتایج زنده.Stop-loss, take-profit, an emergency liquidation guard, and a rollback net that restores the last validated model if live results diverge.
نرخ اکتشاف و نرخ یادگیری هر دو از چرخههای ریاستارت گرم پیروی میکنند.Exploration and learning rate both follow warm-restart cycles, so the agent keeps probing instead of settling too early.
چهار عامل مستقل بهصورت موازی اجرا میشوند؛ هرکدام با وضعیت، حافظه و محدودیت ریسک خاص خود.Four independent agents run in parallel threads, each with its own state, memory and risk limits.
هر مدل پیش از آنکه برای گرفتن موقعیت مورد اعتماد قرار گیرد، روی دادهای که هرگز روی آن آموزش ندیده اعتبارسنجی میشود. معاملات فیوچرز اهرمدار ریسک واقعی از دست دادن سریع و کامل سرمایه دارد — آرگو یک پروژهی تحقیقاتی آزمایشی است، نه مشاورهی مالی، و عملکرد شبیهسازیشدهی گذشته نشاندهندهی نتایج آینده نیست. Every model is validated on data it never trained on before it's trusted with a position. Leveraged futures trading carries a real risk of rapid, total loss of capital — ARGO is an experimental research project, not financial advice, and past simulated performance does not predict future results.