بازار منتظر نمی‌ماند؛ مدل هم همین‌طور. Markets don't wait. Neither does the model.

آرگو یک عامل یادگیری تقویتی مبتنی بر Double-DQN است که به‌صورت شبانه‌روزی چهار بازار فیوچرز اهرم‌دار را رصد می‌کند و پیش از باز کردن، نگه‌داشتن یا بستن هر موقعیت، ۷۴ سیگنال زنده را می‌سنجد. ARGO is a Double-DQN reinforcement-learning agent that watches four leveraged futures markets around the clock, weighing 74 live signals before it opens, holds, or closes a position.

زنده — کاغذیLIVE — PAPER 240m · 5x
آخرین به‌روزرسانی توسط عامل DQN · شبیه‌سازی نمایشی Last update from DQN agent · illustrative simulation
74
ویژگی وضعیت رصدشدهstate features tracked
حداکثر اهرمmaximum leverage
4
بازار، یک سیاستmarkets, one policy
24/7
فعالیت بدون وقفهunattended operation

یک تصمیم چطور شکل می‌گیردHow a decision gets made

از داده‌ی خام کندل تا یک اقدام واحد و قابل توضیح.From a raw candle to a single, explainable action.

01

خواندن بازارRead the tape

هر کندل ۴ساعته در بازارهای تتر/ریال، اتریوم، بیت‌کوین و سوی، پیش از هر اقدام دیگری دریافت و پاک‌سازی می‌شود.Every 4-hour candle across USDT/IRT, ETH, BTC and SUI is pulled and cleaned before anything else happens.

02

مهندسی سیگنالEngineer the signal

رفتار خام قیمت به ۶۶ اندیکاتور تکنیکال به‌علاوه ۶ ویژگی موقعیت‌آگاه — فاصله تا حد ضرر، سود و زیان باز، تعداد کندل‌های نگه‌داشته‌شده — تبدیل می‌شود.Raw price action becomes 66 technical indicators plus 6 position-aware features — distance to stop, unrealized P&L, bars held — so the model always knows exactly where it stands.

03

سنجش گزینه‌هاWeigh the options

یک شبکه‌ی Double-DQN چهار اقدام — لانگ، شورت، نگه‌داشتن، بستن — را امتیازدهی می‌کند؛ آموزش‌دیده روی بافری با بازپخش اولویت‌دار.A Double-DQN network scores four actions — open long, open short, hold, close — trained against a prioritized replay buffer that revisits its most instructive trades.

04

محافظت از ریسکGuard the downside

هر موقعیت با یک حد ضرر، حد سود و محافظ نقدشوندگی همراه است که در لحظه‌ی ورود محاسبه می‌شود.Every position carries a stop-loss, take-profit and liquidation guard computed at entry — the model can be wrong without the account being ruined.

05

عمل کن، سپس بیاموزAct, then learn

نتیجه دوباره در حافظه ثبت می‌شود و برای بازآموزی شبکه استفاده می‌شود؛ همان عاملی که دیروز معامله کرد، دقیقاً همان عاملی نیست که امروز معامله می‌کند.The outcome is written back into memory and used to retrain the network — the agent that traded yesterday isn't quite the one trading today.

ساخته‌شده برای بازاری که خطا را نمی‌بخشدBuilt for a market that doesn't forgive

شش مؤلفه‌ای که رفتار عامل را قابل‌اتکا نگه می‌دارند.Six components that keep the agent's behavior dependable.

Double DQN

انتخاب اقدام را از ارزیابی آن جدا می‌کند تا بیش‌برآورد رایج در Q-learning ساده کاهش یابد.Decouples action selection from evaluation to curb the overestimation that plagues plain Q-learning.

بازپخش اولویت‌دار + حافظه‌ی برگزیدهPrioritized Replay + Elite Memory

از انتقال‌های غافلگیرکننده بیشتر می‌آموزد و فهرستی دائمی از بهترین اپیزودهای خود را نگه می‌دارد.Learns more from surprising transitions, and keeps a permanent shortlist of its best-performing episodes.

شکل‌دهی پاداش یکپارچهUnified Reward Shaping

یک تابع پاداش واحد انگیزه‌های باز کردن، نگه‌داشتن و بستن را متعادل می‌کند.One reward function balances open, hold and close incentives so the agent isn't tempted to overtrade or freeze.

موتور ریسکRisk Engine

حد ضرر، حد سود، محافظ اضطراری نقدشوندگی و یک شبکه‌ی ایمنی بازگشتی برای واگرایی نتایج زنده.Stop-loss, take-profit, an emergency liquidation guard, and a rollback net that restores the last validated model if live results diverge.

تطبیق چرخه‌ایCyclic Adaptation

نرخ اکتشاف و نرخ یادگیری هر دو از چرخه‌های ری‌استارت گرم پیروی می‌کنند.Exploration and learning rate both follow warm-restart cycles, so the agent keeps probing instead of settling too early.

موتور چندبازارهMulti-Asset Engine

چهار عامل مستقل به‌صورت موازی اجرا می‌شوند؛ هرکدام با وضعیت، حافظه و محدودیت ریسک خاص خود.Four independent agents run in parallel threads, each with its own state, memory and risk limits.

!

نظم پیش از استقرارDiscipline before deployment

هر مدل پیش از آن‌که برای گرفتن موقعیت مورد اعتماد قرار گیرد، روی داده‌ای که هرگز روی آن آموزش ندیده اعتبارسنجی می‌شود. معاملات فیوچرز اهرم‌دار ریسک واقعی از دست دادن سریع و کامل سرمایه دارد — آرگو یک پروژه‌ی تحقیقاتی آزمایشی است، نه مشاوره‌ی مالی، و عملکرد شبیه‌سازی‌شده‌ی گذشته نشان‌دهنده‌ی نتایج آینده نیست. Every model is validated on data it never trained on before it's trusted with a position. Leveraged futures trading carries a real risk of rapid, total loss of capital — ARGO is an experimental research project, not financial advice, and past simulated performance does not predict future results.