<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE ArticleSet PUBLIC "-//NLM//DTD PubMed 2.7//EN" "https://dtd.nlm.nih.gov/ncbi/pubmed/in/PubMed.dtd">
<ArticleSet>
<Article>
<Journal>
				<PublisherName>دانشگاه شهید بهشتی</PublisherName>
				<JournalTitle>چشم انداز مدیریت مالی</JournalTitle>
				<Issn>2645-4637</Issn>
				<Volume>16</Volume>
				<Issue>1</Issue>
				<PubDate PubStatus="epublish">
					<Year>2026</Year>
					<Month>04</Month>
					<Day>21</Day>
				</PubDate>
			</Journal>
<ArticleTitle>Dynamic Portfolio Management in Cryptocurrency Markets: A Deep Reinforcement Learning Approach with a Risk-Sensitive Adaptive Agent Framework</ArticleTitle>
<VernacularTitle>مدیریت پویای پرتفوی رمز ارزها با استفاده از یادگیری تقویتی عمیق و چارچوب عامل تطبیقی حساس‌به‌ریسک</VernacularTitle>
			<FirstPage>101</FirstPage>
			<LastPage>131</LastPage>
			<ELocationID EIdType="pii">107259</ELocationID>
			
<ELocationID EIdType="doi">10.48308/jfmp.2026.243005.1564</ELocationID>
			
			<Language>FA</Language>
<AuthorList>
<Author>
					<FirstName>سعید</FirstName>
					<LastName>ایزی</LastName>
<Affiliation>دانشکده حسابداری و مالی</Affiliation>
<Identifier Source="ORCID">0009-0007-4492-2575</Identifier>

</Author>
<Author>
					<FirstName>عبدالرسول</FirstName>
					<LastName>مستاجران</LastName>
<Affiliation>عضو هیات علمی دانشکده علوم مالی، دانشگاه خوارزمی، تهران، ایران</Affiliation>
<Identifier Source="ORCID">0009-0001-0916-0110</Identifier>

</Author>
</AuthorList>
				<PublicationType>Journal Article</PublicationType>
			<History>
				<PubDate PubStatus="received">
					<Year>2025</Year>
					<Month>12</Month>
					<Day>24</Day>
				</PubDate>
			</History>
		<Abstract>Purpose: This study aims to propose and evaluate a dynamic framework for portfolio optimization in cryptocurrency markets that ensures an effective balance between return maximization and risk control under conditions of high volatility. The primary objective is to develop a risk-sensitive adaptive agent that integrates multiple baseline deep reinforcement learning agents with a dynamic switching mechanism to adjust asset weight allocations over time. This adaptive structure enables conservative behavior during highly volatile market regimes and more aggressive positioning during trending periods. The empirical analysis is conducted on a selected set of five major cryptocurrencies—Bitcoin, Ethereum, Solana, Ripple, and Tether—to assess the effectiveness and practical applicability of the proposed framework in real-world market environments.&lt;br&gt;&lt;br&gt;Method: Daily data spanning five years were collected from Yahoo Finance and, after data cleaning, were divided into training and testing sets using a 70%–30% split. The state representation comprised asset prices, trading volumes, and commonly used technical indicators. To capture long-term temporal dependencies, state encoding was implemented using a Transformer-based architecture. Two categories of methods were examined: (1) individual deep reinforcement learning agents—namely PPO, A2C, and DQN—each independently managing the portfolio; and (2) a risk-sensitive adaptive framework that dynamically switches among agents by monitoring short-term performance indicators such as rolling cumulative profit and loss and five-day moving volatility. The reward function incorporated risk-sensitive components, including a logarithmic utility of returns, a volatility penalty, and the Calmar ratio. Performance evaluation was conducted using cumulative return, annualized return, Sharpe ratio, Sortino ratio, Calmar ratio, and maximum drawdown.&lt;br&gt;&lt;br&gt;Findings: On the out-of-sample test dataset, the proposed risk-sensitive adaptive framework consistently outperformed each individual deep reinforcement learning agent. During non-trending market periods, the proposed model achieved higher terminal portfolio value and superior risk-adjusted performance compared to alternative methods. For instance, it recorded a Sharpe ratio of approximately 1.13 and a Sortino ratio of about 1.81. In bullish market regimes, the framework delivered markedly stronger results, achieving a Sharpe ratio of approximately 1.73, a Calmar ratio of around 3.34, and higher annualized returns, such that the final portfolio value during the uptrend was nearly twice that of the best-performing standalone agent. The quantitative results indicate that dynamic switching among aggressive, balanced, and conservative agents enhances the exploitation of favorable market trends while mitigating losses during highly volatile periods. Although a temporary increase in maximum drawdown was observed in certain scenarios, this effect was effectively offset by a reversion mechanism that shifts the agent back toward conservative behavior.&lt;br&gt;&lt;br&gt;Conclusion: Integrating a Transformer architecture for temporal feature extraction with a risk-sensitive adaptive agent framework provides an effective solution for dynamic portfolio management in cryptocurrency markets, particularly when the objective is to simultaneously enhance returns and control downside risk. The findings indicate that employing a dynamic switching mechanism among multiple deep reinforcement learning agents can significantly improve portfolio performance and stability when facing shifting market regimes. Furthermore, statistical significance analysis using the Wilcoxon Signed-Rank Test across ten independent random seeds confirmed that the proposed model significantly outperformed PPO, A2C, and DQN in all major performance metrics (p &lt; 0.01), demonstrating both robustness and reproducibility of the results.</Abstract>
			<OtherAbstract Language="FA">هدف : ارائه و ارزیابی چارچوبی پویا برای بهینه‌ سازی پرتفوی در بازار رمزارزها که توازن میان بازده و کنترل ریسک را در شرایط نوسانی زیاد تضمین کند. در این پژوهش هدف اصلی توسعه عامل تطبیقی حساس‌ به‌ ریسک است که با ترکیب چند عامل پایه یادگیری تقویتی عمیق و مکانیزم جابجایی پویا، تخصیص وزن دارایی‌ها را به‌صورت زمان‌ مند تنظیم کرده و رفتار محافظه‌ کارانه در دوره‌های پرنوسان و رفتار تهاجمی در دوره‌های رونددار را برقرار می‌سازد. دامنه تجربی شامل پنج رمزارز منتخب شامل بیت‌کوین، اتریوم، سولانا، ریپل و تتر است تا کارایی چارچوب در محیط‌های واقعی بازار ارزیابی شود.&lt;br&gt;&lt;br&gt;روش : داده‌های روزانه پنج ساله از پایگاه یاهو فایننس گردآوری و پس از پاک‌سازی با تقسیم ۷۰٪ برای آموزش و ۳۰٪ برای آزمون آماده شدند. نمایه حالت شامل قیمت‌ ها، حجم و شاخص‌های تکنیکال رایج بود و نمایش حالت با استفاده از معماری ترنسفورمر برای استخراج وابستگی‌ های بلندمدت زمانی صورت گرفت. دو دسته روش مورد بررسی قرار گرفت: 1- عوامل منفرد یادگیری تقویتی عمیق شامل PPO، A2C و DQN که هر یک مستقل پرتفوی را مدیریت می‌کنند و 2- چارچوب تطبیقی حساس‌به‌ریسک که با پایش معیارهای کوتاه‌مدت مانند سود و زیان تجمعی پنجره‌ای و نوسان متحرک پنج‌ روزه، بین عوامل سوئیچ می کند. تابع پاداش از مؤلفه‌ های حساس‌ به‌ ریسک شامل تابع مطلوبیت لگاریتمی بازده، جریمه برای نوسان و نسبت‌ کالمار تشکیل شد و معیارهای ارزیابی شامل بازده تجمعی، بازده سالیانه‌، نسبت شارپ، نسبت سورتینو، نسبت کالمار و حداکثر افت سرمایه بودند.&lt;br&gt;&lt;br&gt;یافته‌ها : در مجموعه داده‌های آزمایشی، چارچوب تطبیقی حساس‌ به‌ ریسک عملکرد برتری نسبت به هر یک از عوامل منفرد نشان داد. در دوره‌های بدون روند بازار، مدل پیشنهادی ارزش نهایی پرتفو و نسبت‌های تعدیل‌ شده بر ریسک بالاتری نسبت به سایر روش ها ثبت کرد. برای مثال نسبت شارپ ≈ 1.13، نسبت سورتینو ≈ 1.81 است و در دوره‌های صعودی بازار به‌ طور چشمگیری نسبت شارپ ≈ 1.73، نسبت کالمار ≈ 3.34 و بازده سالیانه‌ بالاتری ارائه داد؛ به‌طوری که ارزش نهایی پرتفو در دوره صعودی تقریباً دو برابر بهترین عامل مستقل شد. نتایج کمی نشان دادند که جابجایی پویا بین عوامل تهاجمی، متعادل و محافظه‌کار موجب افزایش بهره‌برداری از روندهای مثبت و کاهش زیان در دوره‌های پرنوسان گردید، هرچند افت حداکثر در برخی سناریوها افزایشی مقطعی نشان داد که با مکانیسم بازگشتی به رفتار محافظه‌کار جبران شد.&lt;br&gt;&lt;br&gt;نتیجه‌گیری : ترکیب معماری ترنسفورمر برای استخراج ویژگی‌های زمانی با چارچوب عامل تطبیقی حساس‌ به‌ ریسک، راهکار مؤثری برای مدیریت پویای پرتفوی در بازار رمزارزها ارائه می‌دهد؛ به‌ویژه زمانی که هدف، افزایش بازده و کنترل ریسک نزولی به طور همزمان است . یافته‌ ها نشان می‌دهد استفاده از مکانیسم سوئیچ پویا میان چند عامل یادگیری تقویتی عمیق می‌تواند کارایی و پایداری پرتفو را در مواجهه با تغییر رژیم‌های بازار به‌ طور معنا‌داری بهبود بخشد. همچنین، نتایج آزمون رتبه علامت ویلکاکسون بر پایه ده اجرای مستقل نشان داد که برتری مدل پیشنهادی نسبت به مدل‌های PPO، A2C و DQN در تمامی شاخص‌های اصلی عملکرد از نظر آماری معنادار است (01/0&gt;P). این یافته بیانگر پایداری، استحکام و قابلیت تکرارپذیری نتایج مدل پیشنهادی بوده و نشان می‌دهد که عملکرد برتر آن صرفاً ناشی از نوسانات تصادفی فرآیند آموزش نیست.</OtherAbstract>
		<ObjectList>
			<Object Type="keyword">
			<Param Name="value">مدیریت پرتفو تطبیقی</Param>
			</Object>
			<Object Type="keyword">
			<Param Name="value">یادگیری تقویتی عمیق</Param>
			</Object>
			<Object Type="keyword">
			<Param Name="value">عامل تطبیقی حساس‌به‌ریسک</Param>
			</Object>
			<Object Type="keyword">
			<Param Name="value">مدیریت ریسک</Param>
			</Object>
			<Object Type="keyword">
			<Param Name="value">بازار پرنوسان رمزارز</Param>
			</Object>
		</ObjectList>
<ArchiveCopySource DocType="pdf">https://jfmp.sbu.ac.ir/article_107259_98ad5fd2c787eb91c5d5ceafbaf1ff51.pdf</ArchiveCopySource>
</Article>
</ArticleSet>
