Ανάπτυξη συστήματος αυτόματης ενδοημερήσιας διαπραγμάτευσης με αρχιτεκτονική Dueling Deep Q-Network και ενσωμάτωση του δείκτη VWAP

Development of an Automated Intraday Trading System Using a Dueling Deep Q-Network Architecture and VWAP Integration (Αγγλική)

  1. Bachelor’s thesis
  2. ΑΘΑΝΑΣΙΟΣ ΧΑΜΠΕΟΣ
  3. Πληροφορική (ΠΛΗ)
  4. 18 Ιουλίου 2026
  5. Ελληνικά
  6. 103
  7. Δρ. Ευστράτιος Γεωργόπουλος
  8. Δρ. Πλαγιανάκος Βασίλειος | Δρ. Αναγνωστόπουλος Χρήστος – Νικόλαος
  9. Τεχνητή νοημοσύνη | Ενισχυτική Μάθηση | Deep Reinforcement Learning | Dueling Deep Q-Network | Αλγοριθμική Διαπραγμάτευση | VWAP
  10. Πληροφορική
  11. 1
  12. 45
  13. Δημιουργία αλγορίθμου για αυτόματη αγοραπωλησία μετοχών μέσα στην ημέρα για το δείκτη S&P 500 / Λέανδρος Καϊπής
    • Η τεχνητή νοημοσύνη αποτελεί βασικό παράγοντα καινοτομίας στον τομέα των χρηματοοικονομικών, επηρεάζοντας σημαντικά τον τρόπο με τον οποίο αναλύονται τα δεδομένα της αγοράς και λαμβάνονται επενδυτικές αποφάσεις. Ιδιαίτερα, οι μέθοδοι ενισχυτικής μάθησης προσφέρουν ένα δυναμικό πλαίσιο για την ανάπτυξη συστημάτων που μπορούν να προσαρμόζονται σε μεταβαλλόμενες συνθήκες και να βελτιστοποιούν τη στρατηγική τους μέσω εμπειρίας.

      Η παρούσα εργασία διερευνά την εφαρμογή της ενισχυτικής μάθησης στο πρόβλημα της αυτόματης διαπραγμάτευσης μετοχών, αντιμετωπίζοντας τη διαδικασία ως πρόβλημα διαδοχικής λήψης αποφάσεων. Στο πλαίσιο αυτό, αναπτύσσεται ένας πράκτορας βασισμένος στην αρχιτεκτονική Dueling Deep Q-Network (Dueling DQN), ο οποίος εκπαιδεύεται σε προσομοιωμένο περιβάλλον ενδοημερήσιας διαπραγμάτευσης.

      Η μεθοδολογία περιλαμβάνει τον σχεδιασμό περιβάλλοντος που αναπαριστά τη δυναμική της αγοράς μέσω ιστορικών δεδομένων τιμών και όγκου συναλλαγών, καθώς και τον ορισμό συνάρτησης ανταμοιβής βασισμένης στη μεταβολή της αξίας του χαρτοφυλακίου (Profit and Loss – PnL). Ιδιαίτερη έμφαση δίνεται στην ενσωμάτωση του δείκτη Volume-Weighted Average Price (VWAP) ως πρόσθετου χαρακτηριστικού στο διάνυσμα κατάστασης του πράκτορα, με στόχο τη διερεύνηση της επίδρασής του στη διαδικασία λήψης αποφάσεων.

      Η αξιολόγηση της προτεινόμενης προσέγγισης πραγματοποιείται μέσω δύο διακριτών πειραματικών σεναρίων και συγκριτικών πειραμάτων μεταξύ των εκδοχών BASE και VWAP, με στόχο τη διερεύνηση της επίδρασης της ενσωμάτωσης του δείκτη VWAP στη στρατηγική συμπεριφορά και στη συνολική απόδοση του πράκτορα. Τα αποτελέσματα δείχνουν ότι ο πράκτορας είναι ικανός να αναπτύσσει αποτελεσματικές στρατηγικές ενδοημερήσιας διαπραγμάτευσης, ενώ η ενσωμάτωση των χαρακτηριστικών VWAP διαφοροποιεί τη διαδικασία λήψης αποφάσεων χωρίς να οδηγεί συστηματικά σε υψηλότερη τελική απόδοση.

    • Artificial Intelligence has become a key driver of innovation in the financial sector, significantly influencing the way market data are analyzed and investment decisions are made. In particular, reinforcement learning provides a powerful framework for developing adaptive systems that improve their performance through interaction with dynamic environments.

      This study investigates the application of reinforcement learning to the problem of automated stock trading, treating it as a sequential decision-making process under uncertainty. In this context, a trading agent based on the Dueling Deep Q-Network (Dueling DQN) architecture is developed and trained within a simulated intraday trading environment.

      The proposed methodology includes the design of a trading environment that models market dynamics using historical price and volume data, as well as the definition of a reward function based on changes in portfolio value (Profit and Loss – PnL). Special emphasis is placed on the integration of the Volume-Weighted Average Price (VWAP) as an additional feature in the agent’s state representation, aiming to investigate its impact on the decision-making process.

      The proposed approach is evaluated through two experimental scenarios and comparative experiments between the BASE and VWAP configurations, investigating the effect of including VWAP as an additional state feature on both the agent's trading behaviour and overall performance. The results show that the Dueling DQN agent is capable of learning effective intraday trading strategies, while the inclusion of VWAP-derived features influences the agent's decision-making behaviour without consistently improving the final trading performance.

  14. Hellenic Open University
  15. Αναφορά Δημιουργού-Μη Εμπορική Χρήση 4.0 Διεθνές