NCKH – Pilot Scale
Reinforcement Learning
Reinforcement Learning (RL) Forecast Dashboard
Policy-based forecaster that evaluates control-style actions from telemetry historyLast updated:
Weather Data Source – Web API (Open-Meteo)
Air Temperature31,03°C
Air Humidity71,65%
Wind Speed13,82 km/h
Rainfall0,26 mm
ConditionsSunny intervals
Weather Data Source – Field Sensor (Sensor)
Air Temperature31,03 °C
Air Humidity71,65 %
Wind Speed13,82 km/h
Rainfall0,26 mm
ConditionsSunny intervals
Water Temperature (°C)
28,22PH Parameter
7,97DO (mg/L)
6,75Turbidity (NTU)
4,11Air Temperature (°C)
31,03Air Humidity (%)
71,65Wind Speed (km/h)
13,82Rainfall (mm)
0,26Water Temperature (°C)
PH Parameter
Dissolved Oxygen (mg/L)
Turbidity (NTU)
Salinity (ppt)
TDS (mg/L)
ORP (mV)
Water Temperature (°C)
25,1PH Parameter
7,52DO (mg/L)
7,51Turbidity (NTU)
2,56Air Temperature (°C)
31,03Air Humidity (%)
71,65Wind Speed (km/h)
13,82Rainfall (mm)
0,26Water Temperature (°C)
PH Parameter
Dissolved Oxygen (mg/L)
Turbidity (NTU)
Salinity (ppt)
TDS (mg/L)
ORP (mV)
MAE
0.126
RMSE
0.176
R²
0.955
MAPE (%)
2.04
Training Loss vs Validation Loss MSE per epoch
MAE Convergence by Epoch
R² Score theo Epoch
Predicted vs Actual – Scatter (Temperature °C)
Model Architecture – Reinforcement Learning (RL)
Reinforcement Learning Policy Network
- State: multi-sensor window (temperature, pH, DO, turbidity, weather)
- Policy backbone: 3 x Dense(96), ReLU activation
- Action: next-step parameter adjustment
- Reward: +stability, +threshold compliance, -overshoot
- Training style: offline replay buffer + periodic online update
- Loss: policy + value objectives (actor-critic style)
Control-Oriented Design
- Adaptive to short-term pond dynamics
- Balances trend-following and stabilization
- Penalty for threshold crossing risk
- Uses weather context as exogenous signal
- Supports continual policy improvement from telemetry