<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
  <channel>
    <title>Hippo's data</title>
    <link>https://hipposdata.tistory.com/</link>
    <description>하이룽 ^^</description>
    <language>ko</language>
    <pubDate>Mon, 27 Jul 2026 05:47:18 +0900</pubDate>
    <generator>TISTORY</generator>
    <ttl>100</ttl>
    <managingEditor>Hippo's data</managingEditor>
    <image>
      <title>Hippo's data</title>
      <url>https://tistory1.daumcdn.net/tistory/4735281/attach/cb004df78e71417a8471daad22f1bbff</url>
      <link>https://hipposdata.tistory.com</link>
    </image>
    <item>
      <title>[Paper review] CSDI</title>
      <link>https://hipposdata.tistory.com/entry/CSDI</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Paper:&lt;/b&gt; CSDI: Conditional Score-based Diffusion Models for Probabilistic Time Series Imputation (Yusuke Tashiro et al.)&lt;br /&gt;&lt;b&gt;Conference:&lt;/b&gt; NeurIPS 2021&lt;br /&gt;&lt;b&gt;GitHub Repository:&lt;/b&gt;&lt;a href=&quot;https://github.com/ermongroup/CSDI&quot;&gt;https://github.com/ermongroup/CSDI&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1773047146403&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - ermongroup/CSDI: Codes for &amp;quot;CSDI: Conditional Score-based Diffusion Models for Probabilistic Time Series Imputation&amp;quot;&quot; data-og-description=&quot;Codes for &amp;quot;CSDI: Conditional Score-based Diffusion Models for Probabilistic Time Series Imputation&amp;quot; - ermongroup/CSDI&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/ermongroup/CSDI&quot; data-og-url=&quot;https://github.com/ermongroup/CSDI&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/HDxMX/dJMb9cBGeRZ/YDK5MrMCoBVLQklaMkXbek/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/b4II2o/dJMb8UHNiPo/v0gUhQLi6BIMC1yylmrCf0/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/ermongroup/CSDI&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/ermongroup/CSDI&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/HDxMX/dJMb9cBGeRZ/YDK5MrMCoBVLQklaMkXbek/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/b4II2o/dJMb8UHNiPo/v0gUhQLi6BIMC1yylmrCf0/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - ermongroup/CSDI: Codes for &quot;CSDI: Conditional Score-based Diffusion Models for Probabilistic Time Series Imputation&quot;&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Codes for &quot;CSDI: Conditional Score-based Diffusion Models for Probabilistic Time Series Imputation&quot; - ermongroup/CSDI&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;ArXiv:&lt;/b&gt; &lt;a href=&quot;https://arxiv.org/abs/2107.03502&quot;&gt;https://arxiv.org/abs/2107.03502&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1773047147595&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;CSDI: Conditional Score-based Diffusion Models for Probabilistic Time Series Imputation&quot; data-og-description=&quot;The imputation of missing values in time series has many applications in healthcare and finance. While autoregressive models are natural candidates for time series imputation, score-based diffusion models have recently outperformed existing counterparts in&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2107.03502&quot; data-og-url=&quot;https://arxiv.org/abs/2107.03502v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/b5AQlx/dJMb8YpTznB/ALIVPk9iSh51NSb0tELKI1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/KxCLn/dJMb86nVF5b/thgCHOfd3In91SCEYxooK0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2107.03502&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2107.03502&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/b5AQlx/dJMb8YpTznB/ALIVPk9iSh51NSb0tELKI1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/KxCLn/dJMb86nVF5b/thgCHOfd3In91SCEYxooK0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;CSDI: Conditional Score-based Diffusion Models for Probabilistic Time Series Imputation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;The imputation of missing values in time series has many applications in healthcare and finance. While autoregressive models are natural candidates for time series imputation, score-based diffusion models have recently outperformed existing counterparts in&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&amp;rarr; &lt;b&gt;Time-series imputation&lt;/b&gt; 에 &lt;b&gt;Diffusion 기법&lt;/b&gt;을 도입&lt;/span&gt;&lt;/p&gt;
&lt;h1&gt;1. SUMMARIZE&lt;/h1&gt;
&lt;table id=&quot;306bd201-015f-80c5-867e-d30c86b2b760&quot; style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style12&quot;&gt;
&lt;tbody&gt;
&lt;tr id=&quot;306bd201-015f-8099-8358-ff5407439404&quot;&gt;
&lt;td id=&quot;Nhn\&quot; style=&quot;width: 14.5348%;&quot;&gt;&lt;b&gt;항목&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;Y&amp;lt;Xj&quot; style=&quot;width: 85.4652%;&quot;&gt;&lt;b&gt;핵심 내용&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;306bd201-015f-80bb-9fce-ea6fddfbd958&quot;&gt;
&lt;td id=&quot;Nhn\&quot; style=&quot;width: 14.5348%;&quot;&gt;&lt;b&gt;Problem&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;Y&amp;lt;Xj&quot; style=&quot;width: 85.4652%;&quot;&gt;&lt;b&gt;기존 시계열 결측치 대체(Imputation) 모델 한계&lt;/b&gt;&lt;br /&gt;&amp;bull; 기존 &lt;b&gt;결정론적&lt;/b&gt;(Deterministic) 방식은 &lt;b&gt;하나의 값만 예측 &amp;rarr;&lt;/b&gt; &lt;b&gt;불확실성(Uncertainty) 측정할 수 없음&lt;/b&gt;&lt;br /&gt;&amp;bull; VAE, GAN 기반의 기존 &lt;b&gt;확률론적&lt;/b&gt;(Probabilistic) 모델 &amp;rarr; &lt;b&gt;시간적(Temporal) 의존성과 변수(Feature) 간의 상관관계&lt;/b&gt;를 동시에 포착하는 데 어려움&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;306bd201-015f-802b-b5b3-cde6334ccf83&quot;&gt;
&lt;td id=&quot;Nhn\&quot; style=&quot;width: 14.5348%;&quot;&gt;&lt;b&gt;Method&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;Y&amp;lt;Xj&quot; style=&quot;width: 85.4652%;&quot;&gt;&lt;b&gt;CSDI (Conditional Score-based Diffusion Imputation)&lt;/b&gt;&lt;br /&gt;&lt;b&gt;1. 조건부 확산 모델 (Conditional Diffusion Model)&lt;/b&gt;&lt;br /&gt;&amp;bull; 결측치 대체를 &lt;b&gt;조건부 생성 문제&lt;/b&gt;로 정의.&lt;br /&gt;&amp;bull; &lt;b&gt;관측된 데이터&lt;/b&gt;(Observed values)를 &lt;b&gt;조건&lt;/b&gt;(Condition)으로 삼아, 노이즈가 낀 결측치(Missing values)를 역확산(Reverse process) 과정을 통해 점진적으로 복원&lt;br /&gt;&lt;br /&gt;&lt;b&gt;2. Transformer 기반 2D Attention&lt;/b&gt;&lt;br /&gt;&amp;bull; &lt;b&gt;Temporal Attention:&lt;/b&gt; 시간 축(Time steps) &amp;rarr; 시점간 의존성 모델링&lt;br /&gt;&amp;bull; &lt;b&gt;Feature Attention:&lt;/b&gt; 다변량 데이터의 여러 변수(Features) 간 상관관계 모델링&lt;br /&gt;&lt;br /&gt;&lt;b&gt;3. 학습 및 추론 (Training &amp;amp; Inference)&lt;/b&gt;&lt;br /&gt;&amp;bull; 관측된 데이터 중 일부를 인위적으로 마스킹(Masking)하여 타겟으로 삼고, 이를 복원하는 방식으로 &lt;b&gt;자기 지도 학습(Self-supervised learning)&lt;/b&gt; 수행&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;306bd201-015f-80a9-a4f4-c8f0b55b51a6&quot;&gt;
&lt;td id=&quot;Nhn\&quot; style=&quot;width: 14.5348%;&quot;&gt;&lt;b&gt;Results&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;Y&amp;lt;Xj&quot; style=&quot;width: 85.4652%;&quot;&gt;&lt;b&gt;다양한 시계열 벤치마크에서 SOTA 달성&lt;/b&gt;&lt;br /&gt;&amp;bull; &lt;b&gt;시계열 예측(Forecasting), 보간(Interpolation)&lt;/b&gt; 우수한 성능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;306bd201-015f-80d8-9242-c500e1bf1170&quot;&gt;
&lt;td id=&quot;Nhn\&quot; style=&quot;width: 14.5348%;&quot;&gt;&lt;b&gt;Contribution&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;Y&amp;lt;Xj&quot; style=&quot;width: 85.4652%;&quot;&gt;&amp;bull; 시계열 결측치 대체(Imputation) 문제에 &lt;b&gt;스코어 기반 확산 모델(Diffusion Model)을 최초로 적용&lt;/b&gt;&lt;br /&gt;&amp;bull; 시간과 변수 축을 모두 고려 -&lt;b&gt;2D Attention 아키텍처&lt;/b&gt;를 제안 &lt;br /&gt;&amp;bull; 다수의 샘플링 &amp;rarr; 결측치에 대한 신뢰 구간(Confidence Interval) &amp;rarr; &lt;b&gt;확률론적 방법론&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h1&gt;2. DETAIL&lt;/h1&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;1. Introduction&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;CSDI 제안&lt;/b&gt; &amp;rarr; Score-based &lt;b&gt;Diffusion Models&lt;/b&gt;을 conditional 방식으로 확장 &amp;rarr; 관측값(condition)으로 부터 누락된 값 추정&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 기존 모델 대비 좋은 성능 달성&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;2. RELATED WORK&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;딥러닝 기반 imputation&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;통계적 방법보다 더 정확&lt;/li&gt;
&lt;li&gt;초기 RNN계열(RNN, LSTM, GRU)&lt;/li&gt;
&lt;li&gt;RNN계열 + GAN, self-training, Attention 메커니즘 기법들 결합&lt;/li&gt;
&lt;li&gt;&lt;b&gt;결정론적&lt;/b&gt;(Deterministic, &lt;b&gt;특정 값 추정)&lt;/b&gt; 뿐만 아니라 &lt;b&gt;확률적&lt;/b&gt;(Probabilistic, &lt;b&gt;분포 추정&lt;/b&gt;) &lt;b&gt;Imputation&lt;/b&gt; 방식 개발&lt;/li&gt;
&lt;/ul&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 572px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 572px;&quot;&gt;
&lt;td style=&quot;width: 100%; height: 572px;&quot;&gt;&lt;span&gt;&lt;b&gt;   score-based generative model&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc; color: #333333; text-align: start;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;생성모델 목적&lt;/b&gt;: 실제 데이터 확률분포 찾기&lt;/li&gt;
&lt;li&gt;&lt;b&gt;정의&lt;/b&gt;: 데이터의 확률 분포 p(x)자체를 직접 계산하는 대신, 데이터가 밀집된 방향(Gradient)을 학습하여 새로운 데이터를 생성해 내는 모델
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;고차원에서는 실제 데이터 확률분포 계산 불가능 &amp;rarr; Score 이용&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;한계점:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;확률분포 정의시, 모든 확률합 1로 만들어주는 Z(Normalization constant)가 정의되어야 하지만 고차원에서 Closed-form으로 계산 불가능&lt;/li&gt;
&lt;li&gt;Score 도입&lt;/li&gt;
&lt;li&gt;&lt;i&gt;$\text{Score} := \nabla_x \log p(x)$*&lt;/i&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;&amp;rarr; 현재 데이터 x에서 확률분포 p(x)가 가장 가파르게 커지는 방향(기울기)&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;DDPM&lt;/b&gt;: 잉크의 확산(Diffusion)에서 영감받아, 데이터에&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;노이즈를 점진적으로 더하고 다시 걷어내는 과정(Markov Chain)으로 접근&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Score-based 모델&lt;/b&gt;: model: 분포의 기울기(Score)를 직접 추정&lt;/li&gt;
&lt;/ul&gt;
&lt;span&gt;&amp;rarr; DDPM, Score-based 모델&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;사실상 같은 모델&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;(확률미분방정식SDE &amp;rarr; 증명)&lt;/span&gt;&lt;br /&gt;&lt;span&gt;노이즈 예측 = Score 계산&lt;br /&gt;&lt;b&gt;Score-Based Generative Modeling through Stochastic Differential Equations&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&lt;a href=&quot;https://arxiv.org/abs/2011.13456&quot;&gt;https://arxiv.org/abs/2011.13456&lt;/a&gt;&lt;/span&gt;&lt;br /&gt;&lt;br /&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;aside&gt;&lt;/aside&gt;
&lt;figure id=&quot;og_1773047203239&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Score-Based Generative Modeling through Stochastic Differential Equations&quot; data-og-description=&quot;Creating noise from data is easy; creating data from noise is generative modeling. We present a stochastic differential equation (SDE) that smoothly transforms a complex data distribution to a known prior distribution by slowly injecting noise, and a corre&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2011.13456&quot; data-og-url=&quot;https://arxiv.org/abs/2011.13456v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/BUIgW/dJMb9kmaVh8/K3Pt9V2kmFpAqopBTdLG4k/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bXyVvR/dJMb8YpTzol/cVIDX1SjK2AQygCtnfznPk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2011.13456&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2011.13456&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/BUIgW/dJMb9kmaVh8/K3Pt9V2kmFpAqopBTdLG4k/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bXyVvR/dJMb8YpTzol/cVIDX1SjK2AQygCtnfznPk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Score-Based Generative Modeling through Stochastic Differential Equations&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Creating noise from data is easy; creating data from noise is generative modeling. We present a stochastic differential equation (SDE) that smoothly transforms a complex data distribution to a known prior distribution by slowly injecting noise, and a corre&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Diffusion model 도입&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;해당 시기 &lt;b&gt;Diffusion modeld은 비조건부 모델&lt;/b&gt; (imputation은 특정 조건하에 결측치 추정)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;TimeGrad&lt;/b&gt; &amp;rarr; Diffusion model을 시계열 예측에 도입
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;RNN 구조 사용으로 impution에는 부적합(과거&amp;rarr;미래 시간의존성)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;3. Background&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;3.1 Multivariate time series imputation&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 다변량 시계열 imputation 수식적 세팅&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$X = {x_{1:K,1:L}} &amp;isin; R^{K&amp;times;L}$&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;X: 시계열 데이터&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;K: 피쳐 수&lt;/li&gt;
&lt;li&gt;L: 시계열 길이(length)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$M = {m_{1:K,1:L}} &amp;isin; {{0, 1}}^{K&amp;times;L}$&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;M: 관측된 마스크(observation mask)&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;$m_{k,l}=0$ : 누락&lt;/li&gt;
&lt;li&gt;$m_{k,l}=1$ : 관측&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$s = {s_{1:L}} \in \mathbb{R}^L$&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;s: 시점(time stamp)&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Imputation 정의&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;보간&lt;/b&gt;(&lt;b&gt;interpolation&lt;/b&gt; - 중간 시점 누락 채우기), &lt;b&gt;예측&lt;/b&gt;(&lt;b&gt;forecasting&lt;/b&gt; - 미래 시점 누락 채우기) 포함하는 포괄적인 개념&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;3.2 Denoising diffusion probabilistic models&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;DDPM&lt;/b&gt;(Denoising diffusion probabilistic models)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2006.11239&quot;&gt;https://arxiv.org/abs/2006.11239&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1773047211608&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Denoising Diffusion Probabilistic Models&quot; data-og-description=&quot;We present high quality image synthesis results using diffusion probabilistic models, a class of latent variable models inspired by considerations from nonequilibrium thermodynamics. Our best results are obtained by training on a weighted variational bound&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2006.11239&quot; data-og-url=&quot;https://arxiv.org/abs/2006.11239v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/cNVb6o/dJMb9aKDfDw/4KOZ5OaGwGKtikhVrZfcU0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bswBjP/dJMb9efb481/FocSKACgp06a92ShlHrpbk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2006.11239&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2006.11239&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/cNVb6o/dJMb9aKDfDw/4KOZ5OaGwGKtikhVrZfcU0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bswBjP/dJMb9efb481/FocSKACgp06a92ShlHrpbk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Denoising Diffusion Probabilistic Models&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We present high quality image synthesis results using diffusion probabilistic models, a class of latent variable models inspired by considerations from nonequilibrium thermodynamics. Our best results are obtained by training on a weighted variational bound&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Forward process:&lt;/b&gt; 원본 데이터에서 가우시안 &lt;b&gt;노이즈를 추가&lt;/b&gt;해나감&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;746&quot; data-origin-height=&quot;71&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bc1h89/dJMb996DKx7/RkIHRDM0IODgmnoilvVma1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bc1h89/dJMb996DKx7/RkIHRDM0IODgmnoilvVma1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bc1h89/dJMb996DKx7/RkIHRDM0IODgmnoilvVma1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbc1h89%2FdJMb996DKx7%2FRkIHRDM0IODgmnoilvVma1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;746&quot; height=&quot;71&quot; data-origin-width=&quot;746&quot; data-origin-height=&quot;71&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Reverse process:&lt;/b&gt; 노이즈 데이터에서 &lt;b&gt;노이즈 제거&lt;/b&gt;해나가며(denoising) 원본 데이터로 복구&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;568&quot; data-origin-height=&quot;118&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bagCSi/dJMcahwQFPg/pGwQa4wNikHN75bJWGOB01/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bagCSi/dJMcahwQFPg/pGwQa4wNikHN75bJWGOB01/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bagCSi/dJMcahwQFPg/pGwQa4wNikHN75bJWGOB01/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbagCSi%2FdJMcahwQFPg%2FpGwQa4wNikHN75bJWGOB01%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;568&quot; height=&quot;118&quot; data-origin-width=&quot;568&quot; data-origin-height=&quot;118&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Loss function:&lt;/b&gt; 실제 추가된 노이즈( $\mathbf{\epsilon}$)를 모델이 정확하게 예측하도록 훈련&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;915&quot; data-origin-height=&quot;39&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cXKJ7o/dJMcaaR2dwG/pJQyZKv0QSkakT9KBNSrUK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cXKJ7o/dJMcaaR2dwG/pJQyZKv0QSkakT9KBNSrUK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cXKJ7o/dJMcaaR2dwG/pJQyZKv0QSkakT9KBNSrUK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcXKJ7o%2FdJMcaaR2dwG%2FpJQyZKv0QSkakT9KBNSrUK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;915&quot; height=&quot;39&quot; data-origin-width=&quot;915&quot; data-origin-height=&quot;39&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;CSDI&lt;/b&gt;: DDPM 프레임워크 기반 + 조건부(Conditional, 조건 = 관측된 데이터) 설정 도입&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;3.3 Imputation with diffusion models&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;CSDI &amp;rarr;&lt;/b&gt; &lt;b&gt;관측값($x_0^{co}$) 을 조건&lt;/b&gt;으로 사용하여 &lt;b&gt;누락된 값 ($x_0^{ta}$) 추정&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;기존 Diffusion model &amp;rarr; 비조건(unconditional) 방식으로 작동&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;630&quot; data-origin-height=&quot;112&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dXhKgH/dJMcabwBnG5/lMnbNoGMCpksG79l8g2jUk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dXhKgH/dJMcabwBnG5/lMnbNoGMCpksG79l8g2jUk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dXhKgH/dJMcabwBnG5/lMnbNoGMCpksG79l8g2jUk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdXhKgH%2FdJMcabwBnG5%2FlMnbNoGMCpksG79l8g2jUk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;630&quot; height=&quot;112&quot; data-origin-width=&quot;630&quot; data-origin-height=&quot;112&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$x_{0:T}^{ta}$: imputation target 시퀀스 (0~T)&lt;/li&gt;
&lt;li&gt;$x_0^{co}$: 관측값(conditional observations)&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;4. Conditional score-based diffusion model for imputation (CSDI)&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;4.1 Imputation with CSDI&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;기존 Diffusion 모델&lt;/b&gt;에서 &lt;b&gt;관측된 데이터를 조건&lt;/b&gt;으로 사용 &amp;rarr; 분포를 모델링&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;4.2 Training of CSDI&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Loss function&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;649&quot; data-origin-height=&quot;41&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bt72KQ/dJMcaaR2dxz/jsFsxbw0ylTmeqAknKmRhk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bt72KQ/dJMcaaR2dxz/jsFsxbw0ylTmeqAknKmRhk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bt72KQ/dJMcaaR2dxz/jsFsxbw0ylTmeqAknKmRhk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbt72KQ%2FdJMcaaR2dxz%2FjsFsxbw0ylTmeqAknKmRhk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;649&quot; height=&quot;41&quot; data-origin-width=&quot;649&quot; data-origin-height=&quot;41&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;476&quot; data-origin-height=&quot;205&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/tMiyv/dJMcaaR2dxJ/eDXerA6Jng2bZFWkX3rcN0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/tMiyv/dJMcaaR2dxJ/eDXerA6Jng2bZFWkX3rcN0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/tMiyv/dJMcaaR2dxJ/eDXerA6Jng2bZFWkX3rcN0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FtMiyv%2FdJMcaaR2dxJ%2FeDXerA6Jng2bZFWkX3rcN0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;571&quot; height=&quot;246&quot; data-origin-width=&quot;476&quot; data-origin-height=&quot;205&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; CSDI self-supervised training 도식화&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;874&quot; data-origin-height=&quot;315&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/xFN9a/dJMcaaxIISk/LpyMKRnIzdUho1OvR3ulP1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/xFN9a/dJMcaaxIISk/LpyMKRnIzdUho1OvR3ulP1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/xFN9a/dJMcaaxIISk/LpyMKRnIzdUho1OvR3ulP1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FxFN9a%2FdJMcaaxIISk%2FLpyMKRnIzdUho1OvR3ulP1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;874&quot; height=&quot;315&quot; data-origin-width=&quot;874&quot; data-origin-height=&quot;315&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 실제 적용시, &lt;b&gt;Zero padding, conditional 추가&lt;/b&gt;&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;초기 데이터: 관찰값, 결측/마스킹 값 구분
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;녹색 &amp;rarr; 관찰값(Observed)&lt;/li&gt;
&lt;li&gt;흰색 &amp;rarr; 결측 or 마스킹 값&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;관찰된 데이터에서 예측할 타겟, 조건값 분리
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;관찰값&lt;/b&gt;(녹색) &amp;rarr; &lt;b&gt;빨간사선&lt;/b&gt;(Imputation targets, $x^{ta}_0$), &lt;b&gt;파란색&lt;/b&gt;(Conditional observations, $x^{co}_0$) 분리&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;예측할 타겟값 부분의 실제 노이즈 추가
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;해당 위치의 노이즈값이 들어감&lt;/li&gt;
&lt;li&gt;&lt;b&gt;빨간사선&lt;/b&gt;(Imputation targets, $x^{ta}_0$) 부분 + &lt;b&gt;회색 점&lt;/b&gt;(ϵ, t 시점에 추가된 실제 노이즈) &amp;rarr; &lt;b&gt;녹색 격자&lt;/b&gt;(노이즈 섞인 타겟값)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;타겟값 예측 (t시점, 관찰된 값 이용)&lt;/li&gt;
&lt;/ol&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;녹색 격자&lt;/b&gt;(노이즈 섞인 타겟값) &lt;b&gt;+ t&lt;/b&gt; (확산 forward 단계 시점) + &lt;b&gt;파란색&lt;/b&gt;(Conditional observations, $x^{co}&lt;i&gt;0$) &amp;rarr; function $\epsilon_\theta$ &amp;rarr; &lt;b&gt;회색격자&lt;/b&gt; $ϵ_&amp;theta;(x&lt;/i&gt;{t^a},t∣x_0^{co}$) (&lt;b&gt;예측한 노이즈 값&lt;/b&gt;)&lt;/li&gt;
&lt;/ul&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;예측값, 실제 노이즈값 비교
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Loss function&lt;/b&gt; : $minimize ||\epsilon - \epsilon_\theta(x^a_t, t | x^{co}_0)||$ (실제 노이즈값, 예측 노이즈 값 최소화)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;회색 점&lt;/b&gt;(t 시점에 추가된 실제 노이즈) vs &lt;b&gt;회색격자&lt;/b&gt; $ϵ&lt;i&gt;&amp;theta;(x&lt;/i&gt;{t^a},t∣x_0^{co}$) (&lt;b&gt;예측한 노이즈 값&lt;/b&gt;)&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;983&quot; data-origin-height=&quot;157&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/QwVlx/dJMcacvx7fz/lTgZu8vYfjWcjrPSjuVMaK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/QwVlx/dJMcacvx7fz/lTgZu8vYfjWcjrPSjuVMaK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/QwVlx/dJMcacvx7fz/lTgZu8vYfjWcjrPSjuVMaK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FQwVlx%2FdJMcacvx7fz%2FlTgZu8vYfjWcjrPSjuVMaK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;983&quot; height=&quot;157&quot; data-origin-width=&quot;983&quot; data-origin-height=&quot;157&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; Conditional observations 으로 Imputation targets을 예측 (=결측(값을 채우는 task)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;샘플링(추론), 학습 단계에서&lt;/b&gt; &lt;b&gt;데이터를 어떻게 사용할지&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;샘플링&lt;/b&gt;(imputation, = 추론단계): 누락된 값 채우기&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Imputation targets: 모든 결측치 대상&lt;/li&gt;
&lt;li&gt;Conditional observations: 모든 관측값 대상&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;학습&lt;/b&gt;(training): 누락된 값을 잘 채우도록 모델을 학습&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Imputation targets: &lt;b&gt;관측된 값&lt;/b&gt; 중 &lt;b&gt;부분집합(subset)&lt;/b&gt; &amp;rarr; 다양한 전략 존재(랜덤, 패턴 등)&lt;/li&gt;
&lt;li&gt;Conditional observations: 관측된 값중 Imputation target(subset)으로 선택되고 &lt;b&gt;남은 값&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;4.3 Choice of imputation targets in self-supervised learning&lt;/h3&gt;
&lt;aside&gt;  &lt;b&gt;결측치 유형(Missing value)&lt;/b&gt;&lt;/aside&gt;
&lt;table id=&quot;304bd201-015f-8058-b5f7-da7666f71ab2&quot; style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style12&quot;&gt;
&lt;tbody&gt;
&lt;tr id=&quot;304bd201-015f-80bd-82e0-f9d8070b0fdd&quot;&gt;
&lt;td id=&quot;^}gq&quot;&gt;&lt;b&gt;결측 유형&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;T@dT&quot;&gt;&lt;b&gt;결측 발생 원인&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;\&amp;#96;iA&quot;&gt;&lt;b&gt;예시&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;T[R&amp;gt;&quot;&gt;&lt;b&gt;일반적인 처리 방법&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;304bd201-015f-8074-88ba-f7aa0d9ed34d&quot;&gt;
&lt;td id=&quot;^}gq&quot;&gt;&lt;b&gt;MCAR&lt;/b&gt;&lt;br /&gt;(완전 무작위 결측, &lt;b&gt;M&lt;/b&gt;issing &lt;b&gt;C&lt;/b&gt;ompletely &lt;b&gt;A&lt;/b&gt;t &lt;b&gt;R&lt;/b&gt;andom)&lt;/td&gt;
&lt;td id=&quot;T@dT&quot;&gt;우연 (단순 오류 등)&lt;/td&gt;
&lt;td id=&quot;\&amp;#96;iA&quot;&gt;통신 오류 &amp;rarr; 서버 데이터 삭제&lt;/td&gt;
&lt;td id=&quot;T[R&amp;gt;&quot;&gt;결측치가 포함된 행 삭제(Drop), 평균/중앙값 단순 대체&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;304bd201-015f-8096-984a-dc1c56f24083&quot;&gt;
&lt;td id=&quot;^}gq&quot;&gt;&lt;b&gt;MAR&lt;/b&gt;&lt;br /&gt;(무작위 결측, &lt;b&gt;M&lt;/b&gt;issing &lt;b&gt;A&lt;/b&gt;t &lt;b&gt;R&lt;/b&gt;andom)&lt;/td&gt;
&lt;td id=&quot;T@dT&quot;&gt;다른 데이터(변수)&lt;/td&gt;
&lt;td id=&quot;\&amp;#96;iA&quot;&gt;주말 &amp;rarr; 주식 거래량 누락&lt;/td&gt;
&lt;td id=&quot;T[R&amp;gt;&quot;&gt;관측된 다른 변수들을 활용한 대체 및 보간 (interpolation)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;304bd201-015f-80f6-867d-f048ff593281&quot;&gt;
&lt;td id=&quot;^}gq&quot;&gt;&lt;b&gt;MNAR&lt;/b&gt;&lt;br /&gt;(비무작위 결측, &lt;b&gt;M&lt;/b&gt;issing &lt;b&gt;N&lt;/b&gt;ot &lt;b&gt;A&lt;/b&gt;t &lt;b&gt;R&lt;/b&gt;andom)&lt;/td&gt;
&lt;td id=&quot;T@dT&quot;&gt;누락된 값 자체&lt;/td&gt;
&lt;td id=&quot;\&amp;#96;iA&quot;&gt;주가 비정상적 폭락 &amp;rarr; 주식 호가창 화면 누락&lt;/td&gt;
&lt;td id=&quot;T[R&amp;gt;&quot;&gt;도메인 지식 반영, 결측 여부 자체를 새로운 변수(Feature)로 추가&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;br /&gt;&lt;br /&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; self-supervised learning imputation 타겟($x^{ta}_0$) 선택 전략 (4가지)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;(1) Random strategy&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;사용 시점: &lt;b&gt;test set 결측값 패턴 모를 때&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;방법: [0%, 100%] 범위에서 무작위로 샘플링
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;예: train set 30% 타겟, 나머지 70% 조건 데이터&lt;/li&gt;
&lt;li&gt;&lt;b&gt;일반화 능력&lt;/b&gt; (다양한 누락 비율에 적응)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;(2) Historical strategy&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;사용 시점: &lt;b&gt;구조화된(structured) 결측 패턴 존재&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;방법:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;현재 훈련 샘플($x_0$), 다른 무작위 샘플$(\tilde{x}_0)$ 선택&lt;/li&gt;
&lt;li&gt;현재 훈련 샘플($x_0$)의 &lt;b&gt;관측값&lt;/b&gt;, 다른 무작위 샘플$(\tilde{x}_0)$의 결측값의 &lt;b&gt;교집합(intersection)을 imputation 타겟으로&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;현재 훈련 샘플 ($x_0$)에서 타겟으로 선택되지 않은 값은 &lt;b&gt;조건부 관측값&lt;/b&gt;($x^{co}_0$)으로&lt;/li&gt;
&lt;li&gt;&lt;i&gt;&amp;rarr; train set의 구조화된(structured) 결측 패턴을 학습하는 방식*&lt;/i&gt;&lt;/li&gt;
&lt;li&gt;구조적인 누락 패턴(예: 주말 동시 누락, 특정 센서들의 연쇄 고장 등)' 자체를 모델이 학습, 과적합 가능성 존재&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;(3) Mix strategy&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;사용 시점: 복합적인 상황(무작위, 구조화된 패턴)&lt;/li&gt;
&lt;li&gt;방법: 두전략 섞음 (Random + Historical) (논문에서는 1:1비율)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;두 전략의 장점(일반화 + 결측패턴 학습) 결합&lt;/li&gt;
&lt;li&gt;과적합(overfitting) 방지, 견고함(robust)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;(4) Test pattern strategy&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;사용 시점: &lt;b&gt;test set 결측값 패턴 알 때&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;예) 미래시점 항상 결측치라는 패턴 앎 &amp;rarr; forecasting&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;방법&lt;b&gt;: test set 패턴대로&lt;/b&gt; &lt;b&gt;imputation&lt;/b&gt; &lt;b&gt;target 설정&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;5. Implementation of CSDI for time series imputation&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;간소화 ver&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;905&quot; data-origin-height=&quot;143&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/8mP69/dJMcabXGESv/kZEu9kmGwC11Bj0LtJ8rU0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/8mP69/dJMcabXGESv/kZEu9kmGwC11Bj0LtJ8rU0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/8mP69/dJMcabXGESv/kZEu9kmGwC11Bj0LtJ8rU0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F8mP69%2FdJMcabXGESv%2FkZEu9kmGwC11Bj0LtJ8rU0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;905&quot; height=&quot;143&quot; data-origin-width=&quot;905&quot; data-origin-height=&quot;143&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;디테일한 ver&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;829&quot; data-origin-height=&quot;420&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ch62Rg/dJMcaaxIIX8/3MFu2XkBEHL2ZquXpVIJEK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ch62Rg/dJMcaaxIIX8/3MFu2XkBEHL2ZquXpVIJEK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ch62Rg/dJMcaaxIIX8/3MFu2XkBEHL2ZquXpVIJEK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fch62Rg%2FdJMcaaxIIX8%2F3MFu2XkBEHL2ZquXpVIJEK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;829&quot; height=&quot;420&quot; data-origin-width=&quot;829&quot; data-origin-height=&quot;420&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;입력 데이터&lt;/b&gt;&amp;rarr; 레이어를 통해 원본 X (K,L) &amp;rarr; &lt;b&gt;(K,L,C) 변환&lt;/b&gt; = 피쳐수, 길이, 채널
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;채널 C&lt;/b&gt; &amp;rarr; 잔차 채널(residual channel) 개수, &lt;b&gt;하이퍼파라미터&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&amp;rarr; $x_0^{Ta}$(imputation target), $x_0^{co}$ (conditional observations) &lt;b&gt;분리(split)&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;제로 패딩(zero padding)&lt;/b&gt;: 비어있는 부분을 0으로 채움 &amp;rarr; 길이 맞춰줌(K x L)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;원본 데이터: $X&amp;isin;R^{K&amp;times;L}$ (피처 K, 길이 L)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;관측 마스크 $M$, 조건부 마스크 $m_{co}$&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;관측 마스크 $M$&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;원본 전체 데이터셋 결측값, 관측값 여부 구분 목적&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;1 &amp;rarr; 관측값 / 0 &amp;rarr; 결측값&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;조건부 마스크 $m_{co}$&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;훈련시 ${x_0^{co}}$(conditional observations) 여부 구분 목적&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;$m_{co}&amp;isin;{{0,1}}^{K&amp;times;L}$ : &lt;b&gt;1&lt;/b&gt; &amp;rarr; $x_0^{co}$ (conditional observations) / &lt;b&gt;0&lt;/b&gt; &amp;rarr; $x_0^{Ta}$(imputation target)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;${x_0^{co}}$ = $m_{co}⊙X$&lt;/li&gt;
&lt;li&gt;$x_0^{Ta}$ = $(M - m_{co})⊙X$
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;훈련시 관측값 중에, ${x_0^{co}}$로 선택되지 않은 &lt;b&gt;나머지 값&lt;/b&gt;(일부러 결측치를 만듦) &amp;rarr; 예측 학습을 하기 위함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;훈련 (train, Self-supervised learning)&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;원본 관측 데이터(X)&lt;/b&gt; 에서 &lt;b&gt;일부&lt;/b&gt;를 ${x_0^{co}}$(conditional observations), $x_0^{Ta}$(imputation target)&lt;/li&gt;
&lt;li&gt;${x_0^{co}}$로 결측치($x_0^{Ta}$)를 예측하는 것을 &lt;b&gt;훈련&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;추론(interence) = 샘플링(imputation)&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;실제 관측된 &lt;b&gt;모든 값을&lt;/b&gt; ${x_0^{co}}$(conditional observations)로 사용 &amp;rarr; &lt;b&gt;결측치 추론&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;모델 아키텍처($\epsilon_\theta$)&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Diffusion T 스텝 50고정&lt;/li&gt;
&lt;li&gt;DiffWave 모델 기반 &amp;rarr; DiffWave의 &lt;b&gt;Residual Block 구조&lt;/b&gt;를 2D로 확장
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Paper: DiffWave: A Versatile Diffusion Model for Audio Synthesis&lt;/li&gt;
&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2009.09761&quot;&gt;https://arxiv.org/abs/2009.09761&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;DiffWave &amp;rarr; 디퓨전 모델을 WaveNet에 적용한 오디오 생성모델&lt;/li&gt;
&lt;li&gt;WaveNet&amp;rarr; &lt;b&gt;Causal Convolution&lt;/b&gt; 구조(현재, 과거정보로 피처맵 추출) &amp;rarr; 미래 시계열 예측 모델&lt;/li&gt;
&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2009.09761&quot;&gt;https://arxiv.org/abs/2009.09761&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;figure id=&quot;og_1773047460434&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;DiffWave: A Versatile Diffusion Model for Audio Synthesis&quot; data-og-description=&quot;In this work, we propose DiffWave, a versatile diffusion probabilistic model for conditional and unconditional waveform generation. The model is non-autoregressive, and converts the white noise signal into structured waveform through a Markov chain with a &quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2009.09761&quot; data-og-url=&quot;https://arxiv.org/abs/2009.09761v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/cgdm6L/dJMb83SgXfj/YeQr4W2SPVx5mDMuaD1MuK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cLZSjz/dJMb8WexL1V/XDvClcUkwQi7YTEiwP3KQ1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2009.09761&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2009.09761&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/cgdm6L/dJMb83SgXfj/YeQr4W2SPVx5mDMuaD1MuK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cLZSjz/dJMb8WexL1V/XDvClcUkwQi7YTEiwP3KQ1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;DiffWave: A Versatile Diffusion Model for Audio Synthesis&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;In this work, we propose DiffWave, a versatile diffusion probabilistic model for conditional and unconditional waveform generation. The model is non-autoregressive, and converts the white noise signal into structured waveform through a Markov chain with a&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;figure id=&quot;og_1773047456924&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;DiffWave: A Versatile Diffusion Model for Audio Synthesis&quot; data-og-description=&quot;In this work, we propose DiffWave, a versatile diffusion probabilistic model for conditional and unconditional waveform generation. The model is non-autoregressive, and converts the white noise signal into structured waveform through a Markov chain with a &quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2009.09761&quot; data-og-url=&quot;https://arxiv.org/abs/2009.09761v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/cgdm6L/dJMb83SgXfj/YeQr4W2SPVx5mDMuaD1MuK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cLZSjz/dJMb8WexL1V/XDvClcUkwQi7YTEiwP3KQ1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2009.09761&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2009.09761&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/cgdm6L/dJMb83SgXfj/YeQr4W2SPVx5mDMuaD1MuK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cLZSjz/dJMb8WexL1V/XDvClcUkwQi7YTEiwP3KQ1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;DiffWave: A Versatile Diffusion Model for Audio Synthesis&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;In this work, we propose DiffWave, a versatile diffusion probabilistic model for conditional and unconditional waveform generation. The model is non-autoregressive, and converts the white noise signal into structured waveform through a Markov chain with a&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;pre class=&quot;markdown&quot;&gt;&lt;code&gt;- **2D Attention**
    - Temporal Transformer (시간축)
        - (1,L,C) x K
        - 각 피쳐들의 **시간 의존성 포착**
    - Feature Transformer (변수 축)
        - (K,1,C) x L
        - 각 시점들의 **피처간 의존성 포착 (동일 시점 변수간 상관관계)**&lt;/code&gt;&lt;/pre&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Side Information 활용&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Diffusion 단계(t) 임베딩&lt;/b&gt;: 현재 diffusion t시점 정수값&amp;rarr; &lt;b&gt;128차원 임베딩&lt;/b&gt;(사인64, 코사인 64개 수식)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;현재 확산과정 어느 단계에 있는지 더 &lt;b&gt;풍부한 위치정보&lt;/b&gt; &lt;b&gt;제공&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;$tembedding (t)&lt;br /&gt;=( \sin(10^0 \cdot \frac{4}{63} t), \dots , \sin(10^{63} \cdot \frac{4}{63} t), \cos(10^0 \cdot \frac{4}{63} t), \dots , \cos(10^{63} \cdot \frac{4}{63} t))$&lt;/li&gt;
&lt;li&gt;&amp;rarr; 서로 다른 주기를 가진 128개 사인/코사인 임베딩 벡터 생성&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;시간 임베딩 (Time Embedding)&lt;/b&gt;: 시계열의 시간적 위치 정보 ($s_l$l)를 모델에 제공 &amp;rarr; &lt;b&gt;128차원 임베딩&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 시점의 &lt;b&gt;고유한 시간 정보&lt;/b&gt; 제공&lt;/li&gt;
&lt;li&gt;$sembedding(sl)=(sin⁡(sl/&amp;tau;^{0/64}),&amp;hellip;,sin⁡(sl/&amp;tau;^{63/64}),cos⁡(sl/&amp;tau;^{0/64}),&amp;hellip;,cos⁡(sl/&amp;tau;^{63/64}))$&lt;/li&gt;
&lt;li&gt;$\tau = 10000$&lt;/li&gt;
&lt;li&gt;&amp;rarr; 서로 다른 주기를 가진 128개 사인/코사인 임베딩 벡터 생성&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;범주형 특징 임베딩 (Categorical Feature Embedding)&lt;/b&gt;: K개의 특징에 대한 피쳐 정보 &amp;rarr; &lt;b&gt;학습 가능한(learnable) 16차원 임베딩&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 변수 고유한 특성 할당 (언어모델처럼 문맥적 분석X)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;6. Experimental results&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;6.1 Time series imputation&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Dataset&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;healthcare dataset (중환자실 intensive care unit (ICU))
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;35개 변수(feature), 48시점(hourly)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;결측치&lt;/b&gt;: 원본 80% 결측&lt;/li&gt;
&lt;li&gt;&lt;b&gt;학습&lt;/b&gt;: &lt;b&gt;Random&lt;/b&gt; strategy, 관측값 10%, 50%, 90% 결측으로 설정&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;air quality PM2.5 measurement
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;베이징에서 측정한 36개 관측소 12개월 측정, 각각 36개 시점&lt;/li&gt;
&lt;li&gt;&lt;b&gt;결측치&lt;/b&gt;: 원본 13% 결측&lt;/li&gt;
&lt;li&gt;&lt;b&gt;학습: mix&lt;/b&gt;(random and historical strategy)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;Deterministic Imputation&lt;/b&gt; &amp;rarr; 누락값 &lt;b&gt;단일 값 추청&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;821&quot; data-origin-height=&quot;209&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/WZPcj/dJMcaflt3RD/XKI7MWw4LdiyBCnA3Vru31/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/WZPcj/dJMcaflt3RD/XKI7MWw4LdiyBCnA3Vru31/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/WZPcj/dJMcaflt3RD/XKI7MWw4LdiyBCnA3Vru31/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FWZPcj%2FdJMcaflt3RD%2FXKI7MWw4LdiyBCnA3Vru31%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;821&quot; height=&quot;209&quot; data-origin-width=&quot;821&quot; data-origin-height=&quot;209&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 100개 샘플 5번 실험 &lt;b&gt;CRPS 스코어의 평균, 표준편차&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; CSDI Imputation 성능 SOTA&lt;/b&gt;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 100%;&quot;&gt; &amp;nbsp; &lt;span&gt;&lt;b&gt;CRPS(Continuous Ranked Probability Score)&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc; color: #333333; text-align: start;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;확률적 예측, 보간 모델 성능 평가시 사용&lt;/li&gt;
&lt;li&gt;&lt;b&gt;예측한 확률분포가 실제 관측값과 얼마나 일치하는지&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;점수가 낮을수록 좋음&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;실제수식 (2가지 버전)&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;실수 전체 구간 적분
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$CRPS(F,y)=&amp;int;^{&amp;infin;}&lt;i&gt;{-&amp;infin;}​(F(z)&amp;minus;1&lt;/i&gt;{y&amp;le;z}​)^2dz$
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$F(z)$:&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;예측&lt;/b&gt;한 누적 분포함수(Cumulative Distribution Function, CDF)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$1_{y&amp;le;z}$: 실제 누적분포함수&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;분위수 손실 기반 적분 &amp;rarr;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;해당 수식 근사&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$CRPS(F^{&amp;minus;1},y)=&amp;int;_0^1​2&amp;Lambda;&amp;alpha;​(F^{&amp;minus;1}(&amp;alpha;),y)d&amp;alpha;$
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$F^{&amp;minus;1}(&amp;alpha;)$: 누적 확률 $\alpha$(0 ~ 1)에 해당하는 값(분위수) (분위수 함수)&lt;/li&gt;
&lt;li&gt;$&amp;Lambda;&amp;alpha;(q,z)=(&amp;alpha;&amp;minus;1z&amp;lt;q)(z&amp;minus;q)$ &amp;rarr; 분위수 손실함수&lt;/li&gt;
&lt;/ul&gt;
&amp;rarr; 두 분포간 제곱오차를 모든 가능한 값 Z에 대해 적분&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ul style=&quot;list-style-type: disc; color: #333333; text-align: start;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;근사한 수식&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;모델은 예측 분포를 함수형태로 출력하지 않음 &amp;rarr; 예측한 분포 내의 지정한 샘플값을 출력 &amp;rarr; 샘플들을 통해 분포 근사&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;$\text{CRPS}(F^{-1}, x) \approx \frac{1}{19} \sum_{i=1}^{19} 2 \Lambda_{i * 0.05} (F^{-1}(i * 0.05), x)$&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&amp;rarr; 각 분위수 손실값 구한 후, 적분&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;aside&gt;&lt;/aside&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;720&quot; data-origin-height=&quot;250&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/YYsqo/dJMcacvx7oK/NBQfw9u6fDHDLmbr4YlX1K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/YYsqo/dJMcacvx7oK/NBQfw9u6fDHDLmbr4YlX1K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/YYsqo/dJMcacvx7oK/NBQfw9u6fDHDLmbr4YlX1K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FYYsqo%2FdJMcacvx7oK%2FNBQfw9u6fDHDLmbr4YlX1K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;720&quot; height=&quot;250&quot; data-origin-width=&quot;720&quot; data-origin-height=&quot;250&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;빨간 X: 관측값&lt;/li&gt;
&lt;li&gt;파란원: 관측값 중 누락값&lt;/li&gt;
&lt;li&gt;실선(녹색, 회색): 모델 예측한 imputation의 중앙값(median) (100개 샘플)&lt;/li&gt;
&lt;li&gt;음영(녹색, 회색): 모델 예측값의 분위수 범위(5~95%) (100개 샘플)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; CSDI가 누락값을 더 정확하게 예측&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;Probabilistic Imputation&lt;/b&gt; &amp;rarr; 누락값 &lt;b&gt;확률적 추정&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;789&quot; data-origin-height=&quot;259&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/MXPie/dJMcajaiRCW/nD34mJobRn3ZKL6bwf0r81/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/MXPie/dJMcajaiRCW/nD34mJobRn3ZKL6bwf0r81/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/MXPie/dJMcajaiRCW/nD34mJobRn3ZKL6bwf0r81/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FMXPie%2FdJMcajaiRCW%2FnD34mJobRn3ZKL6bwf0r81%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;789&quot; height=&quot;259&quot; data-origin-width=&quot;789&quot; data-origin-height=&quot;259&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 100개 샘플 중앙값 MAE &amp;rarr; 5번 실험 평균, 표준편차&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; CSDI Imputation 성능 SOTA&lt;/b&gt;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;6.2 Interpolation of irregularly sampled time series&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;직전 데이터셋과 동일 &amp;rarr; &lt;b&gt;irregularly 시간간격(시간 간격을 가까운 분단위로 반올림 &amp;rarr; 불규칙하게 - 샘플 길이 각각 달라짐)&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;657&quot; data-origin-height=&quot;126&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/pNoBU/dJMcahcwoDW/09ka9SV47TVshnYfxgWnY0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/pNoBU/dJMcahcwoDW/09ka9SV47TVshnYfxgWnY0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/pNoBU/dJMcahcwoDW/09ka9SV47TVshnYfxgWnY0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FpNoBU%2FdJMcahcwoDW%2F09ka9SV47TVshnYfxgWnY0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;657&quot; height=&quot;126&quot; data-origin-width=&quot;657&quot; data-origin-height=&quot;126&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; CSDI Imputation 좋은 성능&lt;/b&gt;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;6.3 Time series Forecasting&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;5가지 데이터셋 활용&lt;/li&gt;
&lt;li&gt;Test pattern strategy&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;878&quot; data-origin-height=&quot;173&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/kJzxT/dJMcacPPuNY/AK6jkKlQB4WJTT35ZQktWK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/kJzxT/dJMcacPPuNY/AK6jkKlQB4WJTT35ZQktWK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/kJzxT/dJMcacPPuNY/AK6jkKlQB4WJTT35ZQktWK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FkJzxT%2FdJMcacPPuNY%2FAK6jkKlQB4WJTT35ZQktWK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;878&quot; height=&quot;173&quot; data-origin-width=&quot;878&quot; data-origin-height=&quot;173&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; CSDI Imputation 좋은 성능&lt;/b&gt;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;7. Conclusion&lt;/h2&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;한계점: 샘플링 속도 느림 &amp;rarr; DDIM - 상미분 방정식(ODE) 활용하여 계산 효율성 개선&lt;/li&gt;
&lt;li&gt;downstream tasks으로 확장 - Classification 등&lt;/li&gt;
&lt;li&gt;다양한 modalities적용 (시계열을 넘어)&lt;/li&gt;
&lt;/ul&gt;
&lt;h1&gt;3. Implementation&lt;/h1&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://github.com/ermongroup/CSDI&quot;&gt;https://github.com/ermongroup/CSDI&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1773047541721&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - ermongroup/CSDI: Codes for &amp;quot;CSDI: Conditional Score-based Diffusion Models for Probabilistic Time Series Imputation&amp;quot;&quot; data-og-description=&quot;Codes for &amp;quot;CSDI: Conditional Score-based Diffusion Models for Probabilistic Time Series Imputation&amp;quot; - ermongroup/CSDI&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/ermongroup/CSDI&quot; data-og-url=&quot;https://github.com/ermongroup/CSDI&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/HDxMX/dJMb9cBGeRZ/YDK5MrMCoBVLQklaMkXbek/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/b4II2o/dJMb8UHNiPo/v0gUhQLi6BIMC1yylmrCf0/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/ermongroup/CSDI&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/ermongroup/CSDI&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/HDxMX/dJMb9cBGeRZ/YDK5MrMCoBVLQklaMkXbek/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/b4II2o/dJMb8UHNiPo/v0gUhQLi6BIMC1yylmrCf0/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - ermongroup/CSDI: Codes for &quot;CSDI: Conditional Score-based Diffusion Models for Probabilistic Time Series Imputation&quot;&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Codes for &quot;CSDI: Conditional Score-based Diffusion Models for Probabilistic Time Series Imputation&quot; - ermongroup/CSDI&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://github.com/lmnt-com/diffwave&quot;&gt;https://github.com/lmnt-com/diffwave&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1773047544398&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - lmnt-com/diffwave: DiffWave is a fast, high-quality neural vocoder and waveform synthesizer.&quot; data-og-description=&quot;DiffWave is a fast, high-quality neural vocoder and waveform synthesizer. - lmnt-com/diffwave&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/lmnt-com/diffwave&quot; data-og-url=&quot;https://github.com/lmnt-com/diffwave&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/eCYhh/dJMb8QekkSz/VSn0xlNtBD1GG8SQ1ZjbRk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/HjwhN/dJMb8WexL2n/FlxoPV8NDNBfPmLqkkd52K/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/lmnt-com/diffwave&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/lmnt-com/diffwave&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/eCYhh/dJMb8QekkSz/VSn0xlNtBD1GG8SQ1ZjbRk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/HjwhN/dJMb8WexL2n/FlxoPV8NDNBfPmLqkkd52K/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - lmnt-com/diffwave: DiffWave is a fast, high-quality neural vocoder and waveform synthesizer.&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;DiffWave is a fast, high-quality neural vocoder and waveform synthesizer. - lmnt-com/diffwave&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;데이터셋:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;ETTh1&lt;/b&gt; (Electricity Transformer Temperature, 7개 변수: HUFL, HULL, MUFL, MULL, LUFL, LULL, OT)&lt;/li&gt;
&lt;li&gt;원본: 17420 rows &amp;times; 8 columns(7변수 + 1 time)&lt;/li&gt;
&lt;li&gt;Z-score 표준화 (변수별 mean/std), 슬라이딩 윈도우(길이 72)로 분할 (50%겹치게 &amp;rarr; stride = 36)&lt;/li&gt;
&lt;li&gt;[482, 72, 7] 배치수, 시퀀스 길이, 변수 수
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;(17420 - 72) // 36 + 1 = 482&lt;/li&gt;
&lt;li&gt;첫 시퀀스: 0 ~ 71, 두 번째: 36~107, 마지막: (마지막 시작점) ~ (마지막 시작점+71)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Train/Test = 80%/20% (Train: 385, Test: 97 시퀀스)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;원본 데이터 Trendplot&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1374&quot; data-origin-height=&quot;653&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/7OdGn/dJMcahcwoEB/2KAsaNvQW4endXKMAkKE40/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/7OdGn/dJMcahcwoEB/2KAsaNvQW4endXKMAkKE40/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/7OdGn/dJMcahcwoEB/2KAsaNvQW4endXKMAkKE40/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F7OdGn%2FdJMcahcwoEB%2F2KAsaNvQW4endXKMAkKE40%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;698&quot; height=&quot;332&quot; data-origin-width=&quot;1374&quot; data-origin-height=&quot;653&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;학습&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;모델/optimizer&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;CSDI 모델(DDPM기반)&lt;/li&gt;
&lt;li&gt;AdamW optimizer(lr=2e-4)&lt;/li&gt;
&lt;li&gt;CosineAnnealingLR scheduler(epoch 단위)&amp;rarr;학습이 진행됨에 따라 학습률을 코사인 곡선 형태로 점진적으로 감소&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;학습 루프: 각 배치마다 마스킹 후 forward/backward, gradient clipping(기울기 폭팔방지&amp;rarr; 제한), Noise Schedule( Linear (&amp;beta;: 0.0001 &amp;rarr; 0.02)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;마스킹 전략&lt;/b&gt;: 매 배치마다 결측률 10~50% 랜덤 변동 (자기지도학습 Random strategy)&lt;/li&gt;
&lt;li&gt;Loss: MSE&lt;/li&gt;
&lt;li&gt;500 epoch, diffusion step: 50
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;랜덤 결측률(10~50%)로 mask 생성&lt;/li&gt;
&lt;li&gt;forward: 랜덤 t 선택 &amp;rarr; 노이즈 추가 &amp;rarr; 노이즈 예측 &amp;rarr; 결측 위치 MSE loss&lt;/li&gt;
&lt;li&gt;backward + gradient clipping (max_norm=1.0)&lt;/li&gt;
&lt;li&gt;optimizer.step()&lt;/li&gt;
&lt;li&gt;ema.update() &amp;mdash; shadow 파라미터 (최근까지의 파라미터 변화의 평균값 저장) 갱신&lt;br /&gt;scheduler.step() &amp;mdash; epoch 단위&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;li&gt;for batch in train_loader: (1 에폭 요약)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1789&quot; data-origin-height=&quot;390&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/GdW84/dJMcagEIsGi/Wb9XipIU3sE1Xb5KBIMuck/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/GdW84/dJMcagEIsGi/Wb9XipIU3sE1Xb5KBIMuck/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/GdW84/dJMcagEIsGi/Wb9XipIU3sE1Xb5KBIMuck/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FGdW84%2FdJMcagEIsGi%2FWb9XipIU3sE1Xb5KBIMuck%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1789&quot; height=&quot;390&quot; data-origin-width=&quot;1789&quot; data-origin-height=&quot;390&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;추론
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;EMA 적용(&lt;/b&gt;Exponential Moving Average) &amp;rarr; 학습시 모델 파라미터값 저장 &amp;rarr; 추론시 과도하게 파라미터가 바뀌지 않도록 평균내어 반영&lt;/li&gt;
&lt;li&gt;샘플 10개씩 추출 &amp;rarr; 분포(신뢰구간), 평균내어 단일값 예측&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;실험
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;7개 변수 평균&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;table style=&quot;height: 84px;&quot; data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style4&quot;&gt;
&lt;thead&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;th style=&quot;height: 21px;&quot;&gt;Task&lt;/th&gt;
&lt;th style=&quot;height: 21px;&quot;&gt;결측 방식&lt;/th&gt;
&lt;th style=&quot;height: 21px;&quot;&gt;평가 대상&lt;/th&gt;
&lt;th style=&quot;height: 21px;&quot;&gt;평가 지표&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&lt;b&gt;Interpolation&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;50% 랜덤 결측&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;결측 위치 복원&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;MAE, RMSE, CRPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&lt;b&gt;Forecasting&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;후반 50% (t=36~71) 전체 결측&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;미래 구간 예측&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;MAE, RMSE, CRPS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 21px;&quot;&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;&lt;b&gt;Block Missing&lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;랜덤 2개 변수 전체 결측&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;변수 전체 복원&lt;/td&gt;
&lt;td style=&quot;height: 21px;&quot;&gt;MAE, RMSE&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;table style=&quot;height: 70px;&quot; data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style4&quot;&gt;
&lt;thead&gt;
&lt;tr style=&quot;height: 19px;&quot;&gt;
&lt;th style=&quot;height: 19px;&quot;&gt;Task&lt;/th&gt;
&lt;th style=&quot;height: 19px;&quot;&gt;MAE&lt;/th&gt;
&lt;th style=&quot;height: 19px;&quot;&gt;RMSE&lt;/th&gt;
&lt;th style=&quot;height: 19px;&quot;&gt;CRPS&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 17px;&quot;&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;Interpolation (50%)&lt;/td&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;0.3831 &amp;plusmn; 0.0685&lt;/td&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;0.5910 &amp;plusmn; 0.1200&lt;/td&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;0.1396 &amp;plusmn; 0.0279&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 17px;&quot;&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;Forecasting (50%)&lt;/td&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;0.6535 &amp;plusmn; 0.1289&lt;/td&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;0.8829 &amp;plusmn; 0.1819&lt;/td&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;0.2439 &amp;plusmn; 0.0534&lt;/td&gt;
&lt;/tr&gt;
&lt;tr style=&quot;height: 17px;&quot;&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;Block Missing (2 vars)&lt;/td&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;0.5791 &amp;plusmn; 0.1985&lt;/td&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;0.7184 &amp;plusmn; 0.2346&lt;/td&gt;
&lt;td style=&quot;height: 17px;&quot;&gt;N/A&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;테스트 구간 첫번째 시퀀스 시각화&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imagegridblock&quot;&gt;
  &lt;div class=&quot;image-container&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/doRNqz/dJMcabwBnSB/pFGimkXR5hSkUR8CYuvQW0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/doRNqz/dJMcabwBnSB/pFGimkXR5hSkUR8CYuvQW0/img.png&quot; data-origin-width=&quot;1597&quot; data-origin-height=&quot;1772&quot; data-is-animation=&quot;false&quot; style=&quot;width: 49.5427%; margin-right: 10px;&quot; data-widthpercent=&quot;50.13&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/doRNqz/dJMcabwBnSB/pFGimkXR5hSkUR8CYuvQW0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdoRNqz%2FdJMcabwBnSB%2FpFGimkXR5hSkUR8CYuvQW0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1597&quot; height=&quot;1772&quot;/&gt;&lt;/span&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/nlHVM/dJMcachZSbw/fKlck5oPbl8jtQDt0BpWGK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/nlHVM/dJMcachZSbw/fKlck5oPbl8jtQDt0BpWGK/img.png&quot; data-origin-width=&quot;1589&quot; data-origin-height=&quot;1772&quot; style=&quot;width: 49.2945%;&quot; data-widthpercent=&quot;49.87&quot; data-is-animation=&quot;false&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/nlHVM/dJMcachZSbw/fKlck5oPbl8jtQDt0BpWGK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FnlHVM%2FdJMcachZSbw%2FfKlck5oPbl8jtQDt0BpWGK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1589&quot; height=&quot;1772&quot;/&gt;&lt;/span&gt;&lt;/div&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;테스트 구간 전체 시퀀스 시각화&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1797&quot; data-origin-height=&quot;1419&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/XwTXq/dJMcahjkulX/vFaPUMGYE0aGQOYeveNHKk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/XwTXq/dJMcahjkulX/vFaPUMGYE0aGQOYeveNHKk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/XwTXq/dJMcahjkulX/vFaPUMGYE0aGQOYeveNHKk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FXwTXq%2FdJMcahjkulX%2FvFaPUMGYE0aGQOYeveNHKk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1797&quot; height=&quot;1419&quot; data-origin-width=&quot;1797&quot; data-origin-height=&quot;1419&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;h1&gt;4. Discussion&lt;/h1&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;논문에서는 기본적인 Diffusion 기법(DDPM) &amp;rarr; 최신 Diffusion 기법 도입(LDM, 다양한 샘플러 등)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;TimeLDM: Latent Diffusion Model for Unconditional Time Series Generation&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2407.04211&quot;&gt;https://arxiv.org/abs/2407.04211&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;조건부 고도화 &amp;rarr; RAG 기반 시계열 Diffusion
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Retrieval-Augmented Diffusion Models for Time Series Forecasting (RATD)&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2410.18712&quot;&gt;https://arxiv.org/abs/2410.18712&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;figure id=&quot;og_1773047701397&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;TimeLDM: Latent Diffusion Model for Unconditional Time Series Generation&quot; data-og-description=&quot;Time series generation is a crucial research topic in the area of decision-making systems, which can be particularly important in domains like autonomous driving, healthcare, and, notably, robotics. Recent approaches focus on learning in the data space to &quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2407.04211&quot; data-og-url=&quot;https://arxiv.org/abs/2407.04211v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/J2TkN/dJMb9jgvlUP/xSEefAtTAKPiabf6pr1Yg0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bncRSk/dJMb9jOk53W/OviqZPkOp53az8vlwGK3p1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2407.04211&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2407.04211&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/J2TkN/dJMb9jgvlUP/xSEefAtTAKPiabf6pr1Yg0/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bncRSk/dJMb9jOk53W/OviqZPkOp53az8vlwGK3p1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;TimeLDM: Latent Diffusion Model for Unconditional Time Series Generation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Time series generation is a crucial research topic in the area of decision-making systems, which can be particularly important in domains like autonomous driving, healthcare, and, notably, robotics. Recent approaches focus on learning in the data space to&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;figure id=&quot;og_1773047700447&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Retrieval-Augmented Diffusion Models for Time Series Forecasting&quot; data-og-description=&quot;While time series diffusion models have received considerable focus from many recent works, the performance of existing models remains highly unstable. Factors limiting time series diffusion models include insufficient time series datasets and the absence &quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2410.18712&quot; data-og-url=&quot;https://arxiv.org/abs/2410.18712v1&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/leDgu/dJMb85vM4IQ/omt9gJMskK1wB19zRrymkK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/IDo7S/dJMb87f4zRk/qkSK1fzPnDAJ7ZTj9sHzD1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2410.18712&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2410.18712&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/leDgu/dJMb85vM4IQ/omt9gJMskK1wB19zRrymkK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/IDo7S/dJMb87f4zRk/qkSK1fzPnDAJ7ZTj9sHzD1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Retrieval-Augmented Diffusion Models for Time Series Forecasting&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;While time series diffusion models have received considerable focus from many recent works, the performance of existing models remains highly unstable. Factors limiting time series diffusion models include insufficient time series datasets and the absence&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;</description>
      <category>Paper review</category>
      <category>CSDI</category>
      <author>Hippo's data</author>
      <guid isPermaLink="true">https://hipposdata.tistory.com/163</guid>
      <comments>https://hipposdata.tistory.com/entry/CSDI#entry163comment</comments>
      <pubDate>Mon, 9 Mar 2026 22:39:13 +0900</pubDate>
    </item>
    <item>
      <title>Ceteris Paribus Plots (CP), Individual Conditional Expectation (ICE)</title>
      <link>https://hipposdata.tistory.com/entry/Ceteris-Paribus-Plots-CP-Individual-Conditional-Expectation-ICE</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;요즘 XAI가 AI 연구 분야에서 매우 핫한데욥&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt; XAI (Explainable AI)&lt;/b&gt; 는 말 그대로 &lt;b&gt;설명가능한 인공지능&lt;/b&gt; 입니다!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다양한 인공지능 모델들은 복잡한 내부 연산과정으로 인해 &lt;b&gt;블랙박스(Black Box)&lt;/b&gt;의 성질을 보이는데요&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이러한 &lt;b&gt;인공지능 모델이 왜 그렇게 판단을 했는지&lt;/b&gt;를 설명하고자 하는 분야라고 할 수 있습니다!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;특히 현업에서는 아무리 좋은 예측력을 보이더라도 &lt;b&gt;왜 그렇게 판단&lt;/b&gt;했는지에 대한 &lt;b&gt;설명력&lt;/b&gt;이 없으면 무용지물이도라구욥,,,,&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서!&amp;nbsp;이제부터&amp;nbsp;랩실에서&amp;nbsp;진행한&amp;nbsp;&lt;b&gt;XAI&amp;nbsp;스터디&amp;nbsp;내용&lt;/b&gt;들을&amp;nbsp;포스팅하도록&amp;nbsp;하겠습니다!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;해당 스터디는&lt;b&gt; Christoph Molnar&lt;/b&gt;의&lt;b&gt; 'Interpretable Machine Learning'&lt;/b&gt; 교재를 바탕으로 진행되었습니다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://christophm.github.io/interpretable-ml-book/&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://christophm.github.io/interpretable-ml-book/&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1773044289468&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Interpretable Machine Learning&quot; data-og-description=&quot;Why I wrote the book This book began as a side project while I was working as a statistician in clinical research. On my free day, I explored topics that interested me, and interpretable machine learning eventually caught my focus. Expecting plenty of reso&quot; data-og-host=&quot;christophm.github.io&quot; data-og-source-url=&quot;https://christophm.github.io/interpretable-ml-book/&quot; data-og-url=&quot;https://christophm.github.io/interpretable-ml-book/&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/MHxis/dJMb81GVlxi/hhu2wPlzCV5tkr0KAtR0h1/img.jpg?width=4371&amp;amp;height=5724&amp;amp;face=0_0_4371_5724&quot;&gt;&lt;a href=&quot;https://christophm.github.io/interpretable-ml-book/&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://christophm.github.io/interpretable-ml-book/&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/MHxis/dJMb81GVlxi/hhu2wPlzCV5tkr0KAtR0h1/img.jpg?width=4371&amp;amp;height=5724&amp;amp;face=0_0_4371_5724');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Interpretable Machine Learning&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Why I wrote the book This book began as a side project while I was working as a statistician in clinical research. On my free day, I explored topics that interested me, and interpretable machine learning eventually caught my focus. Expecting plenty of reso&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;christophm.github.io&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;Short taxonomy of interpretability methods&lt;/b&gt;&lt;/h2&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1116&quot; data-origin-height=&quot;798&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bi5Vcr/dJMcaaka4WO/no837sCaXMQaIV3qAYl8P1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bi5Vcr/dJMcaaka4WO/no837sCaXMQaIV3qAYl8P1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bi5Vcr/dJMcaaka4WO/no837sCaXMQaIV3qAYl8P1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbi5Vcr%2FdJMcaaka4WO%2Fno837sCaXMQaIV3qAYl8P1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;596&quot; height=&quot;426&quot; data-origin-width=&quot;1116&quot; data-origin-height=&quot;798&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;XAI 기법&lt;/b&gt;을 간단히 &lt;b&gt;분류(taxonomy)&lt;/b&gt; 하면, 해당 그림처럼 나눠지는데요&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;크게 &lt;b&gt;2가지로 분류&lt;/b&gt;가능합니다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;- 모델 구조가 투명해서 그 자체로 설명 가능한 방식&lt;b&gt;(by-design)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;- 모델 학습이 끝난 뒤, 결과가 나온 과정을 분석하는 방식&lt;b&gt;(Post-hoc)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Post-hoc 방식&lt;/b&gt;은 이후에 &lt;b&gt;2가지로 분류&lt;/b&gt;됩니다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;- 어떤 종류든 상관없이 다 쓸 수 있는 범용적인 방식&lt;b&gt;(Model-agnostic)&lt;/b&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;- 특정 모델에서만 가능한 방식&lt;b&gt;(model-specific)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Model-agnostic도 2개로 분류&lt;/b&gt;되는데요&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;- 전체 데이터에 대한 전반적인 판단 기준을 보여주는 전역적 분석&lt;b&gt;(Global)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;- 데이터 하나하나에 대해 왜 그런 판단을 했는지 짚어주는 국소적 분석&lt;b&gt;(Local)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;이 중에서 오늘은 &lt;b&gt;Post-hoc, Model-agnostic, Local &lt;/b&gt;방식에 속하는 &lt;b&gt;CP, ICE&lt;/b&gt;에 대해 알아보겠습니다!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Post-hoc&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&amp;rarr; 모델 학습 후, 사후 설명&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Model-agnostic&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&amp;rarr; 모델 종류와 관계없이 설명&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Local&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&amp;rarr; 개별 데이터 샘플의 모델 판단 설명&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 100%;&quot;&gt;  &lt;span style=&quot;background-color: #ffffff; color: #0a0a0a; text-align: start;&quot;&gt;Contents&lt;/span&gt; &lt;br /&gt;&lt;span&gt;&lt;b&gt;&lt;br /&gt;12 Ceteris Paribus Plots (CP)&lt;br /&gt;13 Individual Conditional Expectation (ICE)&lt;/b&gt;&lt;/span&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;aside&gt;&lt;/aside&gt;
&lt;h1&gt;&lt;b&gt;12 Ceteris Paribus Plots (CP)&lt;/b&gt;&lt;/h1&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;개념 및 정의&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Ceteris paribus (CP)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;사회과학의 연구에서 가정(assumption)으로 활용되는 라틴어 문구&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;뜻: '&lt;b&gt;다른 모든 조건이 동일하다면&lt;/b&gt;'&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 한 피쳐만 변경하고, 다른 피쳐는 그대로 유지&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;관심 있는 피쳐 하나만 변화시켰을 때 모델의 예측값이 어떻게 변하는지&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;CP Curve:&lt;/b&gt; 특정 데이터 1건에 대한 변화 곡선 (Single line)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;CP Plot:&lt;/b&gt; 하나 이상의 CP Curve를 모아놓음&lt;/li&gt;
&lt;li&gt;CP Curve는 &lt;b&gt;ICE&lt;/b&gt;(Individual Conditional Expectation)의 기본 단위, 이들을 평균 내면 &lt;b&gt;PDP&lt;/b&gt;(Partial Dependence plot)&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1600&quot; data-origin-height=&quot;483&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Js2lA/dJMcadVsk64/WKZIcE4NokZU7McWw8Frg0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Js2lA/dJMcadVsk64/WKZIcE4NokZU7McWw8Frg0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Js2lA/dJMcadVsk64/WKZIcE4NokZU7McWw8Frg0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FJs2lA%2FdJMcadVsk64%2FWKZIcE4NokZU7McWw8Frg0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;655&quot; height=&quot;198&quot; data-origin-width=&quot;1600&quot; data-origin-height=&quot;483&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;예시&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;펭귄 성별 예측&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;부리(Bill) 길이에 따른 암컷 확률(P(Female)) 예측
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;x축: bill(부리) 길이&lt;/li&gt;
&lt;li&gt;y축: Female 확률&lt;/li&gt;
&lt;li&gt;점(dot): 실제 펭귄 부리 길이 / ground truth male&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 부리 길이 작으면, 초반에는 P(Female) 약간 증가, 이후 매우 감소&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imagegridblock&quot;&gt;
  &lt;div class=&quot;image-container&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/I2r4j/dJMcagxT4bx/kfw5HmhS8VgvE1gJFajva0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/I2r4j/dJMcagxT4bx/kfw5HmhS8VgvE1gJFajva0/img.png&quot; data-origin-width=&quot;952&quot; data-origin-height=&quot;1265&quot; data-is-animation=&quot;false&quot; width=&quot;492&quot; height=&quot;654&quot; style=&quot;width: 34.5549%; margin-right: 10px;&quot; data-widthpercent=&quot;34.96&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/I2r4j/dJMcagxT4bx/kfw5HmhS8VgvE1gJFajva0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FI2r4j%2FdJMcagxT4bx%2Fkfw5HmhS8VgvE1gJFajva0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;952&quot; height=&quot;1265&quot;/&gt;&lt;/span&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/RnjEF/dJMcagdDAwR/cdHc20fqLXcE1Sgae4aVD1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/RnjEF/dJMcagdDAwR/cdHc20fqLXcE1Sgae4aVD1/img.png&quot; data-origin-width=&quot;1344&quot; data-origin-height=&quot;960&quot; data-is-animation=&quot;false&quot; style=&quot;width: 64.2823%;&quot; data-widthpercent=&quot;65.04&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/RnjEF/dJMcagdDAwR/cdHc20fqLXcE1Sgae4aVD1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FRnjEF%2FdJMcagdDAwR%2FcdHc20fqLXcE1Sgae4aVD1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1344&quot; height=&quot;960&quot;/&gt;&lt;/span&gt;&lt;/div&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;div&gt;&amp;nbsp;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;자전거 대여 수요 예측&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;온도, 계절, 요일 등 다양한 변수에 따른 자전거 대여 수요 예측&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1536&quot; data-origin-height=&quot;960&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ceGSy8/dJMcaa5xZM9/YkG3DbMKs0KKDbXrkX7N50/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ceGSy8/dJMcaa5xZM9/YkG3DbMKs0KKDbXrkX7N50/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ceGSy8/dJMcaa5xZM9/YkG3DbMKs0KKDbXrkX7N50/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FceGSy8%2FdJMcaa5xZM9%2FYkG3DbMKs0KKDbXrkX7N50%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;617&quot; height=&quot;386&quot; data-origin-width=&quot;1536&quot; data-origin-height=&quot;960&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;왼쪽: 범주형변수&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;holiday (공휴일): 현재는 공휴일 아님(N), 공휴일이 된다면(Y) 대여량이 소폭 감소&lt;/li&gt;
&lt;li&gt;season (계절): 현재는 겨울, FALL(가을)로 바뀐다면 대여량이 2,500 근처까지 크게 상승&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;오른쪽: 수치형변수&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;cnt_2d_bfr (이틀 전 대여량): 이틀 전 대여량이 많을수록 오늘의 대여량 예측치도 급격히 상승&lt;/li&gt;
&lt;li&gt;hum (습도): 습도가 높아질수록 대여량 예측값은 하락&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;모델 아키텍처별 CP Curve 비교&lt;/b&gt;&lt;/h2&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1344&quot; data-origin-height=&quot;960&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bhV4dZ/dJMb99MjbjR/uxl3xJYwuP6eV4kplhZ1Fk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bhV4dZ/dJMb99MjbjR/uxl3xJYwuP6eV4kplhZ1Fk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bhV4dZ/dJMb99MjbjR/uxl3xJYwuP6eV4kplhZ1Fk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbhV4dZ%2FdJMb99MjbjR%2Fuxl3xJYwuP6eV4kplhZ1Fk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;489&quot; height=&quot;349&quot; data-origin-width=&quot;1344&quot; data-origin-height=&quot;960&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; 학습한 모델 종류에 따라, CP Curve의 형태가 달라짐&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Linear Model (lm) &amp;rarr; 선형적 모델링&lt;/li&gt;
&lt;li&gt;Decision Tree&amp;rarr; 계단식 (jump)&lt;/li&gt;
&lt;li&gt;RF, SVM &amp;rarr; 부드러운 증가&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;주의사항&lt;/b&gt;&lt;/h2&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;다른 변수간 상관성(correlated) 무시됨 &amp;rarr; 비현실적(Unrealistic) 시나리오 가능성 존재&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1344&quot; data-origin-height=&quot;960&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/biDxGp/dJMcabKbda7/oiWBtDT4pW3oIE6rFaPZLK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/biDxGp/dJMcabKbda7/oiWBtDT4pW3oIE6rFaPZLK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/biDxGp/dJMcabKbda7/oiWBtDT4pW3oIE6rFaPZLK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbiDxGp%2FdJMcabKbda7%2FoiWBtDT4pW3oIE6rFaPZLK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;590&quot; height=&quot;421&quot; data-origin-width=&quot;1344&quot; data-origin-height=&quot;960&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;CP 변화 (검은 화살표):&lt;/b&gt; 다른 조건(몸무게 약 4,000g, 종 Gentoo)은 그대로 두고, &lt;b&gt;부리 두께만 14mm에서 17.5mm로 늘린다면?&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;근처에 &lt;b&gt;노란색 점(Gentoo 종)이 하나도 없음&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;몸무게는 가벼운데 부리만 엄청 두꺼운 Gentoo 펭귄은 현실에 존재하지 않음&lt;/li&gt;
&lt;li&gt;&lt;b&gt;비현실적(Unrealistic) 시나리오&lt;/b&gt; 가능성&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;장점 및 한계&lt;/h2&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;장점(Strengths)&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;구현, 이해 쉬움&lt;/li&gt;
&lt;li&gt;&lt;b&gt;attribution&lt;/b&gt; 방법 한계 보완
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Attribution-based methods : SHAP, LIME
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 피쳐가 그 결과에 얼마나 기여했는지&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;CP는 개별 예측 설명에 좋음 (&lt;b&gt;예측 변화의 양상 시각화&lt;/b&gt;)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;한계(Limitations)&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;한번에 &lt;b&gt;하나 피쳐 변화만 시각화&lt;/b&gt; 가능 (두 변수 상호작용 확인X)&lt;/li&gt;
&lt;li&gt;변수간 &lt;b&gt;상관관계&lt;/b&gt; 있을 시, 해석 어려움&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;구현&lt;/b&gt;&lt;/h2&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;dalex
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;a href=&quot;https://github.com/ModelOriented/DALEX?tab=readme-ov-file&quot;&gt;https://github.com/ModelOriented/DALEX?tab=readme-ov-file&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;alibi
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;a href=&quot;https://github.com/SeldonIO/alibi&quot;&gt;https://github.com/SeldonIO/alibi&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;figure id=&quot;og_1773045297180&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - SeldonIO/alibi: Algorithms for explaining machine learning models&quot; data-og-description=&quot;Algorithms for explaining machine learning models. Contribute to SeldonIO/alibi development by creating an account on GitHub.&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/SeldonIO/alibi&quot; data-og-url=&quot;https://github.com/SeldonIO/alibi&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bOBfPY/dJMb85vM4oI/1mzX2nmenQfMNToCaALkGk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/ddRr58/dJMb81GVlCe/7tfeYbLDdDOgOCE22NA670/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/cxSotr/dJMb8Z3ppfK/Azmsx1TxeozuoVHENkSxXk/img.png?width=2126&amp;amp;height=839&amp;amp;face=0_0_2126_839&quot;&gt;&lt;a href=&quot;https://github.com/SeldonIO/alibi&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/SeldonIO/alibi&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bOBfPY/dJMb85vM4oI/1mzX2nmenQfMNToCaALkGk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/ddRr58/dJMb81GVlCe/7tfeYbLDdDOgOCE22NA670/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/cxSotr/dJMb8Z3ppfK/Azmsx1TxeozuoVHENkSxXk/img.png?width=2126&amp;amp;height=839&amp;amp;face=0_0_2126_839');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - SeldonIO/alibi: Algorithms for explaining machine learning models&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Algorithms for explaining machine learning models. Contribute to SeldonIO/alibi development by creating an account on GitHub.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;figure id=&quot;og_1773045300737&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - ModelOriented/DALEX: moDel Agnostic Language for Exploration and eXplanation&quot; data-og-description=&quot;moDel Agnostic Language for Exploration and eXplanation - ModelOriented/DALEX&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/ModelOriented/DALEX?tab=readme-ov-file&quot; data-og-url=&quot;https://github.com/ModelOriented/DALEX&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/8lxCj/dJMb83kq3S4/BNFK21uLf69s5gvidEqqDk/img.png?width=1280&amp;amp;height=640&amp;amp;face=0_0_1280_640,https://scrap.kakaocdn.net/dn/0CoVM/dJMb8PGuijg/WpxEaaxbo95kFU8YrIT3kK/img.png?width=1280&amp;amp;height=640&amp;amp;face=0_0_1280_640,https://scrap.kakaocdn.net/dn/NOriv/dJMb88eYMTr/yl1fjuZYfwLG86fhXevMj1/img.png?width=520&amp;amp;height=600&amp;amp;face=0_0_520_600&quot;&gt;&lt;a href=&quot;https://github.com/ModelOriented/DALEX?tab=readme-ov-file&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/ModelOriented/DALEX?tab=readme-ov-file&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/8lxCj/dJMb83kq3S4/BNFK21uLf69s5gvidEqqDk/img.png?width=1280&amp;amp;height=640&amp;amp;face=0_0_1280_640,https://scrap.kakaocdn.net/dn/0CoVM/dJMb8PGuijg/WpxEaaxbo95kFU8YrIT3kK/img.png?width=1280&amp;amp;height=640&amp;amp;face=0_0_1280_640,https://scrap.kakaocdn.net/dn/NOriv/dJMb88eYMTr/yl1fjuZYfwLG86fhXevMj1/img.png?width=520&amp;amp;height=600&amp;amp;face=0_0_520_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - ModelOriented/DALEX: moDel Agnostic Language for Exploration and eXplanation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;moDel Agnostic Language for Exploration and eXplanation - ModelOriented/DALEX&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h1&gt;&lt;b&gt;13 Individual Conditional Expectation (ICE)&lt;/b&gt;&lt;/h1&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Peeking Inside the Black Box: Visualizing Statistical Learning with Plots of Individual Conditional Expectation (Goldstein et al., 2015)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/1309.6392&quot;&gt;https://arxiv.org/abs/1309.6392&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1773045298064&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Peeking Inside the Black Box: Visualizing Statistical Learning with Plots of Individual Conditional Expectation&quot; data-og-description=&quot;This article presents Individual Conditional Expectation (ICE) plots, a tool for visualizing the model estimated by any supervised learning algorithm. Classical partial dependence plots (PDPs) help visualize the average partial relationship between the pre&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/1309.6392&quot; data-og-url=&quot;https://arxiv.org/abs/1309.6392v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/b2dZ9w/dJMb85vM4oS/enfWrpnKcEkuzsbKlLYoHK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/ZSaF9/dJMb88F21n7/tBB2Yyk88zTDbzUvURKc4k/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/1309.6392&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/1309.6392&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/b2dZ9w/dJMb85vM4oS/enfWrpnKcEkuzsbKlLYoHK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/ZSaF9/dJMb88F21n7/tBB2Yyk88zTDbzUvURKc4k/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Peeking Inside the Black Box: Visualizing Statistical Learning with Plots of Individual Conditional Expectation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;This article presents Individual Conditional Expectation (ICE) plots, a tool for visualizing the model estimated by any supervised learning algorithm. Classical partial dependence plots (PDPs) help visualize the average partial relationship between the pre&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; PDP가 평균적인 경향만 보여준다는 점을 보완하여, 개별 관측치별 변화를 보여주는 &lt;b&gt;ICE(Individual Conditional Expectation)&lt;/b&gt; 플롯을 제안&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;개념 및 정의&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;각 인트턴스(샘플)&lt;/b&gt;에 대해 피쳐들이 예측에 의존하는 정도를 &lt;b&gt;전부 시각화(CP curve)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 한 줄당, 한 인스턴스&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 각 샘플의 모든 CP curve &amp;rarr; 한 plot에 나타낸 것&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;예시&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;자전거 대여 예측&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1344&quot; data-origin-height=&quot;537&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/eRvpn2/dJMcaiicgz8/z93AW8JcfYkMkDBF9IWNa1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/eRvpn2/dJMcaiicgz8/z93AW8JcfYkMkDBF9IWNa1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/eRvpn2/dJMcaiicgz8/z93AW8JcfYkMkDBF9IWNa1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FeRvpn2%2FdJMcaiicgz8%2Fz93AW8JcfYkMkDBF9IWNa1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;640&quot; height=&quot;256&quot; data-origin-width=&quot;1344&quot; data-origin-height=&quot;537&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 기온, 습도, 풍속에 따른 자전거 대여 예측값의 변화&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;비슷한 궤적&lt;/b&gt;: 다른 피처들(배경 환경)이 어떤 값을 가지든 상관없이, 해당 피처가 결과에 주는 영향이 일정, &lt;b&gt;변수간 상호작용 없음&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;제각각인 궤적&lt;/b&gt;: 배경 상황에 따라 피처의 영향력이 다르게 나타남, &lt;b&gt;변수간 강한 상호작용&lt;/b&gt; 존재&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1344&quot; data-origin-height=&quot;960&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/tBxTc/dJMcahwQEoi/OEd2IdCO1KCetlorqCmVb0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/tBxTc/dJMcahwQEoi/OEd2IdCO1KCetlorqCmVb0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/tBxTc/dJMcahwQEoi/OEd2IdCO1KCetlorqCmVb0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FtBxTc%2FdJMcahwQEoi%2FOEd2IdCO1KCetlorqCmVb0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;550&quot; height=&quot;393&quot; data-origin-width=&quot;1344&quot; data-origin-height=&quot;960&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; ICE 플롯의 선들을 &lt;b&gt;계절(Season)별로 색칠&lt;/b&gt;하여 &lt;b&gt;변수 간 상호작용을 시각화&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;습도가 변함&lt;/b&gt;에 따라 &lt;b&gt;각 데이터 샘플(계절별)의 예측값&lt;/b&gt;이 어떻게 변하는지&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 계절별 습도의 영향이 다름&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;겨울: &lt;b&gt;습도 증가&lt;/b&gt;가 &lt;b&gt;자전거 대여&lt;/b&gt;를 &lt;b&gt;약간만 감소&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;여름: &lt;b&gt;습도 증가&lt;/b&gt;가 &lt;b&gt;자전거 대여&lt;/b&gt;를 &lt;b&gt;많이 감소 (습도 60% 이상부터)&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;Centered ICE plot (C-ICE)&lt;/b&gt;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;기존 ICE 문제점&lt;/b&gt;: 각 인스턴스마다 기본 예측값이 다르기 때문에 곡선들이 위아래로 흩어져서 나타남&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;각 인스턴스 마다 모양 비교 어려움&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;해결&lt;/b&gt;: &lt;b&gt;특정 지점 고정 (Centering)&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;곡선들을 특정 피처 값(주로 해당 피처의 최솟값) 지점에서 강제로 한 점에 모이게 함&lt;/li&gt;
&lt;li&gt;기준점 대비 예측값이 얼마나 변했는가 &lt;b&gt;상대적 변화량&lt;/b&gt;에만 집중&lt;/li&gt;
&lt;li&gt;$ICE_j^{(i)}(x_j) = \hat{f}(x_j, \mathbf{x}{-j}^{(i)}) - \hat{f}(a, \mathbf{x}{-j}^{(i)})$&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1344&quot; data-origin-height=&quot;960&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/LGVMB/dJMcagq9gSf/xKYpW1UfAcRkQCVhZSP6zK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/LGVMB/dJMcagq9gSf/xKYpW1UfAcRkQCVhZSP6zK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/LGVMB/dJMcagq9gSf/xKYpW1UfAcRkQCVhZSP6zK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FLGVMB%2FdJMcagq9gSf%2FxKYpW1UfAcRkQCVhZSP6zK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;531&quot; height=&quot;379&quot; data-origin-width=&quot;1344&quot; data-origin-height=&quot;960&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 관측 최저 온도로 고정 &amp;rarr; 예측, 실제값 차이 보여줌&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;Derivative ICE plot(d-ICE)&lt;/b&gt;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; ICE 플롯의 &lt;b&gt;각 선&lt;/b&gt;에 대해 &lt;b&gt;미분(Derivative)을 계산&lt;/b&gt;하여 시각화&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 각 곡선의 기울기 시각화&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;방향성&lt;/b&gt;: 양수(+)면 해당 피쳐 증가할 때, 예측값이 증가, 음수(-)면 해당 피쳐 증가할 때, 예측값 감소&lt;/li&gt;
&lt;li&gt;&lt;b&gt;정도:&lt;/b&gt; 값이 클수록 해당 지점에서 모델이 &lt;b&gt;민감하게 반응 (급격한 변화)&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$\hat{f}(\mathbf{x}) = \hat{f}(x_j, \mathbf{x}&lt;i&gt;C) = g(x_j) + h(\mathbf{x}&lt;/i&gt;{-j})$&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$with&lt;br /&gt;\frac{\partial \hat{f}(\mathbf{x})}{\partial x_j} = g'(x_j)$&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;모델의 예측이 피쳐 값의 변화에 따라 어느 방향으로, 얼마나 변하는지를 나타냄으로써, 샘플 간 반응(&lt;b&gt;이질성, Heterogeneity)을 시각적으로 더 쉽게 포착&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;상호작용(Interaction)&lt;/b&gt; 확인
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;상호작용: 한 피쳐가 예측값에 미치는 영향이 &lt;b&gt;다른 피쳐의 값에 따라 달라지는 현상&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;상호작용이 없을 때&lt;/b&gt;: 예측 함수는 각 피쳐별 함수의 합으로 표현, 모든 인스턴스에 대한 &lt;b&gt;미분값&lt;/b&gt; &lt;b&gt;동일하게&lt;/b&gt; 나타남&lt;/li&gt;
&lt;li&gt;&lt;b&gt;상호작용이 있을 때&lt;/b&gt;: 인스턴스마다 &lt;b&gt;미분값이 다르게&lt;/b&gt; 나타남&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imagegridblock&quot;&gt;
  &lt;div class=&quot;image-container&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/uoM8L/dJMcagq9gS3/s2oSHxe5gbDUXte6sTp0DK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/uoM8L/dJMcagq9gS3/s2oSHxe5gbDUXte6sTp0DK/img.png&quot; data-origin-width=&quot;605&quot; data-origin-height=&quot;479&quot; data-is-animation=&quot;false&quot; width=&quot;376&quot; height=&quot;298&quot; style=&quot;width: 50.9192%; margin-right: 10px;&quot; data-widthpercent=&quot;51.52&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/uoM8L/dJMcagq9gS3/s2oSHxe5gbDUXte6sTp0DK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FuoM8L%2FdJMcagq9gS3%2Fs2oSHxe5gbDUXte6sTp0DK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;605&quot; height=&quot;479&quot;/&gt;&lt;/span&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b1tMvt/dJMcaiicgFO/0Mkjj06YvFPm8K9LXG7MD1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b1tMvt/dJMcaiicgFO/0Mkjj06YvFPm8K9LXG7MD1/img.png&quot; data-origin-width=&quot;605&quot; data-origin-height=&quot;509&quot; data-is-animation=&quot;false&quot; style=&quot;width: 47.918%;&quot; data-widthpercent=&quot;48.48&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b1tMvt/dJMcaiicgFO/0Mkjj06YvFPm8K9LXG7MD1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb1tMvt%2FdJMcaiicgFO%2F0Mkjj06YvFPm8K9LXG7MD1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;605&quot; height=&quot;509&quot;/&gt;&lt;/span&gt;&lt;/div&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;특정 구간&lt;b&gt;(약 4.4)&lt;/b&gt;에서 미분값이 크게 솟아오름, &lt;b&gt;모델의 예측이 가장 급격하게 변하는 구간&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;선들이 &lt;b&gt;서로 다른 궤적&lt;/b&gt;, 피쳐 간의 &lt;b&gt;복잡한 상호작용(Interaction)&lt;/b&gt;이 존재&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;장점 및 한계&lt;/h2&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;장점(Strengths)&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;이해 직관적(intuitive)&lt;/li&gt;
&lt;li&gt;다양한 관계 파악 용이 (개별 샘플들의 패턴)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;한계(Limitations)&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;한 피쳐의 영향만&lt;/b&gt; 보여줄 수 있음&lt;/li&gt;
&lt;li&gt;&lt;b&gt;상관관계&lt;/b&gt; 영향 - 선의 몇 지점이 유효하지 않은 지점일 수 있음 (비현실적인 지점)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;많은 선&lt;/b&gt; &amp;rarr; plot이 복잡해짐 &amp;rarr; &lt;b&gt;해석 어려워짐&lt;/b&gt; &amp;rarr; 한샘플만 그리거나, 투명도 추가&lt;/li&gt;
&lt;li&gt;&lt;b&gt;전체 경향 파악의 어려움&lt;/b&gt; &amp;rarr; PDP plot과 결합&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;구현&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;scikit-learn - &lt;code&gt;PartialDependenceDisplay&lt;/code&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Alibibi - &lt;a href=&quot;https://github.com/SeldonIO/alibi&quot;&gt;https://github.com/SeldonIO/alibi&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1773045290613&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - SeldonIO/alibi: Algorithms for explaining machine learning models&quot; data-og-description=&quot;Algorithms for explaining machine learning models. Contribute to SeldonIO/alibi development by creating an account on GitHub.&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/SeldonIO/alibi&quot; data-og-url=&quot;https://github.com/SeldonIO/alibi&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bOBfPY/dJMb85vM4oI/1mzX2nmenQfMNToCaALkGk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/ddRr58/dJMb81GVlCe/7tfeYbLDdDOgOCE22NA670/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/cxSotr/dJMb8Z3ppfK/Azmsx1TxeozuoVHENkSxXk/img.png?width=2126&amp;amp;height=839&amp;amp;face=0_0_2126_839&quot;&gt;&lt;a href=&quot;https://github.com/SeldonIO/alibi&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/SeldonIO/alibi&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bOBfPY/dJMb85vM4oI/1mzX2nmenQfMNToCaALkGk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/ddRr58/dJMb81GVlCe/7tfeYbLDdDOgOCE22NA670/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/cxSotr/dJMb8Z3ppfK/Azmsx1TxeozuoVHENkSxXk/img.png?width=2126&amp;amp;height=839&amp;amp;face=0_0_2126_839');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - SeldonIO/alibi: Algorithms for explaining machine learning models&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Algorithms for explaining machine learning models. Contribute to SeldonIO/alibi development by creating an account on GitHub.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>XAI (Explainable AI)</category>
      <category>CP</category>
      <category>Explainable AI</category>
      <category>Ice</category>
      <category>XAI</category>
      <author>Hippo's data</author>
      <guid isPermaLink="true">https://hipposdata.tistory.com/162</guid>
      <comments>https://hipposdata.tistory.com/entry/Ceteris-Paribus-Plots-CP-Individual-Conditional-Expectation-ICE#entry162comment</comments>
      <pubDate>Mon, 9 Mar 2026 17:35:23 +0900</pubDate>
    </item>
    <item>
      <title>딥러닝 데이터 학습 단위 정리 (Epoch, Batch, batch size, Iteration 등)</title>
      <link>https://hipposdata.tistory.com/entry/%EB%94%A5%EB%9F%AC%EB%8B%9D-%EB%8D%B0%EC%9D%B4%ED%84%B0-%ED%95%99%EC%8A%B5-%EB%8B%A8%EC%9C%84-%EC%A0%95%EB%A6%AC-Epoch-Batch-batch-size-Iteration-%EB%93%B1</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;딥러닝 모델을 학습&lt;/b&gt;할 때, 학습 단위 용어가 항상 헷갈린다.... 뭔가 단어도 비슷비슷하다...&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;그래서 각각의 &lt;b&gt;학습단위 용어&lt;/b&gt;들에 대해 간략하게 정리해보았따! (헷갈릴때마다 봐야겠담)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt; 딥러닝 모델을 학습시킬 때 데이터를 어떻게 쪼개고 넣느냐에 따라 부르는 명칭&lt;/b&gt;이 다르다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;전체 데이터가 1000개&lt;/b&gt;인 상황을 가정하고 각 용어의 의미를 확인해보자!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;학습단위 용어&lt;/b&gt;&lt;/h2&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;1.&amp;nbsp;풀&amp;nbsp;배치&amp;nbsp;(Full&amp;nbsp;Batch) &lt;/b&gt;&lt;b&gt;&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;개념&lt;/b&gt;: 나누는 과정 없이 전체 데이터셋을 &lt;b&gt;한 번에 모두&lt;/b&gt; 모델에 넣어 학습&lt;br /&gt;&lt;b&gt;예시&lt;/b&gt;: 1000개의 데이터를 하나로 묶어 통째로 학습&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;2. 미니 배치 (Mini Batch) = 배치 batch&amp;nbsp;&lt;/b&gt;&lt;b&gt;&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;개념&lt;/b&gt;: 전체 데이터셋을 &lt;b&gt;여러 개의 작은 묶음으로 분할&lt;/b&gt; (&lt;span style=&quot;color: #333333; text-align: start;&quot;&gt;컴퓨터 메모리 한계 등)&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/span&gt; &lt;br /&gt;&lt;b&gt;예시&lt;/b&gt;: 전체 1000개의 데이터를 10개의 묶음으로 분할&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;3.&amp;nbsp;배치&amp;nbsp;사이즈&amp;nbsp;(Batch&amp;nbsp;Size) &lt;/b&gt;&lt;b&gt;&lt;/b&gt;&lt;b&gt;&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;개념&lt;/b&gt;: 분할된 &lt;b&gt;각각의 미니 배치&lt;/b&gt;(Mini Batch) 안에 들어있는 &lt;b&gt;실제 데이터의 개수&lt;/b&gt;&lt;br /&gt;&lt;b&gt;예시&lt;/b&gt;: 1000개의 데이터를 10묶음으로 나눔 -&amp;gt; 각 묶음당 100개 데이터 개수 (1000 / 10 = 100) &lt;br /&gt;&lt;b&gt;&lt;/b&gt;&lt;b&gt;&lt;/b&gt;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4. 이터레이션 (Iteration) = 스텝 (Step) &lt;/b&gt;&lt;br /&gt;&lt;b&gt;&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;개념&lt;/b&gt;: 모델이 &lt;b&gt;미니 배치&lt;/b&gt;(Mini Batch) &lt;b&gt;1개&lt;/b&gt;를 가져와서 &lt;b&gt;학습&lt;/b&gt;, 모델의 &lt;b&gt;가중치를 딱 한 번 업데이트&lt;/b&gt;&lt;br /&gt;&lt;b&gt;예시&lt;/b&gt;: 데이터 100개짜리 묶음 하나를 학습 -&amp;gt; 1 이터레이션(Iteration),1 step&lt;br /&gt;&lt;b&gt;&lt;/b&gt;&lt;b&gt;&lt;/b&gt;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;5.&amp;nbsp;에포크&amp;nbsp;(Epoch) &lt;/b&gt;&lt;br /&gt;&lt;b&gt;&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;개념&lt;/b&gt;: 분할된 &lt;b&gt;모든 미니 배치(Mini Batch)가 각각 학습&lt;/b&gt; -&amp;gt; &lt;b&gt;전체 데이터셋이 빠짐없이 딱 한 번 학습 완료&lt;/b&gt;&lt;br /&gt;&lt;b&gt;예시&lt;/b&gt;: 10개의 미니 배치를 모두 학습하려면 총 10번의 이터레이션(Iteration) 필요 -&amp;gt; 이 10번의 학습이 모두 끝나면 1 에포크(Epoch)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;-&amp;gt; 에포크(Epoch)를 채우기 위한 이터레이션(Iteration) 횟수 = 전체 데이터 개수 / 배치 사이즈(Batch Size)&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1024&quot; data-origin-height=&quot;559&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/zOgwU/dJMcabpQDW4/MnEUm7o9JuN7wkJwtKU0h0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/zOgwU/dJMcabpQDW4/MnEUm7o9JuN7wkJwtKU0h0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/zOgwU/dJMcabpQDW4/MnEUm7o9JuN7wkJwtKU0h0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FzOgwU%2FdJMcabpQDW4%2FMnEUm7o9JuN7wkJwtKU0h0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;722&quot; height=&quot;394&quot; data-origin-width=&quot;1024&quot; data-origin-height=&quot;559&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;-&amp;gt; 나노바나나를 통해 직관적으로 시각화해보았다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;해당 데이터 1000개 예시에서는 정확히 전체 데이터가 배치사이즈 개수로 나누어 떨어졌다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;하지만 &lt;b&gt;정확히 나눠지지 않은 경우에는 어떤식으로 학습이 될까?&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt; 데이터가 정수 단위로 나누어 떨어지지 않을 때, 처리 방법&lt;/b&gt;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;가정) 전체 데이터가 1,050개, 배치 사이즈 100 -&amp;gt; 이 경우 100개짜리 미니 배치(Mini Batch)가 10개 만들어지고, 50개의 데이터가 남게 됨&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Case1: 남은 데이터만으로 마지막 배치 구성&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;-&amp;gt; 앞선 10번의 학습은 100개씩 진행하고, &lt;b&gt;남은 50개의 데이터&lt;/b&gt;만 모아서 &lt;b&gt;마지막 11번째 미니 배치를 만들어 학습을 진행 &lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Case 2: 남은 데이터는 버림 (Drop Last)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;-&amp;gt; 나머지 &lt;b&gt;자투리 50개&lt;/b&gt;는 이번 에포크(Epoch)&lt;b&gt; 학습에서 제외&lt;/b&gt;하고, 100개짜리 10개 배치(총 1,000개)만 학습한 뒤 바로 1에포크를 끝냄&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 125px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 125px;&quot;&gt;
&lt;td style=&quot;width: 100%; height: 125px;&quot;&gt;&lt;span&gt;&lt;b&gt;파이토치 데이터로더&amp;nbsp;&lt;br /&gt;&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;from torch.utils.data import DataLoader&lt;br /&gt;dataloader&amp;nbsp;=&amp;nbsp;&lt;b&gt;DataLoader&lt;/b&gt;(dataset,&amp;nbsp;batch_size=100,&amp;nbsp;&lt;b&gt;shuffle&lt;/b&gt;=True,&amp;nbsp;&lt;b&gt;drop_last&lt;/b&gt;=True)&lt;br /&gt;&lt;br /&gt;shuffle=True -&amp;gt; 매 에폭(학습)마다 데이터가 섞임 -&amp;gt; 매번 남는 데이터가달라짐&amp;nbsp;&amp;nbsp;&lt;br /&gt;모델 평가 -&amp;gt; shuffle=False (섞을 필요 없음)&lt;br /&gt;&lt;/span&gt;&lt;br /&gt;drop_last=&lt;span&gt;True -&amp;gt; 나눠지고 남은 데이터 버림 / False -&amp;gt; 남은 데이터로 마지막 배치 구성해서 학습&lt;/span&gt;&lt;br /&gt;(Default -&amp;gt; False)&lt;br /&gt;&lt;br /&gt;&lt;br /&gt;&lt;b&gt;시계열&amp;nbsp;모델&amp;nbsp;-&amp;gt;&amp;nbsp;시간&amp;nbsp;순서(각&amp;nbsp;타임&amp;nbsp;스탬프)가&amp;nbsp;섞이면&amp;nbsp;안됨&lt;/b&gt; &lt;br /&gt;-&amp;gt; 윈도우window 단위(각 윈도우마다 시간 순서가 유지되어 여러 타임 스탬프 포함됨)로 분할 후, 각 배치마다 포함되는 윈도우를 섞어줌(shuffle = True)&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;Reference&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://docs.pytorch.org/docs/stable/data.html&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://docs.pytorch.org/docs/stable/data.html&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1772785272752&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;torch.utils.data &amp;mdash; PyTorch 2.10 documentation&quot; data-og-description=&quot;torch.utils.data Created On: Jun 13, 2025 | Last Updated On: Jun 13, 2025 At the heart of PyTorch data loading utility is the torch.utils.data.DataLoader class. It represents a Python iterable over a dataset, with support for These options are configured b&quot; data-og-host=&quot;docs.pytorch.org&quot; data-og-source-url=&quot;https://docs.pytorch.org/docs/stable/data.html&quot; data-og-url=&quot;https://docs.pytorch.org/docs/stable/data.html&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://docs.pytorch.org/docs/stable/data.html&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://docs.pytorch.org/docs/stable/data.html&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;torch.utils.data &amp;mdash; PyTorch 2.10 documentation&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;torch.utils.data Created On: Jun 13, 2025 | Last Updated On: Jun 13, 2025 At the heart of PyTorch data loading utility is the torch.utils.data.DataLoader class. It represents a Python iterable over a dataset, with support for These options are configured b&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;docs.pytorch.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;</description>
      <category>DL(Deep Learning)</category>
      <category>batch</category>
      <category>Batch size</category>
      <category>Epoch</category>
      <category>iteration</category>
      <category>step</category>
      <author>Hippo's data</author>
      <guid isPermaLink="true">https://hipposdata.tistory.com/161</guid>
      <comments>https://hipposdata.tistory.com/entry/%EB%94%A5%EB%9F%AC%EB%8B%9D-%EB%8D%B0%EC%9D%B4%ED%84%B0-%ED%95%99%EC%8A%B5-%EB%8B%A8%EC%9C%84-%EC%A0%95%EB%A6%AC-Epoch-Batch-batch-size-Iteration-%EB%93%B1#entry161comment</comments>
      <pubDate>Fri, 6 Mar 2026 17:45:09 +0900</pubDate>
    </item>
    <item>
      <title>[Paper review] VIT(Vision Transformer)</title>
      <link>https://hipposdata.tistory.com/entry/Paper-review-VITVision-Transformer</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Paper:&lt;/b&gt; AN IMAGE IS WORTH 16X16 WORDS: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE (Alexey Dosovitskiy et al.)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Conference:&lt;/b&gt; ICLR 2021&lt;/li&gt;
&lt;li&gt;&lt;b&gt;GitHub Repository:&lt;/b&gt; &lt;a href=&quot;https://github.com/google-research/vision_transformer&quot;&gt;https://github.com/google-research/vision_transformer&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;ArXiv:&lt;/b&gt; &lt;a href=&quot;https://arxiv.org/abs/2010.11929&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2010.11929&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;figure id=&quot;og_1772503362631&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - google-research/vision_transformer&quot; data-og-description=&quot;Contribute to google-research/vision_transformer development by creating an account on GitHub.&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/google-research/vision_transformer&quot; data-og-url=&quot;https://github.com/google-research/vision_transformer&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bmhoYY/dJMb9lL86xQ/XqfIQgSkaqBTW6TGtXxb4k/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/fWSh7/dJMb9bvZRwc/SGqvxqRu3ukfDwZPrh53j1/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/google-research/vision_transformer&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/google-research/vision_transformer&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bmhoYY/dJMb9lL86xQ/XqfIQgSkaqBTW6TGtXxb4k/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/fWSh7/dJMb9bvZRwc/SGqvxqRu3ukfDwZPrh53j1/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - google-research/vision_transformer&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Contribute to google-research/vision_transformer development by creating an account on GitHub.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;figure id=&quot;og_1772503362011&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale&quot; data-og-description=&quot;While the Transformer architecture has become the de-facto standard for natural language processing tasks, its applications to computer vision remain limited. In vision, attention is either applied in conjunction with convolutional networks, or used to rep&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2010.11929&quot; data-og-url=&quot;https://arxiv.org/abs/2010.11929v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bk3bTv/dJMb88F2rgL/H8vVkVZNTLLcdyBNj58Xe1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bceFvA/dJMb8866pEC/9kdRyHvgYtNu4VG8UzGvo1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2010.11929&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2010.11929&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bk3bTv/dJMb88F2rgL/H8vVkVZNTLLcdyBNj58Xe1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bceFvA/dJMb8866pEC/9kdRyHvgYtNu4VG8UzGvo1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;While the Transformer architecture has become the de-facto standard for natural language processing tasks, its applications to computer vision remain limited. In vision, attention is either applied in conjunction with convolutional networks, or used to rep&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&amp;rarr; &lt;b&gt;이미지&lt;/b&gt;를 &lt;b&gt;패치단위&lt;/b&gt;로 분할하여 &lt;b&gt;Transformer&lt;/b&gt; 적용&lt;/span&gt;&lt;/p&gt;
&lt;h1&gt;1. SUMMARIZE&lt;/h1&gt;
&lt;table id=&quot;301bd201-015f-8014-b341-f1e4fdd9111c&quot; style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style12&quot;&gt;
&lt;tbody&gt;
&lt;tr id=&quot;301bd201-015f-804f-b95d-fc0565a88949&quot;&gt;
&lt;td id=&quot;b&amp;#96;j[&quot;&gt;&lt;b&gt;항목&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;&amp;lt;RgY&quot;&gt;&lt;b&gt;핵심 내용&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;301bd201-015f-80a7-91c2-e028c0242335&quot;&gt;
&lt;td id=&quot;b&amp;#96;j[&quot;&gt;&lt;b&gt;Problem&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;&amp;lt;RgY&quot;&gt;NLP는 Transformer가 표준이나, 비전은 여전히&lt;b&gt; CNN이 주류&lt;/b&gt;&lt;br /&gt;&amp;bull; 기존 비전 모델은 이미지의 지역성(Locality)과 이동 불변성(Translation Invariance)이라는 &lt;b&gt;Inductive Bias&lt;/b&gt;에 지나치게 의존&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;301bd201-015f-802a-8975-c464f5ecf6be&quot;&gt;
&lt;td id=&quot;b&amp;#96;j[&quot;&gt;&lt;b&gt;Method&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;&amp;lt;RgY&quot;&gt;&lt;b&gt;VIT(Vision Transformer)&lt;br /&gt;1. Transformer Encoder input&lt;br /&gt;&lt;/b&gt; &amp;bull; Image 패치화 (Patch)&lt;br /&gt;&lt;b&gt; &amp;bull; &lt;/b&gt;Flatten + Linear Projection&lt;br /&gt;&amp;bull; CLS 토큰 추가, Position Embedding&lt;br /&gt;&lt;b&gt;&lt;br /&gt;2. Transformer Encoder &lt;br /&gt;&amp;bull; &lt;/b&gt;MSA(Multi Head Self-Attention), MLP&lt;br /&gt;&amp;bull; Layer Normalization (LN)&lt;br /&gt;&amp;bull; Residual Connections&lt;br /&gt;&lt;b&gt;&lt;br /&gt;3. MLP Head&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;301bd201-015f-80e4-8d4c-fa11864b7c04&quot;&gt;
&lt;td id=&quot;b&amp;#96;j[&quot;&gt;&lt;b&gt;Results&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;&amp;lt;RgY&quot;&gt;&lt;b&gt;대규모 데이터셋에서 SOTA 달성&lt;/b&gt;&lt;br /&gt;&amp;bull; ImageNet(중간 규모)에서는 Inductive Bias 부족으로 성능이 낮으나, &lt;b&gt;JFT-300M(초대규모)&lt;/b&gt; 사전 학습 시 데이터 양으로 이를 극복하며 최신 CNN 모델을 압도.&lt;br /&gt;&amp;bull; 동일 성능 대비 CNN보다 &lt;b&gt;계산 비용&lt;/b&gt;(Computational Cost)이 &lt;b&gt;더 효율적&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;301bd201-015f-8020-aeba-fc224f3afa25&quot;&gt;
&lt;td id=&quot;b&amp;#96;j[&quot;&gt;&lt;b&gt;Contribution&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;&amp;lt;RgY&quot;&gt;&amp;bull; 이미지를 픽셀 그리드가 아닌 &lt;b&gt;패치 시퀀스&lt;/b&gt;로 정의하여, &lt;b&gt;비전 문제를 NLP 방식으로 해결하는 프레임워크 제시&lt;/b&gt;&lt;br /&gt;&amp;bull; 복잡한 CNN 없이 &quot;&lt;b&gt;대량의 데이터 + 기본 Transformer&lt;/b&gt;&quot; 조합&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h1&gt;&amp;nbsp;&lt;/h1&gt;
&lt;h1&gt;2. DETAIL&lt;/h1&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;1. Introduction&lt;/b&gt;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;NLP 분야&lt;/b&gt; &amp;rarr; Transformer 도입 성공&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;CV분야&lt;/b&gt; &amp;rarr; 여전히 &lt;b&gt;CNN 아키텍처 지배적&lt;/b&gt;, CNN + Self Attention 연구 진행&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; Transformer 구조 CV분야에 직접 적용하는 방식 제안&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;2. RELATED WORK&lt;/b&gt;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;CV 분야 Transformer 도입 접근방식&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;이미지에 Self-Attention 직접 적용 &amp;rarr; &lt;b&gt;각 모든 픽셀에 대해 어텐션&lt;/b&gt; &amp;rarr; $O(N^2)$&lt;/li&gt;
&lt;li&gt;다양한 근사(approximate) 방식 시도&lt;b&gt;(국소적, 희소(sparse), 축별(axial) 어텐션&lt;/b&gt;)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;VIT와 가장 유사한 선행연구&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Paper&lt;/b&gt;: On the Relationship between Self-Attention and Convolutional Layers (2020, Cordonnier et al.)&lt;/li&gt;
&lt;li&gt;2 X 2 패치 &amp;rarr; Self-Attention (CNN 국소적인 정보처리능력을 작은 패치단위 어텐션을 통해 대체)&lt;/li&gt;
&lt;li&gt;고정된 패치단위 연구 &amp;rarr; &lt;b&gt;작은 해상도만 처리 가능&lt;/b&gt; (2x2 패치)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;VIT&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;더 큰 크기 패치&amp;rarr; &lt;b&gt;더 큰 해상도 처리가능, 큰 데이터셋 학습 가능&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;3. METHOD&lt;/b&gt;&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;3.1 VISION TRANSFORMER (VIT)&lt;/b&gt;&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;756&quot; data-origin-height=&quot;395&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Tv4WU/dJMcajnJ9hi/EfW1W3lvYQ4FelIPs1GydK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Tv4WU/dJMcajnJ9hi/EfW1W3lvYQ4FelIPs1GydK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Tv4WU/dJMcajnJ9hi/EfW1W3lvYQ4FelIPs1GydK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FTv4WU%2FdJMcajnJ9hi%2FEfW1W3lvYQ4FelIPs1GydK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;756&quot; height=&quot;395&quot; data-origin-width=&quot;756&quot; data-origin-height=&quot;395&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$$ &lt;br /&gt;\begin{aligned} &lt;br /&gt;\mathbf{z}_0&amp;nbsp;&amp;amp;=&amp;nbsp;[\mathbf{x}_{\text{class}};&amp;nbsp;\mathbf{x}_p^1&amp;nbsp;\mathbf{E};&amp;nbsp;\cdots&amp;nbsp;;&amp;nbsp;\mathbf{x}_p^N&amp;nbsp;\mathbf{E}]&amp;nbsp;+&amp;nbsp;\mathbf{E}_{\text{pos}},&amp;nbsp;&amp;amp;&amp;amp;&amp;nbsp;\mathbf{E}&amp;nbsp;\in&amp;nbsp;\mathbb{R}^{(P^2&amp;nbsp;\cdot&amp;nbsp;C)&amp;nbsp;\times&amp;nbsp;D},&amp;nbsp;\mathbf{E}_{\text{pos}}&amp;nbsp;\in&amp;nbsp;\mathbb{R}^{(N+1)&amp;nbsp;\times&amp;nbsp;D}&amp;nbsp;&amp;amp;&amp;nbsp;\text{(1)}&amp;nbsp;\\ &lt;br /&gt;\mathbf{z}'_\ell&amp;nbsp;&amp;amp;=&amp;nbsp;\text{MSA}(\text{LN}(\mathbf{z}_{\ell-1}))&amp;nbsp;+&amp;nbsp;\mathbf{z}_{\ell-1},&amp;nbsp;&amp;amp;&amp;amp;&amp;nbsp;\ell&amp;nbsp;=&amp;nbsp;1&amp;nbsp;\dots&amp;nbsp;L&amp;nbsp;&amp;amp;&amp;nbsp;\text{(2)}&amp;nbsp;\\ &lt;br /&gt;\mathbf{z}_\ell&amp;nbsp;&amp;amp;=&amp;nbsp;\text{MLP}(\text{LN}(\mathbf{z}'_\ell))&amp;nbsp;+&amp;nbsp;\mathbf{z}'_\ell,&amp;nbsp;&amp;amp;&amp;amp;&amp;nbsp;\ell&amp;nbsp;=&amp;nbsp;1&amp;nbsp;\dots&amp;nbsp;L&amp;nbsp;&amp;amp;&amp;nbsp;\text{(3)}&amp;nbsp;\\ &lt;br /&gt;\mathbf{y}&amp;nbsp;&amp;amp;=&amp;nbsp;\text{LN}(\mathbf{z}_L^0)&amp;nbsp;&amp;amp;&amp;amp;&amp;nbsp;&amp;amp;&amp;nbsp;\text{(4)} &lt;br /&gt;\end{aligned} &lt;br /&gt;$$&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 133px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 100%;&quot;&gt; &lt;b&gt;VIT 과정&lt;/b&gt;&lt;br /&gt;
&lt;ol style=&quot;list-style-type: decimal; color: #333333; text-align: start;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;b&gt;Transformer Encoder input&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Transformer Encoder&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;MLP Head&lt;/b&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;1. Transformer Encoder input&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$$ &lt;br /&gt;\begin{aligned} &lt;br /&gt;\mathbf{z}_0&amp;nbsp;&amp;amp;=&amp;nbsp;[\mathbf{x}_{\text{class}};&amp;nbsp;\mathbf{x}_p^1&amp;nbsp;\mathbf{E};&amp;nbsp;\cdots&amp;nbsp;;&amp;nbsp;\mathbf{x}_p^N&amp;nbsp;\mathbf{E}]&amp;nbsp;+&amp;nbsp;\mathbf{E}_{\text{pos}},&amp;nbsp;&amp;amp;&amp;amp;&amp;nbsp;\mathbf{E}&amp;nbsp;\in&amp;nbsp;\mathbb{R}^{(P^2&amp;nbsp;\cdot&amp;nbsp;C)&amp;nbsp;\times&amp;nbsp;D},&amp;nbsp;\mathbf{E}_{\text{pos}}&amp;nbsp;\in&amp;nbsp;\mathbb{R}^{(N+1)&amp;nbsp;\times&amp;nbsp;D}&amp;nbsp;&amp;amp;&amp;nbsp;\text{(1)} &lt;br /&gt;\end{aligned} &lt;br /&gt;$$&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;이미지 패치
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;원본이미지($x&amp;isin;R^{H&amp;times;W&amp;times;C}$) &amp;rarr; P X P 개의 패치로 분할($x_p​&amp;isin;R^{N&amp;times;(P^2&amp;sdot;C)}$)&lt;/li&gt;
&lt;li&gt;H: 높이 / W: 너비 / C: 채널 (RGB = 3채널)&lt;/li&gt;
&lt;li&gt;패치 총 개수 N = H&amp;times;W / $P^2$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;평탄화(Flatten)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;1D 시퀀스&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;선형투영(Linear Projection)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$E&amp;isin;R^{(P^2&amp;sdot;C)&amp;times;D}$ &amp;rarr; D차원 임베딩 벡터로 변환&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;CLS 토큰 추가
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;패치 임베딩 제일 앞&lt;/li&gt;
&lt;li&gt;&lt;b&gt;최종 이미지 분류&lt;/b&gt;에 사용됨&lt;/li&gt;
&lt;li&gt;$\mathbf{x}_{\text{class}}$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;위치 임베딩(Position Embedding)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 패치들의 &lt;b&gt;공간적 위치 정보를 유지&lt;/b&gt;하기 위함&lt;/li&gt;
&lt;li&gt;$E_{pos}​&amp;isin;R^{(N+1)&amp;times;D}$&lt;b&gt;&lt;/b&gt;&lt;b&gt;&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;2. Transformer Encoder&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Multi-Head Self-Attention (MSA)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$\begin{aligned}&amp;nbsp; &lt;br /&gt;\mathbf{z}'_{\ell}&amp;nbsp;&amp;amp;=&amp;nbsp;\text{MSA}(\text{LN}(\mathbf{z}_{\ell-1}))&amp;nbsp;+&amp;nbsp;\mathbf{z}_{\ell-1},&amp;nbsp;&amp;amp;&amp;nbsp;\ell&amp;nbsp;&amp;amp;=&amp;nbsp;1&amp;nbsp;\dots&amp;nbsp;L&amp;nbsp;&amp;amp;&amp;nbsp;\text{(2)}&amp;nbsp; &lt;br /&gt;\end{aligned}$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;MLP
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$\begin{aligned}\mathbf{z}_\ell &amp;amp;= \text{MLP}(\text{LN}(\mathbf{z}'_\ell)) + \mathbf{z}'_\ell, &amp;amp;&amp;amp; \ell = 1 \dots L &amp;amp; \text{(3)}\end{aligned}$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Layer Normalization (Norm)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;MSA, MLP 전 적용(Pre-LN)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Residual Connections (+)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;MSA, MLP 이후 적용&lt;/li&gt;
&lt;li&gt;input값을 해당 출력에 직접 더해주는 방식&lt;/li&gt;
&lt;li&gt;모델이 깊어질때, 학습이 안정되도록&lt;/li&gt;
&lt;li&gt;= skip connection&lt;/li&gt;
&lt;li&gt;$\begin{aligned}&amp;nbsp;&lt;br /&gt;\mathbf{z}'_{\ell}&amp;nbsp;&amp;amp;=&amp;nbsp;\text{MSA}(\text{LN}(\mathbf{z}_{\ell-1}))&amp;nbsp;+&amp;nbsp;\mathbf{z}_{\ell-1},&amp;nbsp;&amp;amp;&amp;nbsp;\ell&amp;nbsp;&amp;amp;=&amp;nbsp;1&amp;nbsp;\dots&amp;nbsp;L&amp;nbsp;&amp;amp;&amp;nbsp;\text{(2)}&amp;nbsp;&lt;br /&gt;\end{aligned}$&lt;/li&gt;
&lt;li&gt;$\begin{aligned}\mathbf{z}_\ell &amp;amp;= \text{MLP}(\text{LN}(\mathbf{z}'_\ell)) + \mathbf{z}'_\ell, &amp;amp;&amp;amp; \ell = 1 \dots L &amp;amp; \text{(3)}\end{aligned}$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;3. MLP Head&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;MLP input&lt;/b&gt;: $\begin{aligned}\mathbf{y} &amp;amp;= \text{LN}(\mathbf{z}_L^0) &amp;amp;&amp;amp; &amp;amp; \text{(4)} \end{aligned}$
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$z^0_L$ : Transformer Encoder 마지막(L번째) CLS(0번째 인덱스) 토큰&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Transformer Encoder 의 결과 y를 최종 MLP Head 입력
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Pre-train&lt;/b&gt;: &amp;ldquo;one hidden layer&amp;rdquo; &amp;rarr; 선형 계층 + &lt;b&gt;활성화 함수(GELU)&lt;/b&gt; + 선형 계층
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$W_2​(&amp;sigma;(W_1​y+b_1​))+b_2​$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Fine-tuning&lt;/b&gt;: &amp;ldquo;single linear layer&amp;rdquo; &amp;rarr; 선형계층
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$W_1y + b_1$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;hr data-ke-style=&quot;style1&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;Inductive bias&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 100%;&quot;&gt; &lt;span&gt;&lt;b&gt;Inductive bias&lt;/b&gt;&lt;br /&gt;&amp;nbsp; &amp;rarr; 모델이 가지고 있는 기본 가정&lt;/span&gt;&lt;br /&gt;&lt;b&gt;&lt;span&gt;&lt;br /&gt;예)&lt;/span&gt;&lt;/b&gt;&lt;br /&gt;&lt;span&gt;&lt;b&gt;CNN &amp;rarr; Locality&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&amp;rarr; 이미지는 가까운 픽셀간 강한 연관성이 있다&lt;br /&gt;&lt;b&gt;RNN &amp;rarr; Sequentiality, Temporal Dependence&lt;/b&gt;&lt;br /&gt;&amp;rarr; 현재 정보는 과거의 정보에 영향을 받는다&lt;/span&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;aside&gt;&lt;/aside&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; CNN에 비해 VIT &lt;b&gt;Inductive bias 약함&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;CNN
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;지역성(Locality)&lt;/b&gt; &amp;rarr; filter를 통한 Convolution 연산은 특정 픽셀 주위만 고려&lt;/li&gt;
&lt;li&gt;&lt;b&gt;2차원 구조 보존&lt;/b&gt; &amp;rarr; filter는 2차원 이미지를 슬라이딩하며 공간적 구조 보존&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;VIT
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;MLP&lt;/b&gt;(Transformer 인코더 내부) &amp;rarr; 각 토큰별로 비선형 연산 &amp;rarr; &lt;b&gt;지역성(Locality)&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Self-Attention&lt;/b&gt; &amp;rarr;각 패치는 다른 모든 패치에 대해 어텐션 연산 적용 &amp;rarr; &lt;b&gt;전역적(global)&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 오히려 VIT의 낮은 &lt;b&gt;Inductive bias &amp;rarr; 대규모 데이터셋에 강점&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;Hybrid Architecture&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 원본 이미지 패치가 아닌 CNN이 추출한 &lt;b&gt;feature map&lt;/b&gt;(Convolution 연산)을 &lt;b&gt;Transformer 입력으로 사용&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;CNN의&lt;/b&gt; &lt;b&gt;Inductive bias(지역성) + VIT의 Inductive bias(전역성) 결합&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;적은 데이터 셋에서는 VIT보다 좋은 성능, 데이터가 많아질 때, VIT와 성능차이 줄어듦&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;3.2 FINE-TUNING AND HIGHER RESOLUTION&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 대규모 데이터 셋에서 pre-train된 VIT모델 &amp;rarr; &lt;b&gt;downstream tasks&lt;/b&gt; 맞춰 &lt;b&gt;Fine-tuning&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Fine-tuning 방법 (classification task)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;기존 &lt;b&gt;prediction head&lt;/b&gt;(MLP Head) &lt;b&gt;교체&lt;/b&gt; (D &amp;times; K feedforward layer)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;D: 모델 hidden dimension&lt;/li&gt;
&lt;li&gt;K: downstream task에서 Class 수&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;prediction head&lt;/b&gt; 가중치 0 초기화(zero-initialize)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;pre-train보다 &lt;b&gt;높은 해상도&lt;/b&gt;의 이미지로 Fine-tuning &amp;rarr; 성능 향상에 도움됨
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;(낮은&amp;rarr; 높은) 해상도: 패치 크기는 일정, 패치 개수 증가&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;4. EXPERIMENTS&lt;/b&gt;&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;4.1 SETUP&lt;/b&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Dataset&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Pre-train&lt;/b&gt;: ILSVRC-2012 ImageNet, ImageNet-21k, JFT-300M(1만 8천개 클래스, 1천4백만 이미지)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Transfer learning&lt;/b&gt;: ImageNet, CIFAR-10/100, Oxford-IIIT Pets, Oxford Flowers-102, VTAB (Visual Task Adaptation Benchmark) - (Natural, Specialized, Structured 세 종류 총 19task)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Model Variants&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;VIT(Base, Large, Huge)&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;ResNet(BIT)&lt;/b&gt;: Baseline - CNN, Group Normalization(기존 Batch Normalization)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Hybrid:&lt;/b&gt; CNN Featuremap &amp;rarr; input&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Training &amp;amp; Fine-tuning&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Pre-Train, Fine-tuning&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Metrics&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Fine-tuning Accuracy&lt;/li&gt;
&lt;li&gt;Few-Shot Accuracy&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;4.2 COMPARISON TO STATE OF THE ART&lt;/b&gt;&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;797&quot; data-origin-height=&quot;235&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/sjoLA/dJMcafTfZuw/BdAVKlSd0b3MHegsUOi6mk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/sjoLA/dJMcafTfZuw/BdAVKlSd0b3MHegsUOi6mk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/sjoLA/dJMcafTfZuw/BdAVKlSd0b3MHegsUOi6mk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FsjoLA%2FdJMcafTfZuw%2FBdAVKlSd0b3MHegsUOi6mk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;797&quot; height=&quot;235&quot; data-origin-width=&quot;797&quot; data-origin-height=&quot;235&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;가장 큰 VIT 모델&lt;/b&gt; ViT-H/14가 여러 Task에서 &lt;b&gt;좋은 성능&lt;/b&gt;달성&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; BIT, Noisy Student보다 &lt;b&gt;적은 계산 자원&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 동일한 VIT 모델에서도, &lt;b&gt;사전학습 데이터셋이 클 수록, 더 좋은 성능&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;771&quot; data-origin-height=&quot;176&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bqesqd/dJMcafTfZuP/hr8mJVWpmIT6Zd9KY6LdL0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bqesqd/dJMcafTfZuP/hr8mJVWpmIT6Zd9KY6LdL0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bqesqd/dJMcafTfZuP/hr8mJVWpmIT6Zd9KY6LdL0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbqesqd%2FdJMcafTfZuP%2Fhr8mJVWpmIT6Zd9KY6LdL0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;771&quot; height=&quot;176&quot; data-origin-width=&quot;771&quot; data-origin-height=&quot;176&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; VTAB task 정확도&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;가장 큰 VIT 모델&lt;/b&gt; ViT-H/14가 여러 Task에서 &lt;b&gt;좋은 성능&lt;/b&gt;달성&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;4.3 PRE-TRAINING DATA REQUIREMENTS&lt;/b&gt;&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imagegridblock&quot;&gt;
  &lt;div class=&quot;image-container&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bOU2Hi/dJMb99Me7hO/lxPfA7iKTpSnxStQggICe1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bOU2Hi/dJMb99Me7hO/lxPfA7iKTpSnxStQggICe1/img.png&quot; data-origin-width=&quot;366&quot; data-origin-height=&quot;255&quot; data-is-animation=&quot;false&quot; style=&quot;width: 48.9605%; margin-right: 10px;&quot; data-widthpercent=&quot;49.54&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bOU2Hi/dJMb99Me7hO/lxPfA7iKTpSnxStQggICe1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbOU2Hi%2FdJMb99Me7hO%2FlxPfA7iKTpSnxStQggICe1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;366&quot; height=&quot;255&quot;/&gt;&lt;/span&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/JlBUe/dJMcacPLv6I/zsyK529uKH26Qtcl2Rsrzk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/JlBUe/dJMcacPLv6I/zsyK529uKH26Qtcl2Rsrzk/img.png&quot; data-origin-width=&quot;367&quot; data-origin-height=&quot;251&quot; data-is-animation=&quot;false&quot; style=&quot;width: 49.8767%;&quot; data-widthpercent=&quot;50.46&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/JlBUe/dJMcacPLv6I/zsyK529uKH26Qtcl2Rsrzk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FJlBUe%2FdJMcacPLv6I%2FzsyK529uKH26Qtcl2Rsrzk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;367&quot; height=&quot;251&quot;/&gt;&lt;/span&gt;&lt;/div&gt;
&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;데이터셋 규모에 따른 ViT 모델 성능&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;ViT &amp;rarr; 대규모 데이터셋으로 사전 학습 &amp;rarr; 최고 성능(CNN 능가)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;CNN Inductive bias(지역성)&lt;/b&gt; &amp;rarr; &lt;b&gt;작은 데이터셋에서 이점&lt;/b&gt; / &lt;b&gt;큰 데이터셋&lt;/b&gt;에서는 &lt;b&gt;VIT의 유연성이 강점&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;4.4 SCALING STUDY&lt;/b&gt;&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;731&quot; data-origin-height=&quot;309&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b8Rqiz/dJMb99S1FyH/A6euKyJacDyGj0bIRbY8wk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b8Rqiz/dJMb99S1FyH/A6euKyJacDyGj0bIRbY8wk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b8Rqiz/dJMb99S1FyH/A6euKyJacDyGj0bIRbY8wk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb8Rqiz%2FdJMb99S1FyH%2FA6euKyJacDyGj0bIRbY8wk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;731&quot; height=&quot;309&quot; data-origin-width=&quot;731&quot; data-origin-height=&quot;309&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;모델별 계산비용, 전이학습 성능 비교&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;VIT&lt;/b&gt; - 파란색원이 &lt;b&gt;ResNet(BIT)&lt;/b&gt; - 회색사각형보다 &lt;b&gt;전반적으로 높은 성능&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;동일한 계산비용으로 ResNet(BIT) 보다 &lt;b&gt;VIT가 더 높은 성능&lt;/b&gt;을 보임 &lt;b&gt;(계산 효율성)&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;낮은 계산비용&lt;/b&gt;&amp;rarr; VIT보다 &lt;b&gt;Hybrid가 높은 성능 / 높은 계산비용 &amp;rarr; VIT가 높은 성능&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;낮은 계산비용 단계&lt;/b&gt;에 &lt;b&gt;CNN의 inductive bias 여전히 유용&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;4.5 INSPECTING VISION TRANSFORMER&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;ViT&lt;/b&gt; 모델이 &lt;b&gt;이미지 데이터를 내부적으로 어떻게 처리&lt;/b&gt;하는지 &lt;b&gt;(동작방식 이해)&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;213&quot; data-origin-height=&quot;380&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/kDtwB/dJMcaiWHRF4/fjxil0R2sLgKyd2yngwr70/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/kDtwB/dJMcaiWHRF4/fjxil0R2sLgKyd2yngwr70/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/kDtwB/dJMcaiWHRF4/fjxil0R2sLgKyd2yngwr70/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FkDtwB%2FdJMcaiWHRF4%2Ffjxil0R2sLgKyd2yngwr70%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;213&quot; height=&quot;380&quot; data-origin-width=&quot;213&quot; data-origin-height=&quot;380&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;CLS 토큰&lt;/b&gt;이 입력 이미지의 &lt;b&gt;어떤 패치(patch)&lt;/b&gt;들에 가장 강하게 &lt;b&gt;어텐션(attention)&lt;/b&gt;했는지&lt;/p&gt;
&lt;aside&gt;&lt;/aside&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 100%;&quot;&gt; &lt;span&gt;&lt;b&gt;Attention Rollout&lt;/b&gt;&lt;br /&gt;&amp;rarr; 모델이 입력데이터 어디를 보고 판단했는지 (&lt;b&gt;XAI&lt;/b&gt;)&lt;br /&gt;&amp;rarr;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;트랜스포머 여러 레이어&lt;/b&gt;를 거치면서&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;정보 섞임&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;(2번째 어텐션 맵은, 1번째 레이어의 출력값에 대한 어텐션 스코어/ 최종 CLS 토큰에는 모든 레이어 어텐션 결과 누적됨)&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&lt;b&gt;계산방법&lt;/b&gt;:&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&amp;rarr; Multi-Head Self-Attention 가중치&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;헤드 평균&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&amp;rarr; 각 레이어 걸쳐&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;재귀적으로 곱함&lt;/b&gt;&lt;/span&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;795&quot; data-origin-height=&quot;233&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/tqfjw/dJMcagYUNqM/LbuA6F0Jl2ekG6HtMQctf1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/tqfjw/dJMcagYUNqM/LbuA6F0Jl2ekG6HtMQctf1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/tqfjw/dJMcagYUNqM/LbuA6F0Jl2ekG6HtMQctf1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Ftqfjw%2FdJMcagYUNqM%2FLbuA6F0Jl2ekG6HtMQctf1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;795&quot; height=&quot;233&quot; data-origin-width=&quot;795&quot; data-origin-height=&quot;233&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;(좌)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$\begin{aligned}&amp;nbsp; &lt;br /&gt;\mathbf{z}_0 &amp;amp;= [\mathbf{x}_{\text{class}}; \mathbf{x}_p^1 \mathbf{E}; \cdots ; \mathbf{x}_p^N \mathbf{E}] + \mathbf{E}_{pos}, &amp;amp; \mathbf{E} &amp;amp;\in \mathbb{R}^{(P^2 \cdot C) \times D}, \mathbf{E}_{pos} \in \mathbb{R}^{(N+1) \times D} &amp;amp; \text{(1)}&lt;br /&gt;\end{aligned}$&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;E 행렬 &amp;rarr; PCA &amp;rarr; 시각화&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;E 행렬&lt;/b&gt;: 이미지 패치 평탄화(Flatten) &amp;rarr; 선형투영(linear projection) &amp;rarr; Transformer 입력차원에 맞춘 가중치&lt;/li&gt;
&lt;li&gt;특정한 패턴 보임 &amp;rarr; 이미지의 저차원 표현 학습&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;(중앙)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; 패치 1D 위치 임베딩간 코사인 유사도&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각각 자기 위치에 해당하는 부분의 유사도가 가장 큼, 패치 거리가 멀수록 유사도 작아짐&lt;/li&gt;
&lt;li&gt;= 이미지 내의 거리 개념을 효과적으로 인코딩 = &lt;b&gt;1D&lt;/b&gt; &lt;b&gt;위치 임베딩이 패치들의 이미지 내 공간정보(2D)를 효과적으로 포착&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;(우)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;레이어 깊이&lt;/b&gt;에 따른 &lt;b&gt;평균 어텐션 거리&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;초반 - 다양한 어텐션 거리 &amp;rarr; 깊이가 증가&lt;/b&gt;할수록, 대부분 &lt;b&gt;헤드 평균 어텐션 거리 증가&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;CNN vs VIT
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;CNN &amp;rarr; inductive bias &amp;rarr; 지역적인 정보 반영&lt;/li&gt;
&lt;li&gt;VIT &amp;rarr; 초기부터 다양한 관점에서 학습&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;4.6 SELF-SUPERVISION&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 자기지도학습 효과 실험&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;BERT&lt;/b&gt;의 &lt;b&gt;마스크드 언어 모델링&lt;/b&gt; 참고 &amp;rarr; 이미지 패치 &lt;b&gt;50% 마스크&lt;/b&gt; 처리 &amp;rarr; &lt;b&gt;해당 패치 평균 색상 예측&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;결과:&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;분류 다운스트림 태스크 파인튜닝 전, &lt;b&gt;*&lt;i&gt;가중치 *&lt;/i&gt;사전 학습(pre-training)&lt;/b&gt; &amp;rarr; &lt;b&gt;지도학습, 자기지도학습&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;성능 순) &lt;b&gt;무작위 가중치 &amp;lt; 자기지도학습 &amp;lt; 지도학습&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;자기지도 학습이 어느정도 효과있음,&lt;/li&gt;
&lt;li&gt;지도학습보다 효과 약함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h1&gt;&lt;b&gt;3. Implementation&lt;/b&gt;&lt;/h1&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&lt;a href=&quot;https://github.com/NoCodeProgram/deepLearning/blob/main/transformer/vitTransfer.ipynb&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://github.com/NoCodeProgram/deepLearning/blob/main/transformer/vitTransfer.ipynb&lt;/a&gt;&lt;/b&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1772503019495&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;deepLearning/transformer/vitTransfer.ipynb at main &amp;middot; NoCodeProgram/deepLearning&quot; data-og-description=&quot;Contribute to NoCodeProgram/deepLearning development by creating an account on GitHub.&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/NoCodeProgram/deepLearning/blob/main/transformer/vitTransfer.ipynb&quot; data-og-url=&quot;https://github.com/NoCodeProgram/deepLearning/blob/main/transformer/vitTransfer.ipynb&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/vpA7e/dJMb81fQaDI/FVC6SaC1NlgzAK7uFkUzJk/img.png?width=1200&amp;amp;height=600&amp;amp;face=971_144_1053_234,https://scrap.kakaocdn.net/dn/bx3cxs/dJMb89ya6JQ/zXYwrkSGKqdkJKkrvilmh1/img.png?width=1200&amp;amp;height=600&amp;amp;face=971_144_1053_234&quot;&gt;&lt;a href=&quot;https://github.com/NoCodeProgram/deepLearning/blob/main/transformer/vitTransfer.ipynb&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/NoCodeProgram/deepLearning/blob/main/transformer/vitTransfer.ipynb&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/vpA7e/dJMb81fQaDI/FVC6SaC1NlgzAK7uFkUzJk/img.png?width=1200&amp;amp;height=600&amp;amp;face=971_144_1053_234,https://scrap.kakaocdn.net/dn/bx3cxs/dJMb89ya6JQ/zXYwrkSGKqdkJKkrvilmh1/img.png?width=1200&amp;amp;height=600&amp;amp;face=971_144_1053_234');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;deepLearning/transformer/vitTransfer.ipynb at main &amp;middot; NoCodeProgram/deepLearning&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Contribute to NoCodeProgram/deepLearning development by creating an account on GitHub.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;데이터셋: CIFAR-10&lt;/b&gt; (32x32 크기의 10개 클래스 이미지: 비행기, 자동차, 새, 고양이, 사슴, 개, 개구리, 말, 배, 트럭) (train:5만장 / test: 1만장)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;목표&lt;/b&gt;: 10 종류 이미지 classification&lt;/li&gt;
&lt;li&gt;&lt;b&gt;모델&lt;/b&gt;: VIT&lt;/li&gt;
&lt;li&gt;&lt;b&gt;파라미터&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 18px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 18px;&quot;&gt;
&lt;td style=&quot;width: 100%; height: 18px;&quot;&gt;&lt;span&gt; &lt;br /&gt;&lt;span&gt;optimizer: AdamW&lt;/span&gt;&lt;br /&gt;&lt;span&gt;learning rate: 1e-3&lt;/span&gt;&lt;br /&gt;&lt;span&gt;loss: CrossEntropyLoss&lt;/span&gt;&lt;br /&gt;&lt;span&gt;batch size: 128&lt;/span&gt;&lt;br /&gt;&lt;span&gt;epoch: 100&lt;br /&gt;&lt;br /&gt;&lt;/span&gt; &lt;br /&gt;img_size = 32 # 입력 이미지 크기 (CIFAR-10: 32x32)&lt;br /&gt;patch_size = 4 # 패치 크기 (4x4)&lt;br /&gt;in_channels = 3 # 입력 채널 (RGB)&lt;br /&gt;embed_dim = 48 # 패치 임베딩 차원&lt;br /&gt;num_heads = 4 # 멀티헤드 어텐션 헤드 수&lt;br /&gt;dropout = 0.1 # 드롭아웃 비율&lt;br /&gt;num_layers = 4 # Transformer 인코더 레이어 수&lt;br /&gt;num_classes = 10 # 분류 클래스 수 (CIFAR-10)&lt;br /&gt;mlp_ratio = 4.0 # FFN(FeedForward) 중간 레이어 차원 비율&lt;/span&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;결과&lt;/b&gt;: Test Accuracy: 70.31% (100 에폭)&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1260&quot; data-origin-height=&quot;215&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/yir6p/dJMcafZZT8J/Pi9xgn2v7XWNLbLyrJZQck/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/yir6p/dJMcafZZT8J/Pi9xgn2v7XWNLbLyrJZQck/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/yir6p/dJMcafZZT8J/Pi9xgn2v7XWNLbLyrJZQck/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fyir6p%2FdJMcafZZT8J%2FPi9xgn2v7XWNLbLyrJZQck%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1260&quot; height=&quot;215&quot; data-origin-width=&quot;1260&quot; data-origin-height=&quot;215&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;예시 이미지 8개 각 분류 결과(확률)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;698&quot; data-origin-height=&quot;701&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bCHkcc/dJMcahKjTJ2/i9E9w7Wn9V9wmtwwSTYeKK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bCHkcc/dJMcahKjTJ2/i9E9w7Wn9V9wmtwwSTYeKK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bCHkcc/dJMcahKjTJ2/i9E9w7Wn9V9wmtwwSTYeKK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbCHkcc%2FdJMcahKjTJ2%2Fi9E9w7Wn9V9wmtwwSTYeKK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;698&quot; height=&quot;701&quot; data-origin-width=&quot;698&quot; data-origin-height=&quot;701&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;10000개 예제 이미지&lt;/b&gt; 모델 마지막 레이어 &lt;b&gt;CLS 토큰 임베딩 분포&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;t-SNE로 2차원(embed_dim = 48차원 &amp;rarr; 2차원)으로 분류결과 시각화&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;854&quot; data-origin-height=&quot;520&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/zwju3/dJMcajnJ9GV/sk6xCEv7OlY6D7Y56601a0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/zwju3/dJMcajnJ9GV/sk6xCEv7OlY6D7Y56601a0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/zwju3/dJMcajnJ9GV/sk6xCEv7OlY6D7Y56601a0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fzwju3%2FdJMcajnJ9GV%2Fsk6xCEv7OlY6D7Y56601a0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;854&quot; height=&quot;520&quot; data-origin-width=&quot;854&quot; data-origin-height=&quot;520&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Vision Transformer(ViT) 모델의 각 레이어별 CLS 어텐션 맵 시각화&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;각 레이어(4)&lt;/b&gt;가 입력 이미지의 &lt;b&gt;어떤 부분(패치)에 집중&lt;/b&gt;하는지 확인&lt;/li&gt;
&lt;li&gt;&lt;b&gt;레이어별 특징 추출 차이&lt;/b&gt; 시각화&lt;/li&gt;
&lt;/ul&gt;
&lt;h1&gt;4. Discussion&lt;/h1&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #99cefa;&quot;&gt;&lt;b&gt;중요!!!! Swin Transformer &amp;larr;&lt;/b&gt; locality! (baseline)&lt;/span&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;background-color: #99cefa;&quot;&gt;ViT + CNN Inductive Bias(지역성)&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;TSF - PatchTST
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;PatchTST 논문명&lt;b&gt;:&lt;span style=&quot;background-color: #f3c000;&quot;&gt; A TIME SERIES IS WORTH 64 WORDS&lt;/span&gt;: LONG-TERM FORECASTING WITH TRANSFORMERS&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;&lt;a href=&quot;https://arxiv.org/abs/2211.14730&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2211.14730&lt;/a&gt;&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;VIT 에서 패치 단위 분할 방식 착안&lt;/li&gt;
&lt;li&gt;VIT 논문명: &lt;b&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;AN IMAGE IS WORTH 16X16 WORDS&lt;/span&gt;: TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;figure id=&quot;og_1772503170515&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;A Time Series is Worth 64 Words: Long-term Forecasting with Transformers&quot; data-og-description=&quot;We propose an efficient design of Transformer-based models for multivariate time series forecasting and self-supervised representation learning. It is based on two key components: (i) segmentation of time series into subseries-level patches which are serve&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2211.14730&quot; data-og-url=&quot;https://arxiv.org/abs/2211.14730v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/NGZcN/dJMb86OZm2m/ykknKlirmfjW8ljHwkvmP1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/c4EEFb/dJMb9gxiWFh/81kcpc53cMRvihaU9G01tk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2211.14730&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2211.14730&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/NGZcN/dJMb86OZm2m/ykknKlirmfjW8ljHwkvmP1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/c4EEFb/dJMb9gxiWFh/81kcpc53cMRvihaU9G01tk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;A Time Series is Worth 64 Words: Long-term Forecasting with Transformers&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We propose an efficient design of Transformer-based models for multivariate time series forecasting and self-supervised representation learning. It is based on two key components: (i) segmentation of time series into subseries-level patches which are serve&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>Paper review</category>
      <category>vision transformer</category>
      <category>VIT</category>
      <author>Hippo's data</author>
      <guid isPermaLink="true">https://hipposdata.tistory.com/160</guid>
      <comments>https://hipposdata.tistory.com/entry/Paper-review-VITVision-Transformer#entry160comment</comments>
      <pubDate>Tue, 3 Mar 2026 11:40:01 +0900</pubDate>
    </item>
    <item>
      <title>[Paper review] TimeXer</title>
      <link>https://hipposdata.tistory.com/entry/Paper-review-TimeXer</link>
      <description>&lt;h1&gt;TimeXer&lt;/h1&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Paper: TIMEXER: EMPOWERING TRANSFORMERS FOR TIME SERIES FORECASTING WITH EXOGENOUS VARIABLES&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;(Yuxuan Wang, Haixu Wu, Jiaxiang Dong, Guo Qin, Haoran Zhang, Yong Liu, Yunzhong Qiu, Jianmin Wang, Mingsheng Long)&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Conference:&lt;/b&gt; NeurIPS 2024&lt;/li&gt;
&lt;li&gt;&lt;b&gt;GitHub Repository:&lt;/b&gt; &lt;a href=&quot;https://github.com/thuml/TimeXer&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://github.com/thuml/TimeXer&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;ArXiv:&lt;/b&gt; &lt;a href=&quot;https://arxiv.org/abs/2402.19072&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2402.19072&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;figure id=&quot;og_1772501244198&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - thuml/TimeXer: Official implementation for &amp;quot;TimeXer: Empowering Transformers for Time Series Forecasting with Exogenous&quot; data-og-description=&quot;Official implementation for &amp;quot;TimeXer: Empowering Transformers for Time Series Forecasting with Exogenous Variables&amp;quot; (NeurIPS 2024) - thuml/TimeXer&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/thuml/TimeXer&quot; data-og-url=&quot;https://github.com/thuml/TimeXer&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bws2S9/dJMb8XR3aWl/fLTEQ6xLOr3qsgtjeguqkk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/kRmaG/dJMb8Wexa7Q/nO1IvmRUIJX4IrSmJqWpg0/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/thuml/TimeXer&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/thuml/TimeXer&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bws2S9/dJMb8XR3aWl/fLTEQ6xLOr3qsgtjeguqkk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/kRmaG/dJMb8Wexa7Q/nO1IvmRUIJX4IrSmJqWpg0/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - thuml/TimeXer: Official implementation for &quot;TimeXer: Empowering Transformers for Time Series Forecasting with Exogenous&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Official implementation for &quot;TimeXer: Empowering Transformers for Time Series Forecasting with Exogenous Variables&quot; (NeurIPS 2024) - thuml/TimeXer&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;figure id=&quot;og_1772501229215&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;TimeXer: Empowering Transformers for Time Series Forecasting with Exogenous Variables&quot; data-og-description=&quot;Deep models have demonstrated remarkable performance in time series forecasting. However, due to the partially-observed nature of real-world applications, solely focusing on the target of interest, so-called endogenous variables, is usually insufficient to&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2402.19072&quot; data-og-url=&quot;https://arxiv.org/abs/2402.19072v4&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/ZP9mS/dJMb8T9W0ZO/zxtcwM9sEBRjr8GvgQlTo1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bW6Jjk/dJMb8Z3oOkQ/WSLLpmzzany1Ujgkb1w6ak/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2402.19072&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2402.19072&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/ZP9mS/dJMb8T9W0ZO/zxtcwM9sEBRjr8GvgQlTo1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bW6Jjk/dJMb8Z3oOkQ/WSLLpmzzany1Ujgkb1w6ak/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;TimeXer: Empowering Transformers for Time Series Forecasting with Exogenous Variables&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Deep models have demonstrated remarkable performance in time series forecasting. However, due to the partially-observed nature of real-world applications, solely focusing on the target of interest, so-called endogenous variables, is usually insufficient to&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;TimeXer&lt;/b&gt; = &lt;b&gt;Time&lt;/b&gt; Series Transform&lt;b&gt;er&lt;/b&gt; with e&lt;b&gt;X&lt;/b&gt;ogenous variables&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&amp;rarr; &lt;b&gt;트랜스포머 구조&lt;/b&gt;를 이용하여 &lt;b&gt;내생 + 외생변수&lt;/b&gt;를 효과적으로 활용하여 &lt;b&gt;예측&lt;/b&gt;하는 모델&lt;/span&gt;&lt;/p&gt;
&lt;h1&gt;1. SUMMARIZE&lt;/h1&gt;
&lt;table id=&quot;2fbbd201-015f-8070-a36e-d5c6d3e0c28d&quot; style=&quot;border-collapse: collapse; width: 100%; height: 392px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style12&quot;&gt;
&lt;tbody&gt;
&lt;tr id=&quot;2fbbd201-015f-80ec-9ba1-d06a7f290ed1&quot; style=&quot;height: 21px;&quot;&gt;
&lt;td id=&quot;sZ=e&quot; style=&quot;width: 13.1394%; height: 21px;&quot;&gt;&lt;b&gt;항목&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;{drb&quot; style=&quot;width: 86.7443%; height: 21px;&quot;&gt;&lt;b&gt;핵심 내용&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2fbbd201-015f-809b-a887-cc0b78214a61&quot; style=&quot;height: 124px;&quot;&gt;
&lt;td id=&quot;sZ=e&quot; style=&quot;width: 13.1394%; height: 124px;&quot;&gt;&lt;b&gt;Problem&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;{drb&quot; style=&quot;width: 86.7443%; height: 124px;&quot;&gt;&lt;b&gt;기존 접근&lt;br /&gt;&amp;bull; Channel Independence (CI):&lt;/b&gt; 변수 간 상관관계를 무시하여 외부 변수의 도움을 못 받음 - &lt;b&gt;PatchTS, DLinear &lt;/b&gt;&lt;br /&gt;&amp;bull;&lt;b&gt; Channel Dependence (CD):&lt;/b&gt; 내생(Target) 변수와 외생(External) 변수를 구분 없이 단순 결합(Concatenation) 임베딩 - &lt;b&gt;iTransformer, Crossformer, Autoformer / Informer&lt;br /&gt;&lt;/b&gt;&lt;br /&gt;&amp;rarr; 현실의 시계열 예측에는 내생변수 + 외부요인(외생변수) 영향 큰 문제&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2fbbd201-015f-8000-8557-c05c160ffd1f&quot; style=&quot;height: 184px;&quot;&gt;
&lt;td id=&quot;sZ=e&quot; style=&quot;width: 13.1394%; height: 184px;&quot;&gt;&lt;b&gt;Method&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;{drb&quot; style=&quot;width: 86.7443%; height: 184px;&quot;&gt;&lt;b&gt;1. Endogenous, Exogenous 변수 임베딩&lt;/b&gt;&lt;br /&gt;&amp;bull; &lt;b&gt;Endogenous (내생 변수):&lt;/b&gt; &lt;b&gt;Patch-wise&lt;/b&gt; (패치단위) &amp;rarr; 각 시계열 &lt;b&gt;시간적 종속성&lt;/b&gt;(Temporal Dependency) 포착, &lt;b&gt;전역 토큰&lt;/b&gt;( &lt;b&gt;Global Token, 내생변수 전체 시계열 요약, 내생-외생 bridge 역할)&lt;/b&gt; 생성&lt;br /&gt;&amp;bull; &lt;b&gt;Exogenous (외생 변수):&lt;/b&gt; &lt;b&gt;Variate-wise &lt;/b&gt;(변수단위)&lt;b&gt; &amp;rarr; 전체 시계열을 하나의 토큰&lt;/b&gt;으로 압축&lt;br /&gt;&lt;br /&gt;&lt;b&gt;2. Attention Mechanism&lt;br /&gt;&amp;bull; Self-Attention: 내생변수 - 패치, 전역토큰 &amp;rarr; 각 패치 간의 시간적 종속성, 패치와 전체 시계열(전역 토큰) 간의 관계 학습&lt;br /&gt;&amp;bull; Cross-Attention: 외생-내생(전역토큰) 변수 간 관계 학습&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2fbbd201-015f-8056-9867-ddd8bf926d06&quot; style=&quot;height: 21px;&quot;&gt;
&lt;td id=&quot;sZ=e&quot; style=&quot;width: 13.1394%; height: 21px;&quot;&gt;&lt;b&gt;Results&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;{drb&quot; style=&quot;width: 86.7443%; height: 21px;&quot;&gt;&lt;b&gt;short/long-term forecasting 성능&lt;/b&gt; 증명, &lt;b&gt;다양한 현실 시나리오&lt;/b&gt;(결측값, 시간/빈도/길이 불일치 등) &lt;b&gt;적용 &lt;/b&gt;가능&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2fbbd201-015f-80bb-b39f-f809014aaafc&quot; style=&quot;height: 42px;&quot;&gt;
&lt;td id=&quot;sZ=e&quot; style=&quot;width: 13.1394%; height: 42px;&quot;&gt;&lt;b&gt;Contribution&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;{drb&quot; style=&quot;width: 86.7443%; height: 42px;&quot;&gt;복잡한 구조 변경 없이, &lt;b&gt;표준 Transformer 아키텍처로&lt;/b&gt; &lt;b&gt;내생 변수의 시간적 패턴과 외생 변수의 상관관계를 학습&lt;/b&gt;할 수 있도록 하는 &lt;b&gt;범용적인 프레임워크&lt;/b&gt; 제안&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h1&gt;2. DETAIL&lt;/h1&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;1. Introduction&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;현실 시나리오 &amp;rarr; &lt;b&gt;외생변수 중요&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;기존 모델의 한계&lt;/b&gt;:&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1311&quot; data-origin-height=&quot;188&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bkIgw8/dJMcahjfR7s/zV5NWPYMasfD4KOyfufKlK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bkIgw8/dJMcahjfR7s/zV5NWPYMasfD4KOyfufKlK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bkIgw8/dJMcahjfR7s/zV5NWPYMasfD4KOyfufKlK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbkIgw8%2FdJMcahjfR7s%2FzV5NWPYMasfD4KOyfufKlK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1311&quot; height=&quot;188&quot; data-origin-width=&quot;1311&quot; data-origin-height=&quot;188&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;단변량 예측&lt;/b&gt;: 외생 변수 정보 무시 (PatchTST, Autoformer)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;다변량 예측&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;모든 변수를 동등하게 취급 &amp;rarr; 불필요한 복잡성 (Crossformer)&lt;/li&gt;
&lt;li&gt;내생/외생 변수 간 관계를 충분히 모델링하지 못함 (iTransformer)&lt;/li&gt;
&lt;li&gt;실제 외생 변수가 가질 수 있는 불규칙성(결측값, 시간/빈도/길이 불일치 등) 처리하기 어려움 (Transformer 기반 모델 &amp;rarr; Point-wise, Patch-wise 토큰)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; TimeXer 아키텍처 제안&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1232&quot; data-origin-height=&quot;339&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/1ccfk/dJMcaiPU6u0/CkLVn2hIQJfh8q5fzHe97k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/1ccfk/dJMcaiPU6u0/CkLVn2hIQJfh8q5fzHe97k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/1ccfk/dJMcaiPU6u0/CkLVn2hIQJfh8q5fzHe97k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F1ccfk%2FdJMcaiPU6u0%2FCkLVn2hIQJfh8q5fzHe97k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1232&quot; height=&quot;339&quot; data-origin-width=&quot;1232&quot; data-origin-height=&quot;339&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;내생변수 (Endogenous): x(1)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;과거 x(1)으로 미래 x(1) 맞춤&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;외생변수 (Exogenous): z(1),z(2),&amp;hellip;,z(C)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;예측의 대상은 아니지만, 예측을 돕기 위해 참조만 하는 외부 요인&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;다양한 현실 시나리오&lt;/b&gt;(결측값, 시간/빈도/길이 불일치 등) &lt;b&gt;적용 가능&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 외생변수를 단일 토큰으로 처리하므로&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;2. RELATED WORK&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;2.1 Transformer-based Time Series Forecaster&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 장기적인 시간 의존성(temporal dependencies), 다변량 상관관계(multivariate correlations) 포착 강점&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Transformer 표현의 세분성(granularity)에 따라 분류&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Point-wise (점 단위)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 시점(point)을 하나의 시간 토큰으로 임베딩&lt;/li&gt;
&lt;li&gt;&lt;b&gt;한계&lt;/b&gt;: 국소적인 의미 정보(&lt;b&gt;local&lt;/b&gt; semantic information)를 잘 포착하지 못함&lt;/li&gt;
&lt;li&gt;Informer, Autoformer, Pyraformer&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Patch-wise (패치 단위)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;시계열 데이터를 패치(patch)로 분할, 패치들 간의 의존성을 포착&lt;/li&gt;
&lt;li&gt;PatchTST - 시간 축(cross-time) 어텐션 수행&lt;/li&gt;
&lt;li&gt;Crossformer - 시간 축(cross-time), 변수 축(cross-variate)에서 어텐션 수행&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Variate-wise (변수 단위)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;전체 시계열의 전역적인 표현 활용 &amp;rarr; 다변량 상관관계 포착&lt;/li&gt;
&lt;li&gt;&lt;b&gt;한계&lt;/b&gt;: 변수 간의 관계를 잘 파악, 전체 시계열을 하나의 변수 토큰으로 임베딩 &amp;rarr; &lt;b&gt;내부적인 시간적 변화를 포착하는 능력 부족&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;iTransformer - 각 변수를 토큰으로 &amp;rarr; 다변량 토큰간 어텐션 &amp;rarr; 변수 간 상호 관계 파악&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1311&quot; data-origin-height=&quot;188&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/PEEv5/dJMcachVjtb/ojCA5AGaRjODPkubZbLgYk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/PEEv5/dJMcachVjtb/ojCA5AGaRjODPkubZbLgYk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/PEEv5/dJMcachVjtb/ojCA5AGaRjODPkubZbLgYk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FPEEv5%2FdJMcachVjtb%2FojCA5AGaRjODPkubZbLgYk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1311&quot; height=&quot;188&quot; data-origin-width=&quot;1311&quot; data-origin-height=&quot;188&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;. &amp;rarr; former&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;✧: 다변량 예측 시나리오에 적용될 수 있지만, 명시적(explicit)으로 &lt;b&gt;변수 간의 교차 의존성(cross-variate dependency)을 모델링하지는 않음&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Univariate (단변량)&lt;/b&gt;: &lt;b&gt;단일 변수&lt;/b&gt;로 &lt;b&gt;단일 변수 예측&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Multivariate (다변량)&lt;/b&gt;: &lt;b&gt;여러 변수&lt;/b&gt;로 &lt;b&gt;여러 변수 예측&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Exogenous (외생 변수 활용)&lt;/b&gt;: 예측 대상 변수(내생 변수) 외에 예측에 도움이 되는 외부 정보(&lt;b&gt;외생 변수&lt;/b&gt;)를 &lt;b&gt;활용&lt;/b&gt;할 수 있는 능력&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;TimeXer&lt;/b&gt;는 단변량, 다변량, 외생 변수를 활용하는 시나리오까지 처리 &amp;rarr; &lt;b&gt;범용적인(general) 능력&lt;/b&gt;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;2.2 Forecasting with Exogenous Variables&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;외생변수 결합 &lt;b&gt;기존 접근법&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;통계적 기반&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;ARIMAX, SARIMAX&lt;/li&gt;
&lt;li&gt;주로 선형관계 가정, 다수 외생변수 불규칙한 특징 다루는데 한계&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;딥러닝 기반&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;TFT - 변수 선택에 중점(해석)&lt;/li&gt;
&lt;li&gt;NBEATSx, TiDE&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 내생/외생 시계열의 &lt;b&gt;시간 정렬(alignment) 필수&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 결측값, 불균일한 샘플링 등으로 인해 &lt;b&gt;시간 정렬 어려움&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; TimeXer- 각 외생변수를 변수 토큰(variate token)으로 임베딩 &amp;rarr; &lt;b&gt;문제해결&lt;/b&gt;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;3. TimeXer&lt;/h2&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1260&quot; data-origin-height=&quot;573&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cMcp3D/dJMcacoGhIL/g1Ijm6JKRTa40S9f6r17M1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cMcp3D/dJMcacoGhIL/g1Ijm6JKRTa40S9f6r17M1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cMcp3D/dJMcacoGhIL/g1Ijm6JKRTa40S9f6r17M1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcMcp3D%2FdJMcacoGhIL%2Fg1Ijm6JKRTa40S9f6r17M1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1260&quot; height=&quot;573&quot; data-origin-width=&quot;1260&quot; data-origin-height=&quot;573&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;(a)&lt;/b&gt; 내생 변수를 패치(patch)로 분할하여 임베딩, 전역 토큰(global token) 도입&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;(b)&lt;/b&gt; 외생 변수를 각 변수 토큰(variate token)으로 임베딩&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;(c)&lt;/b&gt; 내생 변수 각 패치, 전역 토큰 간 Self-Attention&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;(d)&lt;/b&gt; 내생 전역 토큰, 외생 변수 토큰 간 Cross-Attention&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;Problem Settings&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;입력
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;내생변수(endogenous): $x_{1:T}$ = ${x_1​,x_2​,&amp;hellip;,x_T​}&amp;isin;R^{T&amp;times;1}$
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;1 ~ T 시점까지 과거값&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;외생변수(exogenous): $z_{1:T_{\text{ex}}}$ = ${z^{(1)}&lt;i&gt;{1:T&lt;/i&gt;{\text{ex}}}, z^{(2)}&lt;i&gt;{1:T&lt;/i&gt;{\text{ex}}}, \dots, z^{(C)}&lt;i&gt;{1:T&lt;/i&gt;{\text{ex}}}} \in \mathbb{R}^{T_{\text{ex}} \times C}$
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;C개 외생변수&lt;/li&gt;
&lt;li&gt;1 ~ Tex 시점까지 과거값&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;look-back 길이 유연하게(flexible) 처리 가능
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;외생, 내생변수 길이(look-back) 달라도 처리가능&lt;/li&gt;
&lt;li&gt;$T_{\text{ex}} \neq T$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;출력
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$\hat x = {{x_{T+1}, x_{T+2}, ..., x_{T +S} }}$&lt;/li&gt;
&lt;li&gt;미래 S 시점의 내생 변수 값 예측&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;모델
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$\hat x_{T+1:T+S}​=F_&amp;theta;​(x_{1:T}​,z_{1:Tex}​​)$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;Endogenous Embedding&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$$ \begin{aligned} \{ \mathbf{s}_1, \mathbf{s}_2, \dots, \mathbf{s}_N \} &amp;amp;= \text{Patchify}(\mathbf{x}), \\ \mathbf{P}_{\text{en}} &amp;amp;= \text{PatchEmbed}(\mathbf{s}_1, \mathbf{s}_2, \dots, \mathbf{s}_N), \\ \mathbf{G}_{\text{en}} &amp;amp;= \text{Learnable}(\mathbf{x}). \end{aligned} $$&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Patch-wise&lt;/b&gt; Token
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;패치화 (Patchify)&lt;/b&gt;: 내생 변수를 겹치지 않는(non-overlapping) 패치단위로 분할
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 패치는 &lt;b&gt;Local Temporal Pattern&lt;/b&gt; 표현&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;패치 임베딩 (PatchEmbed)&lt;/b&gt;: 각 패치 임베딩 $P_{\text{en}}$ (D차원 벡터)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Global Endogenous Token&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;학습 가능한&lt;/b&gt; 전역 토큰 $G_{\text{en}}$ 생성 &lt;b&gt;(VIT, Vision Transformer 에서 영감받음 - learnable global endogenous token)&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;전역 토큰은 &lt;b&gt;거시적 정보&lt;/b&gt;(macroscopic) 표현&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;Exogenous Embedding&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$\mathbf{V}_{\text{ex},i} = \text{VariateEmbed}(\mathbf{z}^{(i)}), \quad i \in {1, \dots, C}$&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Variate-level&lt;/b&gt; Token
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 변수(1~C)가 하나의 토큰으로 임베딩&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;이유&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;결측값, 시간 스탬프, 샘플링 빈도, 길이 &lt;b&gt;불일치 처리&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;각 변수&lt;/b&gt;를 &lt;b&gt;패치단위&lt;/b&gt; 처리 &amp;rarr; &lt;b&gt;계산 복잡성과 메모리 사용량 큼&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;외생변수의 거시적(Macro) 정보 반영&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;Endogenous Self-Attention&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$$ &lt;br /&gt;\begin{aligned} &lt;br /&gt;\text{Patch-to-Patch:&amp;nbsp;}&amp;nbsp;&amp;amp;&amp;nbsp;\mathbf{\hat{P}}^{l,1}_{\text{en}}&amp;nbsp;=&amp;nbsp;\text{LayerNorm}&amp;nbsp;\left(&amp;nbsp;\mathbf{P}^{l}_{\text{en}}&amp;nbsp;+&amp;nbsp;\text{Self-Attention}&amp;nbsp;(\mathbf{P}^{l}_{\text{en}})&amp;nbsp;\right)&amp;nbsp;\\ &lt;br /&gt;\text{Global-to-Patch:&amp;nbsp;}&amp;nbsp;&amp;amp;&amp;nbsp;\mathbf{\hat{P}}^{l,2}_{\text{en}}&amp;nbsp;=&amp;nbsp;\text{LayerNorm}&amp;nbsp;\left(&amp;nbsp;\mathbf{P}^{l}_{\text{en}}&amp;nbsp;+&amp;nbsp;\text{Cross-Attention}&amp;nbsp;(\mathbf{P}^{l}_{\text{en}},&amp;nbsp;\mathbf{G}^{l}_{\text{en}})&amp;nbsp;\right)&amp;nbsp;\\ &lt;br /&gt;\text{Patch-to-Global:&amp;nbsp;}&amp;nbsp;&amp;amp;&amp;nbsp;\mathbf{\hat{G}}^{l}_{\text{en}}&amp;nbsp;=&amp;nbsp;\text{LayerNorm}&amp;nbsp;\left(&amp;nbsp;\mathbf{G}^{l}_{\text{en}}&amp;nbsp;+&amp;nbsp;\text{Cross-Attention}&amp;nbsp;(\mathbf{G}^{l}_{\text{en}},&amp;nbsp;\mathbf{P}^{l}_{\text{en}})&amp;nbsp;\right) &lt;br /&gt;\end{aligned} &lt;br /&gt;$$&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Patch-to-Patch&lt;/b&gt;: 패치간 시간 관계 학습&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Global-to-Patch&lt;/b&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;: 전역 토큰(query), 패치 토큰(key, value) &amp;rarr; 전역 토큰이 패치 토큰으로부터 시계열 &lt;/span&gt;&lt;b&gt;세부 정보&lt;/b&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt; 학습&lt;/span&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Patch-to-Global&lt;/b&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt;: &lt;/span&gt;&lt;b&gt;패치 토큰(query), 전역 토큰(key, value) &amp;rarr; 패치 토큰이 전역 토큰으로부터 시계열 전체 맥락&lt;/b&gt;&lt;span style=&quot;letter-spacing: 0px;&quot;&gt; 학습&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$\hat{\mathbf{P}}_\text{en}^l, \hat{\mathbf{G}}_\text{en}^l = \left(\text{LayerNorm} \left(\left[\mathbf{P}_\text{en}^l, \mathbf{G}_\text{en}^l\right]\right) + \text{Self-Attention} \left(\left[\mathbf{P}_\text{en}^l, \mathbf{G}_\text{en}^l\right]\right)\right)$&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;overall process&lt;/b&gt; &amp;rarr; 실제 연산은 모든 토큰을 합쳐(concatenation, $\left[\mathbf{P}_\text{en}^l, \mathbf{G}_\text{en}^l\right]$) 3가지 연산이 한번에 수행됨(Self-Attention)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;즉, 입력 시퀀스를 [Global_Token, Patch_1, Patch_2, ...] 형태로 Concatenation(연결)한 뒤, Self-Attention&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;Exogenous-to-Endogenous Cross-Attention&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;전역 토큰은 &lt;b&gt;내생 시계열 정보 요약&lt;/b&gt;한 상태 (이전 Self-Attention)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Cross-Attention&lt;/b&gt; &amp;rarr; 전역 토큰이 외생변수 정보 학습 (&lt;b&gt;중요한 외생 변수 선택적 가중치&lt;/b&gt;)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;전역 토큰(query), 각 외생 변수 토큰(key, value)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$$ &lt;br /&gt;\hat{G}^{n}_{l+1}&amp;nbsp;=&amp;nbsp;\text{LayerNorm}(\hat{G}^{n}_{l+1})&amp;nbsp;+&amp;nbsp;\text{Cross-Attention}(\hat{G}^{n}_{l+1},&amp;nbsp;V_{\text{ex}}) &lt;br /&gt;$$&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;&lt;br /&gt;Forecasting&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;FFN(Feed-Foward network)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$G_{\text{en}}^{l+1} = \text{Feed-Forward}(\hat{G}_{\text{en}}^{l+1})$&lt;/li&gt;
&lt;li&gt;$P_{\text{en}}^{l+1} = \text{Feed-Forward}(P_{\text{en}}^{n})$&lt;/li&gt;
&lt;li&gt;$\text{FFN}(x) = \text{Activation}(x W_1 + b_1) W_2 + b_2$&lt;/li&gt;
&lt;li&gt;각 패치, 전역 토큰 FFN 통과&lt;/li&gt;
&lt;li&gt;비선형성, 복잡한 관계 학습&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Forecasting Loss
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;MSE(Mean Squared Error)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;선형 투영(Linear Projection)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$Output=Input&amp;times;W+b$&amp;nbsp;&lt;/li&gt;
&lt;li&gt;$\hat{x} = \text{Projection}([P_{\text{en}}^L, G_{\text{en}}^L])$&lt;/li&gt;
&lt;li&gt;Linear Projection을 통해 &lt;b&gt;최종 예측값&lt;/b&gt; 생성&lt;/li&gt;
&lt;li&gt;Encoder-only 구조이므로 한번에 여러시점 예측&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Parallel Multivariate Forecasting
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 변수마다 하나는 내생변수, 나머지는 외생변수로 취급 &amp;rarr; &lt;b&gt;병렬적으로 예측&lt;/b&gt; 가능
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;iTransformer,&lt;/b&gt; &lt;b&gt;Crossformer &amp;rarr;&lt;/b&gt; 모든 변수(C개)를 한 번에 타겟&amp;rarr; 관계학습 &amp;rarr; 한번에 모든변수 예측값 뱉어냄&lt;/li&gt;
&lt;li&gt;&lt;b&gt;TimeXer&lt;/b&gt; &amp;rarr; 각 변수를 타겟(내생)으로 놓고 나머지 외생으로 (C번 수행, 병렬적으로 가능)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;각 변수 예측시, &lt;b&gt;가중치 공유(Parameter Sharing)&lt;/b&gt; 가능&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;4. EXPERIMENTS&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Setting&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;short-term&lt;/b&gt; forecasting: Electricity Price Forecasting(EPF) - 5개 전력시장 데이터, 2 외생/1 내생변수
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Look-back: 168 / Prediction length: 24 / Patch length: 24 (non-overlapping)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;long-term&lt;/b&gt; forecasting: 7개(ECL, Weather, ETTh1, ETTh2, ETTm1, ETTm2, Traffic)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Look-back: 96/ Prediction length: 96, 192, 336, 720/ Patch length: 16 (non-overlapping)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;832&quot; data-origin-height=&quot;264&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/7Cbtl/dJMcaa5todh/cAjHhj9YpTxlHTsf0rupo0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/7Cbtl/dJMcaa5todh/cAjHhj9YpTxlHTsf0rupo0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/7Cbtl/dJMcaa5todh/cAjHhj9YpTxlHTsf0rupo0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F7Cbtl%2FdJMcaa5todh%2FcAjHhj9YpTxlHTsf0rupo0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;832&quot; height=&quot;264&quot; data-origin-width=&quot;832&quot; data-origin-height=&quot;264&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Baselines&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Transformer-based&lt;/b&gt;: iTransformer, PatchTST, Crossformer, Autoformer&lt;/li&gt;
&lt;li&gt;&lt;b&gt;CNN-based:&lt;/b&gt; TimesNet, SCINet&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Linear-based&lt;/b&gt;: RLinear, DLinear, TiDE(외생변수 특화)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Metric&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;MSE, MAE&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;4.1 Main Results&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;832&quot; data-origin-height=&quot;223&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/Ng4In/dJMcacPK7OL/pCVK2zsn2pUQ6gxsH978Bk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/Ng4In/dJMcacPK7OL/pCVK2zsn2pUQ6gxsH978Bk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/Ng4In/dJMcacPK7OL/pCVK2zsn2pUQ6gxsH978Bk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FNg4In%2FdJMcacPK7OL%2FpCVK2zsn2pUQ6gxsH978Bk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;832&quot; height=&quot;223&quot; data-origin-width=&quot;832&quot; data-origin-height=&quot;223&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;short-term&lt;/b&gt; forecasting
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Transformer based &amp;gt; Linear based (변수간 상호작용 interaction 파악 한계)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;TimeXer &lt;span style=&quot;background-color: #ffffff; color: #0a0a0a; text-align: start;&quot;&gt;SOTA&lt;/span&gt; &lt;/b&gt;&lt;/li&gt;
&lt;li&gt;Crossformer - 다양한 segment 수준에서 분할 &amp;rarr; 불필요한 노이즈(noise) 가능성&lt;/li&gt;
&lt;li&gt;iTransformer - temporal dependency 포착 한계&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;832&quot; data-origin-height=&quot;249&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bd5RM1/dJMcadnyj1R/lIjejiMK6aCDq9ClpblMs0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bd5RM1/dJMcadnyj1R/lIjejiMK6aCDq9ClpblMs0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bd5RM1/dJMcadnyj1R/lIjejiMK6aCDq9ClpblMs0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbd5RM1%2FdJMcadnyj1R%2FlIjejiMK6aCDq9ClpblMs0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;832&quot; height=&quot;249&quot; data-origin-width=&quot;832&quot; data-origin-height=&quot;249&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;long-term&lt;/b&gt; forecasting
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;대부분 &lt;b&gt;TimeXer &lt;span style=&quot;background-color: #ffffff; color: #0a0a0a; text-align: start;&quot;&gt;SOTA&lt;/span&gt; &lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;MSE &amp;gt; MAE : MSE는 극단적인 오차를 과도하게 반영 (제곱계산)&lt;/li&gt;
&lt;li&gt;급변 지점 예측
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;TimeXer, PatchTST&lt;/b&gt; (&lt;b&gt;patch-wise 방식&lt;/b&gt;) &amp;rarr; 전반적인 추세 잘예측하지만, &lt;b&gt;급변지점 놓칠 수 있음 (&lt;/b&gt;평활화 하는 경향)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;iTransformer (Variate-wise 방식)&lt;/b&gt; &amp;rarr; 급변지점이 특졍 변수와 강한 연관성 &amp;rarr; 구조적 강점traffic dataset &amp;rarr; iTransformer 낮은 성능&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dna/pQ9F7/dJMcadnyj1X/AAAAAAAAAAAAAAAAAAAAAI5V-4ujn2YR7Gg2PZez_gOLi-SZ9sw7NlOYG087Y2Jc/img.png?credential=yqXZFxpELC7KVnFOS48ylbz2pIh7yKj8&amp;amp;expires=1774969199&amp;amp;allow_ip=&amp;amp;allow_referer=&amp;amp;signature=jzKBMTImW3auDePHuzCHI%2FUQeiY%3D&quot; data-image-src=&quot;https://blog.kakaocdn.net/dna/pQ9F7/dJMcadnyj1X/AAAAAAAAAAAAAAAAAAAAAI5V-4ujn2YR7Gg2PZez_gOLi-SZ9sw7NlOYG087Y2Jc/img.png?credential=yqXZFxpELC7KVnFOS48ylbz2pIh7yKj8&amp;amp;expires=1774969199&amp;amp;allow_ip=&amp;amp;allow_referer=&amp;amp;signature=jzKBMTImW3auDePHuzCHI%2FUQeiY%3D&quot; data-origin-width=&quot;825&quot; data-origin-height=&quot;453&quot; /&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;4.2 Ablation Study&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;831&quot; data-origin-height=&quot;236&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bXQg0H/dJMcabQPB1F/qESIwFjFoQMy4wPpHfxQQk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bXQg0H/dJMcabQPB1F/qESIwFjFoQMy4wPpHfxQQk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bXQg0H/dJMcabQPB1F/qESIwFjFoQMy4wPpHfxQQk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbXQg0H%2FdJMcabQPB1F%2FqESIwFjFoQMy4wPpHfxQQk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;831&quot; height=&quot;236&quot; data-origin-width=&quot;831&quot; data-origin-height=&quot;236&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Ex: 외생변수(Exogenous)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;En: 내생변수(Endogenous)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;P: patch token&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;G: learnable global token&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;V: variate token&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Ours&lt;/b&gt;(기존 TimeXer): 가장 우수한 성능&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Replace&lt;/b&gt; (외생변수 V &amp;rarr; P): 외생변수는 세밀한 시간정보를 반영하는 패치 토큰(P) 보다 전체 정보를 담는 &lt;b&gt;변수 토큰(V)이 더 효과적&lt;/b&gt; / 각 변수 패치토큰(P) 임베딩 &amp;rarr; 불필요한 노이즈 담길 수 있음&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Remove&lt;/b&gt; (내생 G 제거): &lt;b&gt;전역 토큰(G)&lt;/b&gt;이 &lt;b&gt;Bridge 역할&lt;/b&gt; 잘 해냄(&lt;b&gt;내생변수 거시적 정보 + 외생변수 정보&lt;/b&gt;)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Add&lt;/b&gt;: 기존 Cross Attention &amp;rarr; 내생, 외생변수 단순히 더함(Add) - &lt;b&gt;Cross Attention이 외부정보 통합시 유용&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Concatenate&lt;/b&gt;: 기존 Cross Attention &amp;rarr; 내생, 외생변수 연결(Concatenate) 후, Self-Attention
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Concatenate - &lt;b&gt;외생변수 간 상호작용 고려&lt;/b&gt; &amp;rarr; &lt;b&gt;단순 Cross Attention 유용&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; 즉, 외생변수는 변수단위 토큰(V) 효과적 / 전역 토큰(G)의 효과 / 변수간 상호작용은 Cross Attention 이 효과적&lt;/b&gt;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;4.3 TimeXer Generality&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;4.3.1 Practical Situations&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Increasing Look-back Length&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;806&quot; data-origin-height=&quot;254&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ctgdiI/dJMcabQPB1U/HjZZ1K5MKNxZF7vHKf1ypk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ctgdiI/dJMcabQPB1U/HjZZ1K5MKNxZF7vHKf1ypk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ctgdiI/dJMcabQPB1U/HjZZ1K5MKNxZF7vHKf1ypk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FctgdiI%2FdJMcabQPB1U%2FHjZZ1K5MKNxZF7vHKf1ypk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;806&quot; height=&quot;254&quot; data-origin-width=&quot;806&quot; data-origin-height=&quot;254&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Look-back Length 길수록, 성능향상&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;특히 외생변수(Exogenous)보다 &lt;b&gt;내생변수(Endogenous) 길이 늘릴 때, 더 큰 성능 향상&lt;/b&gt; (둘다 늘리면 더 좋음)&lt;/li&gt;
&lt;li&gt;외생변수 길이 성능편차 크지 않음 &lt;b&gt;&amp;rarr; 외생 변수간 불일치(misalignment)에도 잘 작동함&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Missing Values&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;832&quot; data-origin-height=&quot;241&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bb3JK2/dJMcaaLaxdg/KvOAsaqk1ZAAak5hpXmAjk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bb3JK2/dJMcaaLaxdg/KvOAsaqk1ZAAak5hpXmAjk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bb3JK2/dJMcaaLaxdg/KvOAsaqk1ZAAak5hpXmAjk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbb3JK2%2FdJMcaaLaxdg%2FKvOAsaqk1ZAAak5hpXmAjk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;832&quot; height=&quot;241&quot; data-origin-width=&quot;832&quot; data-origin-height=&quot;241&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 내생, 외생변수 0으로 채움(Zeros) or 랜덤값(0~1범위 무작위)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;내생변수(&lt;b&gt;Endogenous)&lt;/b&gt;에 변화를 줄 시 오차값 큰 변동 &amp;rarr; &lt;b&gt;내생변수(Endogenous)가 예측성능에 직접적 관련&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;외생변수(Exogenous) 변화&lt;/b&gt;에는 &lt;b&gt;강건함&lt;/b&gt;(Robust) - 성능변동 크지 않음&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; 외생변수가 유용하지 않더라도(결측, 특정값 변형 등), 내생변수가 예측을 주도함&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;4.3.2 Scalability&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 큰, 복잡한 데이터셋 얼마나 잘 작동하는지&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;817&quot; data-origin-height=&quot;234&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bwYCRB/dJMcafTfzcV/D3o68tgwsRL5Ox8yleXHWK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bwYCRB/dJMcafTfzcV/D3o68tgwsRL5Ox8yleXHWK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bwYCRB/dJMcafTfzcV/D3o68tgwsRL5Ox8yleXHWK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbwYCRB%2FdJMcafTfzcV%2FD3o68tgwsRL5Ox8yleXHWK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;817&quot; height=&quot;234&quot; data-origin-width=&quot;817&quot; data-origin-height=&quot;234&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Dataset : large-scale weather dataset - National Centers for Environmental Information (NCEI)&lt;/li&gt;
&lt;li&gt;내생변수: 각 관측소 기온 (시간별)&lt;/li&gt;
&lt;li&gt;외생변수: 각 관측소 근처 기상지표 (내생변수와 샘플링 빈도 다름 - 3시간별)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;TimeXer &lt;span style=&quot;background-color: #ffffff; color: #0a0a0a; text-align: start;&quot;&gt;SOTA&lt;/span&gt; &lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;4.4 Model Analysis&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Variate-wise Correlations&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;551&quot; data-origin-height=&quot;226&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/JjhUM/dJMcadVnNqo/UMdfoDU9VjwYaMergEhuwK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/JjhUM/dJMcadVnNqo/UMdfoDU9VjwYaMergEhuwK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/JjhUM/dJMcadVnNqo/UMdfoDU9VjwYaMergEhuwK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FJjhUM%2FdJMcadVnNqo%2FUMdfoDU9VjwYaMergEhuwK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;551&quot; height=&quot;226&quot; data-origin-width=&quot;551&quot; data-origin-height=&quot;226&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 내생변수와 유사한 형태를 보이는 외생시계열이 큰 Attention score를 보임&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; TimeXer의 &lt;b&gt;Cross-Attention이 유용하게 외생 변수를 선택&lt;/b&gt;, &lt;b&gt;해석가능(interpretability) Attention map&lt;/b&gt; 제공&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Model Efficiency&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;274&quot; data-origin-height=&quot;222&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/5yfrw/dJMcahpZYxU/N4uuLdE7UeXIckYEO85vb0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/5yfrw/dJMcahpZYxU/N4uuLdE7UeXIckYEO85vb0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/5yfrw/dJMcahpZYxU/N4uuLdE7UeXIckYEO85vb0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F5yfrw%2FdJMcahpZYxU%2FN4uuLdE7UeXIckYEO85vb0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;274&quot; height=&quot;222&quot; data-origin-width=&quot;274&quot; data-origin-height=&quot;222&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ECL 데이터셋 - (320개의 외생 변수 - 대규모 시계열 데이터셋)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;메모리사용, 훈련시간 측면&lt;/b&gt; &amp;rarr; &lt;b&gt;TimeXer&lt;/b&gt;가 iTransformer보다 &lt;b&gt;효율적&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;iTransformer&lt;/b&gt;: 모든 변수(외생, 내생)에 대해 Self-Attention&lt;/li&gt;
&lt;li&gt;&lt;b&gt;TimeXer&lt;/b&gt;: 외생변수 - variate embedding / 내생 - 외생 변수 상호작용 &amp;rarr; Cross-Attention (외생변수간 상호작용 어텐션 생략)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h1&gt;3. Implementation&lt;/h1&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Dataset&lt;/b&gt;: ETTh1 (중국 전력 변압기 온도 데이터)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;길이:&lt;/b&gt; 2년(2016-2018), 시간단위(17,420 시간)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Look-back Length: 96 &amp;rarr; FCST Length: 24&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;내생변수&lt;/b&gt;: Oil Temperature / &lt;b&gt;외생변수&lt;/b&gt; (6개): HUFL, HULL, MUFL &amp;hellip; 등&lt;/li&gt;
&lt;li&gt;&lt;b&gt;모델 아키텍처&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;입력&lt;/b&gt;: [배치, 시계열길이(96), 변수(7)]&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Patch 분할&lt;/b&gt;: patch_len=2 &amp;rarr; 48개 패치 + Global Token&lt;/li&gt;
&lt;li&gt;&lt;b&gt;임베딩&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;타겟(Endogenous): Patch Embedding + PositionalEmbedding&lt;/li&gt;
&lt;li&gt;외생변수(Exogenous): Variate Embedding (시간&amp;rarr;변수)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;인코더&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;3개 레이어&lt;/li&gt;
&lt;li&gt;각 레이어:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Self-Attention (패치 간 관계)&lt;/li&gt;
&lt;li&gt;Cross-Attention (Global Token &amp;harr; 외생변수)&lt;/li&gt;
&lt;li&gt;FeedForward(Conv1d)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;헤드&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Flatten + Linear &amp;rarr; 예측값(24시점)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;파라미터&lt;/li&gt;
&lt;/ul&gt;
&lt;pre id=&quot;code_1772500981482&quot; class=&quot;python&quot; data-ke-language=&quot;python&quot; data-ke-type=&quot;codeblock&quot;&gt;&lt;code&gt;class Configs:
    task_name = 'long_term_forecast'
    features = 'MS'           # MS: Multivariate-to-Single
    seq_len = 96              
    pred_len = 24             
    enc_in = 7                # ETTh1: 6개 외생변수 + 1개 타겟
    c_out = 1                 
    d_model = 64              
    d_ff = 128                
    n_heads = 2              
    e_layers = 3              
    patch_len = 4            
    factor = 3                
    dropout = 0
    activation = 'gelu'
    use_norm = True           
    learning_rate = 0.001
    batch_size = 64
    epochs = 120&lt;/code&gt;&lt;/pre&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1389&quot; data-origin-height=&quot;790&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cdlh5W/dJMcaiI99e2/GTZaoo2n7Hb5DHZyjdzvfK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cdlh5W/dJMcaiI99e2/GTZaoo2n7Hb5DHZyjdzvfK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cdlh5W/dJMcaiI99e2/GTZaoo2n7Hb5DHZyjdzvfK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcdlh5W%2FdJMcaiI99e2%2FGTZaoo2n7Hb5DHZyjdzvfK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1389&quot; height=&quot;790&quot; data-origin-width=&quot;1389&quot; data-origin-height=&quot;790&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1760&quot; data-origin-height=&quot;515&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bas8TU/dJMcacoGhMC/pXexBgsq3kAqj6e62F7WO1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bas8TU/dJMcacoGhMC/pXexBgsq3kAqj6e62F7WO1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bas8TU/dJMcacoGhMC/pXexBgsq3kAqj6e62F7WO1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fbas8TU%2FdJMcacoGhMC%2FpXexBgsq3kAqj6e62F7WO1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1760&quot; height=&quot;515&quot; data-origin-width=&quot;1760&quot; data-origin-height=&quot;515&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;X/Y축: Patch 토큰들 (P0~P47 &amp;rarr; patch length 2로 쪼갠 패치) + Global Token (GLB)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 각 인코더 레이어별 패치-글로벌 토큰 Self-Attention 가중치 시각화&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 레이어별로 서로 다른 구간/패치/글로벌 토큰에 집중하며 다양한 패턴을 학습(레이어 깊어질수록 국소적/세부적 정보에서 거시적/전역적인 정보 포착해나감)&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2034&quot; data-origin-height=&quot;530&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cgrlgQ/dJMcafeGuv8/f693UiBqAGUYaNDBioAbXk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cgrlgQ/dJMcafeGuv8/f693UiBqAGUYaNDBioAbXk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cgrlgQ/dJMcafeGuv8/f693UiBqAGUYaNDBioAbXk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcgrlgQ%2FdJMcafeGuv8%2Ff693UiBqAGUYaNDBioAbXk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;2034&quot; height=&quot;530&quot; data-origin-width=&quot;2034&quot; data-origin-height=&quot;530&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 인코더 레이어별 글로벌-외생변수 어텐션 가중치 시각화&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 레이어별로 집중하는 외생변수 다름&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1575&quot; data-origin-height=&quot;820&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/QIygw/dJMcafeGuwd/0Mhk98R3bKLEPwn0u9pCEK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/QIygw/dJMcafeGuwd/0Mhk98R3bKLEPwn0u9pCEK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/QIygw/dJMcafeGuwd/0Mhk98R3bKLEPwn0u9pCEK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FQIygw%2FdJMcafeGuwd%2F0Mhk98R3bKLEPwn0u9pCEK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1575&quot; height=&quot;820&quot; data-origin-width=&quot;1575&quot; data-origin-height=&quot;820&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;첫번째 레이어 각 헤드별 어텐션 스코어&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Self-Attention (위쪽) - 패치간 Self-Attention&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;X축(Key), y축(Query)&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;참조되는 패치&amp;rarr; 시계열을 patch_len=2로 쪼갠 48개 패치&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;각 패치가 어느 패치와 유사한지&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Cross-Attention (아래쪽) - 외생변수, 전역토큰 간 Cross-Attention&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;X축(Key)&lt;/b&gt;: &lt;b&gt;외생변수&lt;/b&gt; (6개)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;y축(Query): 내생변수 전역토큰 (Global Token)&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;Global Token이 예측할 때, 어떤 외생변수를 얼마나 참고하는지&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;헤드별로 서로 다른 패턴/특징을 학습 중&lt;/b&gt;&lt;/p&gt;
&lt;h1&gt;4. Discussion&lt;/h1&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;TimeXer는 외생변수를 variate-wise 토큰화함 &amp;rarr; &lt;b&gt;만약 Look-back Window 가 매우 길다면, 토큰화 가정에서 정보손실?, 예측력에 영향?&lt;/b&gt; (외생변수의 세밀한 시점 정보가 희석될 수 있음)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;TimeMixer&lt;/b&gt; 모델 찾아보기&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;외생변수 또한 Patch 단위로 분할하여 반영한다면?
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Crossformer -&amp;gt;모든 변수를 패치로 쪼개고, 시간과 변수 차원 모두에서 Attention을 수행&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;외생변수도 내생변수처럼 글로번 토큰, 패치화해서 반영한다면?&lt;/li&gt;
&lt;li&gt;미래 예측시점 실시간 정보 반영하는법? &amp;rarr; 외생변수를 늘려서 토큰화 후, input?&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>Paper review</category>
      <category>TimeXer</category>
      <category>tsf</category>
      <author>Hippo's data</author>
      <guid isPermaLink="true">https://hipposdata.tistory.com/159</guid>
      <comments>https://hipposdata.tistory.com/entry/Paper-review-TimeXer#entry159comment</comments>
      <pubDate>Tue, 3 Mar 2026 09:59:39 +0900</pubDate>
    </item>
    <item>
      <title>[Paper review] TimesNet</title>
      <link>https://hipposdata.tistory.com/entry/Paper-review-TimesNet</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;오늘날까지도 TSF(Time-series Forecasting)에서 압도적인 성능을 보여주고 있는 &lt;b&gt;TimesNet&lt;/b&gt;에 대해 알아보도록 하겠습니다!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;특히 &lt;b&gt;시계열 데이터&lt;/b&gt;를 &lt;b&gt;1D Vision Task&lt;/b&gt;로 치환해서 &lt;b&gt;시계열 예측&lt;/b&gt;에 도입했던 &lt;b&gt;TCN&lt;/b&gt; 모델과 유사하게 &lt;b&gt;TimesNet&lt;/b&gt;는 &lt;b&gt;2D Vision Task&lt;/b&gt;로 &lt;b&gt;치환&lt;/b&gt;해서 &lt;b&gt;시계열 예측에 도입한 모델&lt;/b&gt;입니다!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;간단한 논문리뷰와 예제 데이터를 통한 실습까지 진행해보도록 하겠습니다!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Paper&lt;/b&gt;: TIMESNET: TEMPORAL 2D-VARIATION MODELING FOR GENERAL TIME SERIES ANALYSIS&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;(Haixu Wu, Tengge Hu, Yongliu Liu, Hang Zhou, Jianmin Wang, Mingsheng Long)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Conference:&lt;/b&gt; ICLR 2023&lt;/li&gt;
&lt;li&gt;&lt;b&gt;GitHub Repository:&lt;/b&gt; &lt;a href=&quot;https://github.com/thuml/Time-Series-Library&quot;&gt;https://github.com/thuml/Time-Series-Library&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;ArXiv:&lt;/b&gt; &lt;a href=&quot;https://arxiv.org/abs/2210.02186&quot;&gt;https://arxiv.org/abs/2210.02186&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;figure id=&quot;og_1770725986708&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - thuml/Time-Series-Library: A Library for Advanced Deep Time Series Models for General Time Series Analysis.&quot; data-og-description=&quot;A Library for Advanced Deep Time Series Models for General Time Series Analysis. - thuml/Time-Series-Library&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/thuml/Time-Series-Library&quot; data-og-url=&quot;https://github.com/thuml/Time-Series-Library&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bplrDj/dJMb9aKAZCs/9MLkzmqHmMoXJcisYSMWVk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/bfUWCO/dJMb85vKLkI/cQg2qpRskXTYkVCIWutIA1/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/thuml/Time-Series-Library&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/thuml/Time-Series-Library&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bplrDj/dJMb9aKAZCs/9MLkzmqHmMoXJcisYSMWVk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/bfUWCO/dJMb85vKLkI/cQg2qpRskXTYkVCIWutIA1/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - thuml/Time-Series-Library: A Library for Advanced Deep Time Series Models for General Time Series Analysis.&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;A Library for Advanced Deep Time Series Models for General Time Series Analysis. - thuml/Time-Series-Library&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;figure id=&quot;og_1770725985296&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;TimesNet: Temporal 2D-Variation Modeling for General Time Series Analysis&quot; data-og-description=&quot;Time series analysis is of immense importance in extensive applications, such as weather forecasting, anomaly detection, and action recognition. This paper focuses on temporal variation modeling, which is the common key problem of extensive analysis tasks.&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2210.02186&quot; data-og-url=&quot;https://arxiv.org/abs/2210.02186v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/gtqq7/dJMb9bvYcsu/AiwG6Hx58t2IQetgAL8JeK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bgkrcb/dJMb9eTLwX1/BUovvp00w2UY7a1JHWwEf0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2210.02186&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2210.02186&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/gtqq7/dJMb9bvYcsu/AiwG6Hx58t2IQetgAL8JeK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/bgkrcb/dJMb9eTLwX1/BUovvp00w2UY7a1JHWwEf0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;TimesNet: Temporal 2D-Variation Modeling for General Time Series Analysis&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Time series analysis is of immense importance in extensive applications, such as weather forecasting, anomaly detection, and action recognition. This paper focuses on temporal variation modeling, which is the common key problem of extensive analysis tasks.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;다양한 주기(period) 포착&amp;rarr; &lt;b&gt;시계열 분석을 2D vision task로 치환&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;1. SUMMARIZE&lt;/b&gt;&lt;b&gt;&lt;/b&gt;&lt;/h2&gt;
&lt;table id=&quot;2f4bd201-015f-8063-92c1-c43dfaaad4c7&quot; style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style12&quot;&gt;
&lt;tbody&gt;
&lt;tr id=&quot;2f4bd201-015f-8025-9d43-fa5a45e58bcd&quot;&gt;
&lt;td id=&quot;sLX[&quot; style=&quot;width: 12.7907%;&quot;&gt;&lt;b&gt;항목&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;eb&amp;lt;_&quot; style=&quot;width: 87.093%;&quot;&gt;&lt;b&gt;핵심 내용&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2f4bd201-015f-8018-8078-d5d40eae6eef&quot;&gt;
&lt;td id=&quot;sLX[&quot; style=&quot;width: 12.7907%;&quot;&gt;&lt;b&gt;Problem&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;eb&amp;lt;_&quot; style=&quot;width: 87.093%;&quot;&gt;&lt;b&gt;1D 시계열 표현 한계, 다중 주기성(Multi-periodicity)&lt;/b&gt;&lt;br /&gt;-&amp;gt; 현실의 시계열 데이터는 여러 주기가 중첩된 복잡한 형태&lt;br /&gt;-&amp;gt; 기존 1D 모델(RNN, TCN, Transformer)은 인접 시점의 정보만 포착할 뿐, 서로 다른 주기 간의 변동성(Temporal Variation)을 효과적으로 모델링하지 못함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2f4bd201-015f-80f2-8238-dfbb874a60af&quot;&gt;
&lt;td id=&quot;sLX[&quot; style=&quot;width: 12.7907%;&quot;&gt;&lt;b&gt;Method&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;eb&amp;lt;_&quot; style=&quot;width: 87.093%;&quot;&gt;&lt;b&gt;1. 1D to 2D Transformation (구조 변환)&lt;/b&gt;&lt;br /&gt;&amp;bull; &lt;b&gt;Periodicity Discovery:&lt;/b&gt; FFT(고속 푸리에 변환)를 수행하여 데이터 내에서 Top-k개의 주기(Period) 감지&lt;br /&gt;&amp;bull; &lt;b&gt;Reshape:&lt;/b&gt; 감지된 주기를 기준으로 &lt;b&gt;1D 시계열을 2D 텐서&lt;/b&gt;로 변환 &amp;rarr; '주기 내 변동(Intra-period, 열)', '주기 간 변동(Inter-period, 행)'을 2D로 구조화&lt;br /&gt;&lt;br /&gt;&lt;b&gt;2. TimesBlock (특징 학습)&lt;/b&gt;&lt;br /&gt;&amp;bull; &lt;b&gt;2D Vision Backbone:&lt;/b&gt; 변환된 2D 텐서에 &lt;b&gt;Inception Block&lt;/b&gt;을 적용하여, 다양한 크기의 커널(Multi-scale)로 2D 공간의 지역적/전역적 패턴을 동시에 학습&lt;br /&gt;&amp;bull; &lt;b&gt;Adaptive Aggregation:&lt;/b&gt; 각 주기별로 학습된 k개의 표현(Representation)을 주파수 진폭(Amplitude) 기반 가중합으로 결합하여 최종 출력 생성&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2f4bd201-015f-8011-a87c-fdd2a16af35e&quot;&gt;
&lt;td id=&quot;sLX[&quot; style=&quot;width: 12.7907%;&quot;&gt;&lt;b&gt;Results&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;eb&amp;lt;_&quot; style=&quot;width: 87.093%;&quot;&gt;&lt;b&gt;범용적인(Task-General) 시계열 분석 성능 입증&lt;/b&gt;&lt;br /&gt;장/단기 예측, 결측치 보간, 분류, 이상 탐지 등 &lt;b&gt;5가지 주요 시계열 태스크에서 SOTA&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2f4bd201-015f-80ca-8be3-d5d59e221659&quot;&gt;
&lt;td id=&quot;sLX[&quot; style=&quot;width: 12.7907%;&quot;&gt;&lt;b&gt;Contribution&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;eb&amp;lt;_&quot; style=&quot;width: 87.093%;&quot;&gt;&lt;b&gt;Time Series Analysis as 2D Computer Vision&lt;/b&gt;&lt;br /&gt;시계열 데이터를 1D 시퀀스가 아닌 &lt;b&gt;2D 비전 문제&lt;/b&gt;로 치환하는 새로운 프레임워크를 제안&lt;br /&gt;복잡한 시계열 전용 모듈 설계 없이도, 검증된 &lt;b&gt;최신 2D 비전 백본 모델&lt;/b&gt;(ResNet, Swin Transformer 등)을 &lt;b&gt;시계열 분석에 직접 적용&lt;/b&gt;할 수 있는 범용적인 기반(Foundation)을 마련&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;2. DETAIL&lt;/b&gt;&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;1. Introduction&lt;/b&gt;&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1120&quot; data-origin-height=&quot;354&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cZO7sD/dJMcabC7O9R/T4Fq80dr4gSeMOQlpWReDk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cZO7sD/dJMcabC7O9R/T4Fq80dr4gSeMOQlpWReDk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cZO7sD/dJMcabC7O9R/T4Fq80dr4gSeMOQlpWReDk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcZO7sD%2FdJMcabC7O9R%2FT4Fq80dr4gSeMOQlpWReDk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1120&quot; height=&quot;354&quot; data-origin-width=&quot;1120&quot; data-origin-height=&quot;354&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;기존 1D 구조 한계&lt;/b&gt;: 인접한 시점간 변동만 파악&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; intraperiod, interperiod 활용하여 1D &amp;rarr; 2D 로 재구성&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;intraperiod&lt;/b&gt;(= 주기 내 변동):
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;특정 &lt;b&gt;주기 안&lt;/b&gt;에서의 변화 패턴&lt;/li&gt;
&lt;li&gt;열(columns)&lt;/li&gt;
&lt;li&gt;예) 1월의 30일 변화 패턴&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;interperiod&lt;/b&gt;(= 주기 간 변동):
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;서로 &lt;b&gt;다른 주기 간&lt;/b&gt; 변화 패턴&lt;/li&gt;
&lt;li&gt;행(rows)&lt;/li&gt;
&lt;li&gt;예) 1,2,3 &amp;hellip; 각 월 끼리의 변화 패턴&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;2. RELATED WORK&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 방법론&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;정의된 패턴 가정한 모델 - ARIMA, Holt-Winter, Prophet
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;실제 현실에서는 복잡한 변동성으로 인해 정의된 패턴으로 커버 불가능&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;딥러닝 기반
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;RNN 기반 - 장기의존성 한계, 계산 비효율성&lt;/li&gt;
&lt;li&gt;TCN 기반 - 지역적 특성 포착에는 장점 / 장기 의존성 한계&lt;/li&gt;
&lt;li&gt;Transformer 기반 - 시점간 쌍별(pair-wise) 의존성 포착 / 명확한 의존성 포착 한계&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 &lt;b&gt;1D 시계열&lt;/b&gt; 한계&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;인접 시점 정보 포착은 잘하지만, &lt;b&gt;여러 시점에 걸친 패턴&lt;/b&gt; 포착에는 한계점 존재&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;2D 시계열&lt;/b&gt; 제안&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;3. TIMESNET&lt;/b&gt;&lt;/h3&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;3.1 TRANSFORM 1D-VARIATIONS INTO 2D-VARIATIONS&lt;/b&gt;&lt;/h4&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;875&quot; data-origin-height=&quot;319&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/K96Gj/dJMcadVbEhP/ooaMLni7mleGjgVzpEI5mk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/K96Gj/dJMcadVbEhP/ooaMLni7mleGjgVzpEI5mk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/K96Gj/dJMcadVbEhP/ooaMLni7mleGjgVzpEI5mk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FK96Gj%2FdJMcadVbEhP%2FooaMLni7mleGjgVzpEI5mk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;875&quot; height=&quot;319&quot; data-origin-width=&quot;875&quot; data-origin-height=&quot;319&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1499&quot; data-origin-height=&quot;109&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/yhlHe/dJMcaiWvpiF/Im9grYHqCQFavCEA82IjEk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/yhlHe/dJMcaiWvpiF/Im9grYHqCQFavCEA82IjEk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/yhlHe/dJMcaiWvpiF/Im9grYHqCQFavCEA82IjEk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FyhlHe%2FdJMcaiWvpiF%2FIm9grYHqCQFavCEA82IjEk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1499&quot; height=&quot;109&quot; data-origin-width=&quot;1499&quot; data-origin-height=&quot;109&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;FFT&lt;/b&gt; 적용하여 &lt;b&gt;Top k개의 주파수&lt;/b&gt;를 찾아내어 각각 &lt;b&gt;k개의 주기 길이&lt;/b&gt;를 계산&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$X_{1D}​&amp;isin;R^{T&amp;times;C}$: 1차원 시계열 데이터&lt;/li&gt;
&lt;li&gt;$FFT(X_{1D})$: 1차원 시계열 데이터에 FFT(Fast Fourier Transform, 고속 푸리에 변환) 적용&lt;/li&gt;
&lt;li&gt;$Amp(&amp;sdot;)$: 분해된 각 주파수 스펙트럼 진폭(amplitude, 높이) 계산&lt;/li&gt;
&lt;li&gt;Avg(&amp;sdot;): 여러 변수(multivariate)의 진폭 평균 (단변량(univariate)일 경우, 생략)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉, &lt;b&gt;A&lt;/b&gt;는 각 주파수들의 &lt;b&gt;상대적인 중요도&lt;/b&gt; 나타냄&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$f_1,&amp;hellip;,f_k$: A에서 가장 큰 k개(hyper-parameter)의 진폭 값을 갖는 주파수들 선택
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;목적
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;주파수 도메인 희소성(Sparsity) 고려 - 특정 주파수에 주기성이 몰려있는 특징 고려&lt;/li&gt;
&lt;li&gt;고주파 노이즈 제외&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;$Topk_{f&amp;lowast;&amp;isin;{1,&amp;hellip;,&amp;lfloor;T/2&amp;rfloor;}(A)}$: 해당 선택된 주파수 인덱스 탐색
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;1 ~ $&amp;lfloor;T/2&amp;rfloor;$: 1부터 총 시계열 길이 T의 절반까지 탐색(FFT를 통해 분해된 주파수는 대칭성을 가지기 때문&amp;rarr; 주파수 영역의 켤레성 (conjugacy of frequency domain))&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;$pi​=&amp;lceil;T/fi​&amp;rceil;$: 각 선택된 주파수 $f_i$ 에 해당하는 주기(period) $p_i$ 계산
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;주기계산 &amp;rarr; 시계열 길이 T를 해당 주파수 $f_i$로 나눔 (올림연산 &amp;rarr; 정수값)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;740&quot; data-origin-height=&quot;54&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/lganL/dJMcafFv6dX/YhkqAxf4l3LSWyXJqz87X0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/lganL/dJMcafFv6dX/YhkqAxf4l3LSWyXJqz87X0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/lganL/dJMcafFv6dX/YhkqAxf4l3LSWyXJqz87X0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FlganL%2FdJMcafFv6dX%2FYhkqAxf4l3LSWyXJqz87X0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;740&quot; height=&quot;54&quot; data-origin-width=&quot;740&quot; data-origin-height=&quot;54&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 위의 과정을 요약한(summarize) 수식&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;859&quot; data-origin-height=&quot;56&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ew8BFL/dJMcagqSCEZ/e4ZT97X55ZETJTODg7Cxg1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ew8BFL/dJMcagqSCEZ/e4ZT97X55ZETJTODg7Cxg1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ew8BFL/dJMcagqSCEZ/e4ZT97X55ZETJTODg7Cxg1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Few8BFL%2FdJMcagqSCEZ%2Fe4ZT97X55ZETJTODg7Cxg1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;859&quot; height=&quot;56&quot; data-origin-width=&quot;859&quot; data-origin-height=&quot;56&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;1D &amp;rarr; 2D 변환&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$Padding(X_{1D})$: 2D 텐서 형태로 구성하기 위해 &lt;b&gt;제로 패딩&lt;/b&gt; 추가&lt;/li&gt;
&lt;li&gt;$Reshape_{p_i, f_i}$: 1D &amp;rarr; 2D ( $p_i$개 행과 $f_i$개 열)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$p_i$: 행, 주기 길이, interperiod = &lt;b&gt;adjacent periods&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;$f_i$: 열, 해당 주기에 대한 주파수(frequency)의 역수, intraperiod = &lt;b&gt;adjacent time points&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;주기(p): 한 번 반복되는 데 걸리는 시간&lt;/li&gt;
&lt;li&gt;주파수(f): 단위 시간당 반복되는 횟수&lt;/li&gt;
&lt;li&gt;f=1/p (역수관계)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 100%;&quot;&gt; &lt;span&gt;푸리에 변환( Fourier Transform)이란?&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&amp;rarr; 복잡한 신호는 단순한 파동들의 합으로 표현 가능함&lt;/span&gt;&lt;br /&gt;&lt;span&gt;정의: 시간에 따라 변하는 신호(&lt;b&gt;Time Domain&lt;/b&gt;) &amp;rarr; 주파수 성분&lt;b&gt;(Frequency Domain&lt;/b&gt;)으로 분해&lt;/span&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;2048&quot; data-origin-height=&quot;1118&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cAqtT2/dJMcaiIYaRb/vQ0i4IheaUHjDL19uC9Z91/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cAqtT2/dJMcaiIYaRb/vQ0i4IheaUHjDL19uC9Z91/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cAqtT2/dJMcaiIYaRb/vQ0i4IheaUHjDL19uC9Z91/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcAqtT2%2FdJMcaiIYaRb%2FvQ0i4IheaUHjDL19uC9Z91%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;763&quot; height=&quot;417&quot; data-origin-width=&quot;2048&quot; data-origin-height=&quot;1118&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;aside&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;컴퓨터는 연속된 신호가 아닌, 이산 데이터를 다루기 때문에 이산 푸리에 변환(DFT)을 사용&lt;/li&gt;
&lt;li&gt;DFT는 연산량이 많아 연산량을 줄인 FFT 이용&lt;/li&gt;
&lt;/ul&gt;
&lt;/aside&gt;
&lt;table id=&quot;2f4bd201-015f-80f0-832b-eacabb3ec341&quot; style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style12&quot;&gt;
&lt;tbody&gt;
&lt;tr id=&quot;2f4bd201-015f-8007-82a5-d6d266c3a21c&quot;&gt;
&lt;td id=&quot;nfR@&quot; style=&quot;width: 6.39535%;&quot;&gt;&lt;b&gt;구분&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;jC;d&quot; style=&quot;width: 42.093%;&quot;&gt;&lt;b&gt;DFT (Discrete Fourier Transform)&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;GB?{&quot; style=&quot;width: 51.3954%;&quot;&gt;&lt;b&gt;FFT (Fast Fourier Transform)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2f4bd201-015f-8053-96c3-c7683246daff&quot;&gt;
&lt;td id=&quot;nfR@&quot; style=&quot;width: 6.39535%;&quot;&gt;&lt;b&gt;정의&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;jC;d&quot; style=&quot;width: 42.093%;&quot;&gt;이산 데이터를 주파수로 변환하는 &lt;b&gt;수학적 공식(Definition)&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;GB?{&quot; style=&quot;width: 51.3954%;&quot;&gt;DFT를 컴퓨터가 빠르게 계산하기 위한 &lt;b&gt;고속 알고리즘(Implementation)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2f4bd201-015f-8097-8d20-cede216e8825&quot;&gt;
&lt;td id=&quot;nfR@&quot; style=&quot;width: 6.39535%;&quot;&gt;&lt;b&gt;방식&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;jC;d&quot; style=&quot;width: 42.093%;&quot;&gt;데이터 전체를 1:1로 내적하여 계산&lt;/td&gt;
&lt;td id=&quot;GB?{&quot; style=&quot;width: 51.3954%;&quot;&gt;데이터를 반으로 쪼개는 &lt;b&gt;분할 정복(Divide &amp;amp; Conquer)&lt;/b&gt; 방식&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2f4bd201-015f-8082-9237-f6922dd10472&quot;&gt;
&lt;td id=&quot;nfR@&quot; style=&quot;width: 6.39535%;&quot;&gt;&lt;b&gt;속도&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;jC;d&quot; style=&quot;width: 42.093%;&quot;&gt;&lt;b&gt;O(N^2)&lt;/b&gt; (느림)&lt;/td&gt;
&lt;td id=&quot;GB?{&quot; style=&quot;width: 51.3954%;&quot;&gt;&lt;b&gt;O(N log N)&lt;/b&gt; (매우 빠름)&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;br /&gt;&lt;br /&gt;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;3.2 TIMESBLOCK&lt;/b&gt;&lt;/h4&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;892&quot; data-origin-height=&quot;281&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/oBCiu/dJMcacaYoT8/qka1scRlYz30HPqZ332gd1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/oBCiu/dJMcacaYoT8/qka1scRlYz30HPqZ332gd1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/oBCiu/dJMcacaYoT8/qka1scRlYz30HPqZ332gd1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FoBCiu%2FdJMcacaYoT8%2Fqka1scRlYz30HPqZ332gd1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;892&quot; height=&quot;281&quot; data-origin-width=&quot;892&quot; data-origin-height=&quot;281&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;381&quot; data-origin-height=&quot;40&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/1d8tZ/dJMcaivqTRI/mKgF9Q2S4LhaZLKgN5bqTK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/1d8tZ/dJMcaivqTRI/mKgF9Q2S4LhaZLKgN5bqTK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/1d8tZ/dJMcaivqTRI/mKgF9Q2S4LhaZLKgN5bqTK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F1d8tZ%2FdJMcaivqTRI%2FmKgF9Q2S4LhaZLKgN5bqTK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;381&quot; height=&quot;40&quot; data-origin-width=&quot;381&quot; data-origin-height=&quot;40&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 각 레이어 l의 연산&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;잔차 연결(residual connection) 구조&lt;/b&gt;: TimesBlock 출력을 이전 레이어의 출력에 더하여 다음 레이어의 출력 생성&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Capturing temporal 2D-variations&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;912&quot; data-origin-height=&quot;191&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bRv7fQ/dJMcahDjmG0/FMmkLkQ8VZvu3KCCtVXfb1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bRv7fQ/dJMcahDjmG0/FMmkLkQ8VZvu3KCCtVXfb1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bRv7fQ/dJMcahDjmG0/FMmkLkQ8VZvu3KCCtVXfb1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbRv7fQ%2FdJMcahDjmG0%2FFMmkLkQ8VZvu3KCCtVXfb1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;912&quot; height=&quot;191&quot; data-origin-width=&quot;912&quot; data-origin-height=&quot;191&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;주기추출, 2D 텐서로 변환, Inception블록을 이용하여 특징추출, 1D로 변환&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Trunc(&amp;sdot;): 패딩으로 인해 추가된 부분 제거, 기존 시계열 길이 T에 맞게 자름&lt;/li&gt;
&lt;li&gt;Shared Inception Block
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;시계열에서 발견된 'K'개의 주기성 각각에 대해 생성된 2D 텐서들을 처리하기 위해 동일한 하나의 Inception block 공유(shared)&lt;/li&gt;
&lt;li&gt;추출된 주기성 수 K에 관계없이 모델의 전체 크기는 크게 변하지 않음(model size invariance)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Adaptive aggregation&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;498&quot; data-origin-height=&quot;136&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/uNAGX/dJMcaaYuXaG/zuwND3eef983KOPcecE7mk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/uNAGX/dJMcaaYuXaG/zuwND3eef983KOPcecE7mk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/uNAGX/dJMcaaYuXaG/zuwND3eef983KOPcecE7mk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FuNAGX%2FdJMcaaYuXaG%2FzuwND3eef983KOPcecE7mk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;509&quot; height=&quot;139&quot; data-origin-width=&quot;498&quot; data-origin-height=&quot;136&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 여러 주기에 대해 처리된 2D 텐서 특징($X_{ID}^{l,i}$)들을 중요도 가중치($A_{f_i}^{l&amp;minus;1}$)와 곱하여 결합&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$A_{f_i}^{l&amp;minus;1}$: 각 주파수의 진폭(amplitude = 중요도 가중치)을 Softmax 함수를 이용하여 확률로 표현(0~1, 총합=1)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Generality in 2D vision backbones&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다양한 2D 백본(Inception, ResNet, Swin Transformer, ConvNeXt 등)을 시계열 분석에 활용가능&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;4. EXPERIMENTS&lt;/b&gt;&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;897&quot; data-origin-height=&quot;225&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/dckheK/dJMcagLcMxE/6u7HZKYucvkArtU7CFkyq0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/dckheK/dJMcagLcMxE/6u7HZKYucvkArtU7CFkyq0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/dckheK/dJMcagLcMxE/6u7HZKYucvkArtU7CFkyq0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdckheK%2FdJMcagLcMxE%2F6u7HZKYucvkArtU7CFkyq0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;897&quot; height=&quot;225&quot; data-origin-width=&quot;897&quot; data-origin-height=&quot;225&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Baselines&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;RNN 기반: LSTM (1997), LSTNet (2018), LSSL (2022)&lt;/li&gt;
&lt;li&gt;CNN 기반: TCN (2019)&lt;/li&gt;
&lt;li&gt;MLP 기반: LightTS (2022), DLinear (2023)&lt;/li&gt;
&lt;li&gt;Transformer 기반: Reformer (2020), Informer (2021), Pyraformer (2021a), Autoformer (2021), FEDformer (2022), Non-stationary Transformer (2022a), ETSformer (2022)&lt;/li&gt;
&lt;li&gt;각 작업별 최신 모델: 단기 예측을 위한 N-HiTS (2022) 및 N-BEATS (2019), 이상 탐지를 위한 Anomaly Transformer (2021), 분류를 위한 Rocket (2020) 및 Flowformer (2022)&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4.1 MAIN RESULTS&lt;/b&gt;&lt;/h4&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;937&quot; data-origin-height=&quot;304&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/oMmiX/dJMcafS3q43/HKQLJr07M3652upEr7zJh0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/oMmiX/dJMcafS3q43/HKQLJr07M3652upEr7zJh0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/oMmiX/dJMcafS3q43/HKQLJr07M3652upEr7zJh0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FoMmiX%2FdJMcafS3q43%2FHKQLJr07M3652upEr7zJh0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;937&quot; height=&quot;304&quot; data-origin-width=&quot;937&quot; data-origin-height=&quot;304&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;(좌) 장기 예측, 단기 예측, 결측치 보간, 분류, 이상 탐지 등 다섯 가지 분야에서 SOTA 달성&lt;/li&gt;
&lt;li&gt;(우) 다양한 비전 백본 모델로 교체 &amp;rarr; 더 효과적인 성능 확보 가능&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4.2 SHORT- AND LONG-TERM FORECASTING&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Long-term Fcst&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;past sequence length, Fcst length&lt;/li&gt;
&lt;li&gt;ILI Dataset: 36, {24, 36, 48, 60}&lt;/li&gt;
&lt;li&gt;Others: 96, {96, 192, 336, 720}&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1007&quot; data-origin-height=&quot;437&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/DFPiq/dJMcabJUb6d/vQMomfQWgGN1qZKlkx3Owk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/DFPiq/dJMcabJUb6d/vQMomfQWgGN1qZKlkx3Owk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/DFPiq/dJMcabJUb6d/vQMomfQWgGN1qZKlkx3Owk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FDFPiq%2FdJMcabJUb6d%2FvQMomfQWgGN1qZKlkx3Owk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1007&quot; height=&quot;437&quot; data-origin-width=&quot;1007&quot; data-origin-height=&quot;437&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Short-term Fcst&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Fcst length: [6, 48]&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;997&quot; data-origin-height=&quot;153&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cLmGZS/dJMcacotON0/GYQSpZhOYguGFPObFKBii0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cLmGZS/dJMcacotON0/GYQSpZhOYguGFPObFKBii0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cLmGZS/dJMcacotON0/GYQSpZhOYguGFPObFKBii0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcLmGZS%2FdJMcacotON0%2FGYQSpZhOYguGFPObFKBii0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;997&quot; height=&quot;153&quot; data-origin-width=&quot;997&quot; data-origin-height=&quot;153&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;Long-term, Short-term FCST에서 대부분 SOTA 달성&lt;/b&gt;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4.3 IMPUTATION&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;randomly mask {12.5%, 25%, 37.5%, 50%}&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;96 length&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1005&quot; data-origin-height=&quot;325&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cxptYp/dJMcafMiZDk/EPr4tVSzkkZV55hx1qb7sK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cxptYp/dJMcafMiZDk/EPr4tVSzkkZV55hx1qb7sK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cxptYp/dJMcafMiZDk/EPr4tVSzkkZV55hx1qb7sK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcxptYp%2FdJMcafMiZDk%2FEPr4tVSzkkZV55hx1qb7sK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1005&quot; height=&quot;325&quot; data-origin-width=&quot;1005&quot; data-origin-height=&quot;325&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; SOTA 달성&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4.4 CLASSIFICATION&lt;/b&gt;&lt;/h4&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;609&quot; data-origin-height=&quot;338&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bXrY6t/dJMcagxDoDO/Aps0wI6HnK91EyFD4Y9HIk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bXrY6t/dJMcagxDoDO/Aps0wI6HnK91EyFD4Y9HIk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bXrY6t/dJMcagxDoDO/Aps0wI6HnK91EyFD4Y9HIk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbXrY6t%2FdJMcagxDoDO%2FAps0wI6HnK91EyFD4Y9HIk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;609&quot; height=&quot;338&quot; data-origin-width=&quot;609&quot; data-origin-height=&quot;338&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;UEA Time Series Classification Archve 데이터셋 - multivariate(10개 변수)&lt;/li&gt;
&lt;li&gt;기존 SOTA Rocket, Deep model Flowformer 뛰어넘는 성능&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4.5 ANOMALY DETECTION&lt;/b&gt;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;5가지 이상탐지 벤치마크 데이터셋
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;SMD, MSL, SMAP, SWaT, PSM&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;sliding window 방식 &amp;rarr; 연속적, 겹치지않는 segment로 분할&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;987&quot; data-origin-height=&quot;240&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/AvCc1/dJMcadHEzoz/NW6quEpxzKsWRc9WOYPAdK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/AvCc1/dJMcadHEzoz/NW6quEpxzKsWRc9WOYPAdK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/AvCc1/dJMcadHEzoz/NW6quEpxzKsWRc9WOYPAdK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FAvCc1%2FdJMcadHEzoz%2FNW6quEpxzKsWRc9WOYPAdK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;987&quot; height=&quot;240&quot; data-origin-width=&quot;987&quot; data-origin-height=&quot;240&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;FEDformer, Autoformer 같은 advanced Transformer기반 모델 능가&lt;/li&gt;
&lt;li&gt;일반적인Transformer기반 모델은 평균적으로 낮은 점수
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;다수의 정상시점에 의해 오판될 가능성 존재 (이상탐지는 희귀한 비정상 패턴을 식별해야 하는 반면)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;주기성 추출한는 모델(TimesNet, FEDformer, Autoformer) 우수한 성능 &amp;rarr; 이상탐지에 주기성 고려 중요&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4.6 MODEL ANALYSIS&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Representation analysis&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;990&quot; data-origin-height=&quot;216&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/IyFXd/dJMcadHEzoj/ISCvrsxuIl59IM9Hk7och1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/IyFXd/dJMcadHEzoj/ISCvrsxuIl59IM9Hk7och1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/IyFXd/dJMcadHEzoj/ISCvrsxuIl59IM9Hk7och1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FIyFXd%2FdJMcadHEzoj%2FISCvrsxuIl59IM9Hk7och1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;990&quot; height=&quot;216&quot; data-origin-width=&quot;990&quot; data-origin-height=&quot;216&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CKA similarity (Centered Kernel Alignment)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;신경망의 다른 계층(layer)에서 학습한 표현(representation) 간의 유사성 측정
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;높음&lt;/b&gt;: 계층간 표현이 유사 &amp;rarr; 신경망이 깊어지더라도 &lt;b&gt;학습되는 특징들이 크게 변하지 않음&lt;/b&gt; (저low 수준의 일반적인 특징 학습)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;낮음&lt;/b&gt;: 계층별 표현이 구별됨 &amp;rarr; 신경망이 깊어지면서 &lt;b&gt;특징들이 다른 방식으로 학습&lt;/b&gt;, 계층적(hierarchical) 학습 접근 방식(&lt;b&gt;계층별로 다른 표현 학습&lt;/b&gt; - 일반적인 특징, 복잡한 특징 등)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;각 Task 별로 적합한 표현능력(Representation) 존재 &amp;rarr; &lt;b&gt;각 Task별 성능과 CKA similarity 상관관계 높음&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;보간(Imputation), 이상 탐지(Anomaly Detection) &amp;rarr; 높은 CKA 유사도 효과적 (일반적인 저수준low 패턴 학습이 중요함)&lt;/li&gt;
&lt;li&gt;예측(Forecasting), 분류(Classification) &amp;rarr; 낮은 CKA 유사도 효과적 (복잡한 패턴, 계층적 표현 학습 중요)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; TimesNet은 각 작업에 적합한 표현을 학습 &amp;rarr; &lt;b&gt;범용적으로 활용 가능&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; FEDformer는 예측, 이상 탐지 작업에서 우수한 성능 / 보간, 분류에는 계층적 표현 학습 어려움&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Temporal 2D-variations&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;426&quot; data-origin-height=&quot;306&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/chEvSu/dJMcabb1YBA/tGDitIc1zx1aIqOZj66Wm0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/chEvSu/dJMcabb1YBA/tGDitIc1zx1aIqOZj66Wm0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/chEvSu/dJMcabb1YBA/tGDitIc1zx1aIqOZj66Wm0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FchEvSu%2FdJMcabb1YBA%2FtGDitIc1zx1aIqOZj66Wm0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;426&quot; height=&quot;306&quot; data-origin-width=&quot;426&quot; data-origin-height=&quot;306&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 원본 1D 시계열 데이터를 여러 주기를 기준으로 변환한 &lt;b&gt;2D 텐서&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 특정 주파수(Frequency)와 해당 주파수에 따른 주기(Period) 길이&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;행(Rows): 기간 간 변동(Interperiod-variation)&lt;/li&gt;
&lt;li&gt;열(Columns): 기간 내 변동(Intraperiod-variation)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 특정 시점이나 주기에서 나타나는 강한 변동성 확인&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;3. Implementation&lt;/b&gt;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://github.com/thuml/Time-Series-Library&quot;&gt;https://github.com/thuml/Time-Series-Library&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1770726845545&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - thuml/Time-Series-Library: A Library for Advanced Deep Time Series Models for General Time Series Analysis.&quot; data-og-description=&quot;A Library for Advanced Deep Time Series Models for General Time Series Analysis. - thuml/Time-Series-Library&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/thuml/Time-Series-Library&quot; data-og-url=&quot;https://github.com/thuml/Time-Series-Library&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bplrDj/dJMb9aKAZCs/9MLkzmqHmMoXJcisYSMWVk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/bfUWCO/dJMb85vKLkI/cQg2qpRskXTYkVCIWutIA1/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/thuml/Time-Series-Library&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/thuml/Time-Series-Library&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bplrDj/dJMb9aKAZCs/9MLkzmqHmMoXJcisYSMWVk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/bfUWCO/dJMb85vKLkI/cQg2qpRskXTYkVCIWutIA1/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - thuml/Time-Series-Library: A Library for Advanced Deep Time Series Models for General Time Series Analysis.&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;A Library for Advanced Deep Time Series Models for General Time Series Analysis. - thuml/Time-Series-Library&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Dataset&lt;/b&gt;: &lt;b&gt;Airline Passengers&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://raw.githubusercontent.com/jbrownlee/Datasets/master/airline-passengers.csv&quot;&gt;https://raw.githubusercontent.com/jbrownlee/Datasets/master/airline-passengers.csv&lt;/a&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;총 길이:&lt;/b&gt; 144개월 (12년), 월별 기록&lt;/li&gt;
&lt;li&gt;&lt;b&gt;모델 아키텍처&lt;/b&gt; - 비전 백본으로 &lt;b&gt;inception v1&lt;/b&gt; 사용&lt;/li&gt;
&lt;/ul&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 100%;&quot;&gt;&lt;span&gt;Model(&lt;br /&gt;(model): ModuleList(&lt;br /&gt;(0-1): 2 x TimesBlock(&lt;br /&gt;(conv): Sequential(&lt;br /&gt;(0): Inception_Block_V1(&lt;br /&gt;(kernels): ModuleList(&lt;br /&gt;(0): Conv2d(16, 32, kernel_size=(1, 1), stride=(1, 1))&lt;br /&gt;(1): Conv2d(16, 32, kernel_size=(3, 3), stride=(1, 1), padding=(1, 1))&lt;br /&gt;(2): Conv2d(16, 32, kernel_size=(5, 5), stride=(1, 1), padding=(2, 2))&lt;br /&gt;(3): Conv2d(16, 32, kernel_size=(7, 7), stride=(1, 1), padding=(3, 3))&lt;br /&gt;(4): Conv2d(16, 32, kernel_size=(9, 9), stride=(1, 1), padding=(4, 4))&lt;br /&gt;(5): Conv2d(16, 32, kernel_size=(11, 11), stride=(1, 1), padding=(5, 5))&lt;br /&gt;)&lt;br /&gt;(1): GELU(approximate='none')&lt;br /&gt;(2): Inception_Block_V1(&lt;br /&gt;(kernels): ModuleList(&lt;br /&gt;(0): Conv2d(32, 16, kernel_size=(1, 1), stride=(1, 1))&lt;br /&gt;(1): Conv2d(32, 16, kernel_size=(3, 3), stride=(1, 1), padding=(1, 1))&lt;br /&gt;(2): Conv2d(32, 16, kernel_size=(5, 5), stride=(1, 1), padding=(2, 2))&lt;br /&gt;(3): Conv2d(32, 16, kernel_size=(7, 7), stride=(1, 1), padding=(3, 3))&lt;br /&gt;(4): Conv2d(32, 16, kernel_size=(9, 9), stride=(1, 1), padding=(4, 4))&lt;br /&gt;(5): Conv2d(32, 16, kernel_size=(11, 11), stride=(1, 1), padding=(5, 5))&lt;br /&gt;)&lt;br /&gt;(enc_embedding): Linear(in_features=1, out_features=16, bias=True)&lt;br /&gt;(layer_norm): LayerNorm((16,), eps=1e-05, elementwise_affine=True)&lt;br /&gt;(predict_linear): Linear(in_features=96, out_features=120, bias=True)&lt;br /&gt;(projection): Linear(in_features=16, out_features=1, bias=True)&lt;br /&gt;)&lt;/span&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;파라미터&lt;/li&gt;
&lt;/ul&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 100%;&quot;&gt;class&amp;nbsp;Configs: &lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;seq_len&amp;nbsp;=&amp;nbsp;96&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;#&amp;nbsp;입력&amp;nbsp;길이&amp;nbsp; &lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;pred_len = 24&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;# 예측 길&lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;enc_in&amp;nbsp;=&amp;nbsp;1;&amp;nbsp;c_out&amp;nbsp;=&amp;nbsp;1 &lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;d_model&amp;nbsp;=&amp;nbsp;16;&amp;nbsp;d_ff&amp;nbsp;=&amp;nbsp;32 &lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;e_layers&amp;nbsp;=&amp;nbsp;2 &lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;num_kernels&amp;nbsp;=&amp;nbsp;6 &lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;top_k&amp;nbsp;=&amp;nbsp;3&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;#&amp;nbsp;3개의&amp;nbsp;주기&amp;nbsp;사용 &lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;learning_rate&amp;nbsp;=&amp;nbsp;0.001 &lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;batch_size&amp;nbsp;=&amp;nbsp;64 &lt;br /&gt;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;epochs&amp;nbsp;=&amp;nbsp;200&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 변환된 2D 텐서 시각화
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;top 3개 주기
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;96, 48, 12 주기로 추출됨
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;96 = 1 X 96 &amp;rarr; 전체 주기 : Trend&lt;/li&gt;
&lt;li&gt;48 = 2 X 48&lt;/li&gt;
&lt;li&gt;12 = 8 X 12 &amp;rarr; 1년(12월) 주기
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;가로축 (Width = 12):&lt;/b&gt; 1월, 2월, ..., 12월 (계절 안에서의 변화, Intra-period)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;여름 휴가철(6,7월) 진한 노란색&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;세로축 (Height = 8):&lt;/b&gt; 1년차, 2년차, ..., 8년차 (연도 간의 변화, Inter-period)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;292&quot; data-origin-height=&quot;180&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/WMyki/dJMcaf6z31L/xF5jbNIAqrUSbCeHHKUY4K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/WMyki/dJMcaf6z31L/xF5jbNIAqrUSbCeHHKUY4K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/WMyki/dJMcaf6z31L/xF5jbNIAqrUSbCeHHKUY4K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FWMyki%2FdJMcaf6z31L%2FxF5jbNIAqrUSbCeHHKUY4K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;292&quot; height=&quot;180&quot; data-origin-width=&quot;292&quot; data-origin-height=&quot;180&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1188&quot; data-origin-height=&quot;1190&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/06ntQ/dJMcadOpdLw/CFR0k2I1NG7UMIEixlpKBK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/06ntQ/dJMcadOpdLw/CFR0k2I1NG7UMIEixlpKBK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/06ntQ/dJMcadOpdLw/CFR0k2I1NG7UMIEixlpKBK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F06ntQ%2FdJMcadOpdLw%2FCFR0k2I1NG7UMIEixlpKBK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1188&quot; height=&quot;1190&quot; data-origin-width=&quot;1188&quot; data-origin-height=&quot;1190&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;예측 결과 시각화&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;986&quot; data-origin-height=&quot;451&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/YmdoU/dJMcabwkHKE/Kn0wQ6NKyUvwWzdFJZwjEK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/YmdoU/dJMcabwkHKE/Kn0wQ6NKyUvwWzdFJZwjEK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/YmdoU/dJMcabwkHKE/Kn0wQ6NKyUvwWzdFJZwjEK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FYmdoU%2FdJMcabwkHKE%2FKn0wQ6NKyUvwWzdFJZwjEK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;986&quot; height=&quot;451&quot; data-origin-width=&quot;986&quot; data-origin-height=&quot;451&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;FFT 변환
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;top 3개 주기로 원본 데이터셋 분해&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1189&quot; data-origin-height=&quot;989&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cNcglT/dJMcagj6Qyc/wwCIgcysorlatbGkfkRFT0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cNcglT/dJMcagj6Qyc/wwCIgcysorlatbGkfkRFT0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cNcglT/dJMcagj6Qyc/wwCIgcysorlatbGkfkRFT0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcNcglT%2FdJMcagj6Qyc%2FwwCIgcysorlatbGkfkRFT0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1189&quot; height=&quot;989&quot; data-origin-width=&quot;1189&quot; data-origin-height=&quot;989&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;학습 과정&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;[입력 데이터 (1D 시계열)]&lt;br /&gt;│&lt;br /&gt;├───&amp;gt; (복사 1) ──[Reshape: 96마다]──&amp;gt; [2D 텐서 A: 1 x 144] ──[Conv2D]──&amp;gt; 특징 A 추출&lt;br /&gt;│&lt;br /&gt;├───&amp;gt; (복사 2) ──[Reshape: 48마다]───&amp;gt; [2D 텐서 B: 2 x 72 ] ──[Conv2D]──&amp;gt; 특징 B 추출&lt;br /&gt;│&lt;br /&gt;└───&amp;gt; (복사 3) ──[Reshape: 12마다]───&amp;gt; [2D 텐서 C: 12 x 12] ──[Conv2D]──&amp;gt; 특징 C 추출&lt;br /&gt;│&lt;br /&gt;┌─────────────────────────────────────────────────────────────────────────┘&lt;br /&gt;│&lt;br /&gt;▼&lt;br /&gt;[결과 합산 (Weighted Sum)] -&amp;gt; 다시 1D로 펴서 합침&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;4. Questions&lt;/b&gt;&lt;/h2&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;비주기적(Non-periodic) 데이터 효과적인지?
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;TimesNet은 데이터에서 주기성을 추출하여 학습하는 모델 &amp;rarr; 주기성이 전혀 없는 데이터셋의 경우에는 어떤 결과&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;패딩(Padding) 전략 비교(현재는 제로패딩)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;다른 방식의 패딩(예: 복제 패딩, 평균값 패딩 등)을 사용 후, 결과 차이&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;다양한 비전백본 모델(현재는 inception v1 이용중) 확장
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;ConvNeXt, ResNet, Swin Transformer 등 다양한 모델 사용 후, 결과 차이&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>Paper review</category>
      <category>TimesNet</category>
      <category>tsf</category>
      <author>Hippo's data</author>
      <guid isPermaLink="true">https://hipposdata.tistory.com/158</guid>
      <comments>https://hipposdata.tistory.com/entry/Paper-review-TimesNet#entry158comment</comments>
      <pubDate>Tue, 10 Feb 2026 21:38:27 +0900</pubDate>
    </item>
    <item>
      <title>[Paper review] Pre-LN(Pre-Layer Normalization)</title>
      <link>https://hipposdata.tistory.com/entry/Paper-review-Pre-LNPre-Layer-Normalization</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;트랜스포머 구조&lt;/b&gt;에서 오늘날 거의 &lt;b&gt;표준&lt;/b&gt;으로 사용되는 &lt;b&gt;Pre-LN(Pre-Layer Normalization) 구조&lt;/b&gt;에 관한 논문을 리뷰해보도록 하겠습니다!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Paper:&lt;/b&gt; On Layer Normalization in the Transformer Architecture&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;(Ruibin Xiong, Yunchang Yang, Di He, Kai Zheng, Shuxin Zheng, Chen Xing, Huishuai Zhang, Yanyan Lan, Liwei Wang, Tie-Yan Liu)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Conference:&lt;/b&gt; ICML 2020&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;ArXiv:&lt;/b&gt; &lt;a href=&quot;https://arxiv.org/abs/2002.04745&quot;&gt;https://arxiv.org/abs/2002.04745&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1770566859636&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;On Layer Normalization in the Transformer Architecture&quot; data-og-description=&quot;The Transformer is widely used in natural language processing tasks. To train a Transformer however, one usually needs a carefully designed learning rate warm-up stage, which is shown to be crucial to the final performance but will slow down the optimizati&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2002.04745&quot; data-og-url=&quot;https://arxiv.org/abs/2002.04745v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/cIk3XP/dJMb9g46P3X/88dijQKPzJealb7ZkJu5mk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cchU2a/dJMb9cBDOqC/XmyiFuBQKPwTh7B0tiOXe0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2002.04745&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2002.04745&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/cIk3XP/dJMb9g46P3X/88dijQKPzJealb7ZkJu5mk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/cchU2a/dJMb9cBDOqC/XmyiFuBQKPwTh7B0tiOXe0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;On Layer Normalization in the Transformer Architecture&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;The Transformer is widely used in natural language processing tasks. To train a Transformer however, one usually needs a carefully designed learning rate warm-up stage, which is shown to be crucial to the final performance but will slow down the optimizati&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Pre-LN 최초 제안한 논문&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Adaptive Input Representations for Neural Language Modeling(Alexei Baevski &amp;amp; Michael Auli, Facebook AI Research))&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/1809.10853&quot;&gt;https://arxiv.org/abs/1809.10853&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1770566862146&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Adaptive Input Representations for Neural Language Modeling&quot; data-og-description=&quot;We introduce adaptive input representations for neural language modeling which extend the adaptive softmax of Grave et al. (2017) to input representations of variable capacity. There are several choices on how to factorize the input and output layers, and &quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/1809.10853&quot; data-og-url=&quot;https://arxiv.org/abs/1809.10853v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/IIjG6/dJMb9frA93o/8q3xIXgDXcz4hnGkTkmtLk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/t1DOQ/dJMb9jOiGey/n2xn7JhNGEp12Ubi7jpkl1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/1809.10853&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/1809.10853&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/IIjG6/dJMb9frA93o/8q3xIXgDXcz4hnGkTkmtLk/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/t1DOQ/dJMb9jOiGey/n2xn7JhNGEp12Ubi7jpkl1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Adaptive Input Representations for Neural Language Modeling&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We introduce adaptive input representations for neural language modeling which extend the adaptive softmax of Grave et al. (2017) to input representations of variable capacity. There are several choices on how to factorize the input and output layers, and&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ICLR 2019&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;On Layer Normalization in the Transformer Architecture&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;&amp;rarr; 기존 Post-LN의 한계점, 왜 Pre-LN이 좋은지 수학적으로 분석 (Post-LN VS Pre-LN)&lt;/b&gt;&lt;/span&gt;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;1. SUMMARIZE&lt;/b&gt;&lt;/h2&gt;
&lt;table id=&quot;2f6bd201-015f-8018-a5b6-c428b6214c6d&quot; style=&quot;border-collapse: collapse; width: 100%; height: 446px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style12&quot;&gt;
&lt;tbody&gt;
&lt;tr id=&quot;2f6bd201-015f-80aa-8bee-de8d8370dcdb&quot; style=&quot;height: 21px;&quot;&gt;
&lt;td id=&quot;T]qv&quot; style=&quot;width: 12.4418%; height: 21px;&quot;&gt;&lt;b&gt;항목&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;ZQ~i&quot; style=&quot;width: 87.5582%; height: 21px;&quot;&gt;&lt;b&gt;핵심 내용&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2f6bd201-015f-8034-bce2-ff3c9c1c1ed2&quot; style=&quot;height: 106px;&quot;&gt;
&lt;td id=&quot;T]qv&quot; style=&quot;width: 12.4418%; height: 106px;&quot;&gt;&lt;b&gt;Problem&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;ZQ~i&quot; style=&quot;width: 87.5582%; height: 106px;&quot;&gt;&lt;b&gt;Post-LN의 구조적 한계와 학습 비효율성&lt;/b&gt;&lt;br /&gt;&lt;b&gt;&amp;bull; Post-LN 구조&lt;/b&gt;:&lt;b&gt;&lt;b&gt;&lt;br /&gt;&lt;/b&gt;&lt;/b&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;268&quot; data-origin-height=&quot;43&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/6GO21/dJMcadnllXZ/D0GkFhFXCsjF9AuuKxJkC0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/6GO21/dJMcadnllXZ/D0GkFhFXCsjF9AuuKxJkC0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/6GO21/dJMcadnllXZ/D0GkFhFXCsjF9AuuKxJkC0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F6GO21%2FdJMcadnllXZ%2FD0GkFhFXCsjF9AuuKxJkC0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;187&quot; height=&quot;30&quot; data-origin-width=&quot;268&quot; data-origin-height=&quot;43&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;br /&gt;출력층에 가까울수록 &lt;b&gt;Gradient 크기가 커지는 경향&lt;/b&gt;이 있어 역전파 시 불안정함&lt;br /&gt;&amp;bull; &lt;b&gt;Warm-up 필수:&lt;/b&gt; 초기 Gradient 발산을 막기 위해 학습률을 0부터 천천히 올리는 Warm-up 단계가 강제됨 &amp;rarr; 학습 시간 지연, 하이퍼파라미터 튜닝을 어렵게 함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2f6bd201-015f-8065-aeae-dbe4ebe0a939&quot; style=&quot;height: 128px;&quot;&gt;
&lt;td id=&quot;T]qv&quot; style=&quot;width: 12.4418%; height: 128px;&quot;&gt;&lt;b&gt;Method&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;ZQ~i&quot; style=&quot;width: 87.5582%; height: 128px;&quot;&gt;&lt;b&gt;Pre-LN 제안, Gradient 이론 증명&lt;/b&gt;&lt;br /&gt;&amp;bull; &lt;b&gt;구조 변경:&lt;/b&gt; Layer Normalization(LN)을 잔차 연결(Residual Connection) 내부, 즉 Sub-layer(attention, FFN) 입력 전으로 이동&lt;br /&gt;&lt;b&gt;&amp;bull; 수식&lt;/b&gt;:&lt;b&gt;&lt;b&gt;&lt;br /&gt;&lt;/b&gt;&lt;/b&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;259&quot; data-origin-height=&quot;43&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/nwzxq/dJMcahXCGKM/J045aiFtaH17dTDKJrt5r1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/nwzxq/dJMcahXCGKM/J045aiFtaH17dTDKJrt5r1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/nwzxq/dJMcahXCGKM/J045aiFtaH17dTDKJrt5r1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fnwzxq%2FdJMcahXCGKM%2FJ045aiFtaH17dTDKJrt5r1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;193&quot; height=&quot;32&quot; data-origin-width=&quot;259&quot; data-origin-height=&quot;43&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;br /&gt;&amp;bull; &lt;b&gt;이론적 근거:&lt;/b&gt; 테일러 전개(Taylor Expansion)를 통해 분석한 결과, Pre-LN은 층이 깊어져도 Gradient Norm이 일정하게 유지되어 &lt;b&gt;Gradient Vanishing/Exploding 문제&lt;/b&gt;가 발생하지 않음을 수학적으로 증명&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2f6bd201-015f-805c-a6c8-f98c8a2b6951&quot; style=&quot;height: 106px;&quot;&gt;
&lt;td id=&quot;T]qv&quot; style=&quot;width: 12.4418%; height: 106px;&quot;&gt;&lt;b&gt;Results&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;ZQ~i&quot; style=&quot;width: 87.5582%; height: 106px;&quot;&gt;&lt;b&gt;학습 효율성 및 성능 최적화&lt;/b&gt;&lt;br /&gt;&amp;bull; &lt;b&gt;Warm-up 제거:&lt;/b&gt; Warm-up 단계 없이도 초기 학습이 안정적이며, 훨씬 높은 학습률(Learning Rate) 사용 가능&lt;br /&gt;&amp;bull; &lt;b&gt;수렴 속도:&lt;/b&gt; 기존 대비 더 적은 반복(Iteration) 횟수로 동일 성능에 도달 (시간 단축)&lt;br /&gt;&amp;bull; &lt;b&gt;성능 검증:&lt;/b&gt; 기계 번역(IWSLT, WMT), BERT 학습 태스크에서 Post-LN과 동등하거나 더 우수한 성능을 보이면서 학습 비용은 절감&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2f6bd201-015f-8010-a911-d63874520351&quot; style=&quot;height: 85px;&quot;&gt;
&lt;td id=&quot;T]qv&quot; style=&quot;width: 12.4418%; height: 85px;&quot;&gt;&lt;b&gt;Contribution&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;ZQ~i&quot; style=&quot;width: 87.5582%; height: 85px;&quot;&gt;&lt;b&gt;Deep Transformer 학습의 표준 정립 (Pre-LN )&lt;/b&gt;&lt;br /&gt;&amp;bull; 기존 Post-LN에서 Warm-up이 필요했던 이유를 이론적으로 규명하고 해결책 제시&lt;br /&gt;&amp;bull; 층을 매우 깊게 쌓아도 학습이 가능한 구조임을 입증하여, 이후 &lt;b&gt;GPT-3, PaLM, Llama 2/3&lt;/b&gt; 등 현대 초거대 언어 모델들이 Pre-LN 방식 채택&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;2. DETAIL&lt;/b&gt;&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;1. Introduction&lt;/b&gt;&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignLeft&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;517&quot; data-origin-height=&quot;626&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cE6JA6/dJMcafZMJb4/i0PsXELotaTpLG9IO3yV90/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cE6JA6/dJMcafZMJb4/i0PsXELotaTpLG9IO3yV90/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cE6JA6/dJMcafZMJb4/i0PsXELotaTpLG9IO3yV90/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcE6JA6%2FdJMcafZMJb4%2Fi0PsXELotaTpLG9IO3yV90%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;356&quot; height=&quot;431&quot; data-origin-width=&quot;517&quot; data-origin-height=&quot;626&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;addition = Residual Connection&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;(a) Post-LN(Layer Normalization) Transformer&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Layer Normalization가 &lt;b&gt;Residual Connection(addition) 뒤&lt;/b&gt;에 위치&lt;/li&gt;
&lt;li&gt;&lt;b&gt;문제점&lt;/b&gt;: 평균장 이론을 통해 출력 레이어 근처 파라미터의 초기화 시점 예상 기울기가 크다는 것을 증명 (큰 기울기는 학습 불안정하게 함)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;해결책&lt;/b&gt;: &lt;b&gt;학습률 웜업 단계&lt;/b&gt;(Learning Rate Warm-up Stage) 필요
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;모델 학습시, 학습률(learning rate)을 &lt;b&gt;작은 값에서 시작하여 점진적으로 증가&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;작은 학습률로 시작 &amp;rarr; 학습속도 늦어짐, 추가적인 하이퍼파라미터 튜닝 필요(Warm-up 정도, 최대 학습률 등)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;BERT, Original Transformer&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;(b) Pre-LN(Layer Normalization) Transformer 제안&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Layer Normalization가 &lt;b&gt;각 서브 레이어(Multi-Head Attention, FFN)의 입력 직전에 위치&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;학습률 웜업 단계(Learning Rate Warm-up Stage) 불필요&lt;/li&gt;
&lt;li&gt;학습 시간 / 수렴 속도와 하이퍼파라미터 튜닝 노력 감소&lt;/li&gt;
&lt;li&gt;GPT 시리즈, LLaMA, PaLM&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;2. Related work&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;CNN, RNN &amp;rarr; 초기 큰 학습률에서 점진적으로 감소&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;학습률 웜업 (Learning Rate Warm-up) &amp;rarr; 큰 배치(batch) 훈련 시나리오, Transformer 선호&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;학습률 웜업단계 없다면, 최적화 발산 (optimization diverges)&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;3. Optimization for the Transformer&lt;/b&gt;&lt;/h3&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;3.1. Transformer with Post-Layer Normalization&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 트랜스포머 구조&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignLeft&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;326&quot; data-origin-height=&quot;488&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/uNSsQ/dJMcacWh9FG/wWfmhKqsjrbPc91ZGYXQFK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/uNSsQ/dJMcacWh9FG/wWfmhKqsjrbPc91ZGYXQFK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/uNSsQ/dJMcacWh9FG/wWfmhKqsjrbPc91ZGYXQFK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FuNSsQ%2FdJMcacWh9FG%2FwWfmhKqsjrbPc91ZGYXQFK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;224&quot; height=&quot;335&quot; data-origin-width=&quot;326&quot; data-origin-height=&quot;488&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Self-attention sub-layer&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$Attention(Q, K, V) = \text{softmax}\left( \frac{QK^T}{\sqrt{d_k}} \right)V$&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;목적: 각 요소간 관련성 파악&lt;/li&gt;
&lt;li&gt;$Attention(Q, K, V)$
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;쿼리 (Query, Q): 다른 요소 탐색, 질의 주체&lt;/li&gt;
&lt;li&gt;키 (Key, K): 각 요소들의 식별자 정보&lt;/li&gt;
&lt;li&gt;값 (Value, V): 각 요소들의 실제 정보&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;$\text{softmax}\left( \frac{QK^T}{\sqrt{d_k}} \right)V$
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$\mathbf{QK^T}$ (= 유사도 계산): 현재 요소의 쿼리(Q)와 시퀀스 내 모든 요소들의 키(K)를 곱하여(내적) 요소들 간의 유사도 점수를 계산 (얼마나 서로 관련이 있는지)&lt;/li&gt;
&lt;li&gt;$/ \sqrt{d_k}$ (=스케일링): 계산된 점수들을 히든 표현의 차원 크기 ( $\sqrt{d_k}$)로 나누어, 점수들이 너무 커지거나 작아지지 않도록 안정화 (학습 안정성)&lt;/li&gt;
&lt;li&gt;$\mathbf{\text{softmax}(\dots)}$ (=가중치 변환): 스케일링된 점수들에 소프트맥스 함수를 적용하여, 각 요소에 대한 최종 가중치(확률 분포)로 변환 (가중치는 현재 요소가 다른 요소들에게 부여하는 중요도를 나타냄)&lt;/li&gt;
&lt;li&gt;$\mathbf{(\dots)V}$ (=결합): 계산된 가중치들을 시퀀스 내 모든 요소들의 값(V)에 곱하고 합산 &amp;rarr; 해당 요소는 관련성이 높은 다른 요소들의 정보를 효과적으로 결합하여 자신의 최종 표현을 업데이트함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;멀티 헤드 어텐션(Multi-head Attention)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 어텐션 메커니즘 병렬 처리&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$\text{Multi-head}(Q, K, V) = \text{Concat}(\text{head}_1, \dots, \text{head}_H)W^O$&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$\text{head}_k = \text{Attention}(QW^Q_k, KW^K_k, VW^V_k)$&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$WkQ,WkK,WkV$: k개의 각 헤드는 입력 쿼리(Q), 키(K), 값(V)에 대해 가중치 행렬(학습 가능) 가짐&lt;/li&gt;
&lt;li&gt;$\text{head}_k = \text{Attention}(QW^Q_k, KW^K_k, VW^V_k)$: 각 헤드는 각각 어텐션 계산 수행&lt;/li&gt;
&lt;li&gt;$\text{Concat}(\text{head}_1, \dots, \text{head}_H)$: 각 헤드 출력을 결합&lt;/li&gt;
&lt;li&gt;$W^O$: 최종 선형변환 적용(각 헤드 정보들이 융합)&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Position-wise FFN sub-layer&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$FFN(h_i​)=ReLU(h_i​W^1+b_1)W^2+b^2$&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;목적&lt;/b&gt;: Attention 레이어 출력을 변환하여 각 위치의 벡터 표현에 추가적인 비선형성 제공
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$h_i$: i번째 벡터(토큰)&lt;/li&gt;
&lt;li&gt;선형 변환 -&amp;gt; ReLU 활성화 -&amp;gt; 선형 변환&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Residual connection and layer normalization&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Residual Connection
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;목적: 기울기 소실(vanishing gradient) 문제 완화 &amp;rarr; 깊은 층에도 효율적 학습&lt;/li&gt;
&lt;li&gt;x+F(x)&lt;/li&gt;
&lt;li&gt;sub-layer 입력(x)을 sub-layer 출력(F(x))에 직접 더함&lt;/li&gt;
&lt;li&gt;잔차(residual) 변화를 학습하도록 함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Layer Normalization (LN)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;목적: 학습 과정에서 신경망의 활성화 값을 안정화하여 더 큰 학습률을 사용할 수 있게 함, 모델의 수렴 속도, 성능 향상&lt;/li&gt;
&lt;li&gt;LayerNorm(v)=$\gamma \frac{v - \mu}{\sigma} + \beta$
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;평균 $\mu = \frac{1}{d} \sum_{k=1}^{d} v_k$&lt;/li&gt;
&lt;li&gt;표준편차 $\sigma = \sqrt{\frac{1}{d} \sum_{k=1}^{d} (v_k - \mu)^2}$&lt;/li&gt;
&lt;li&gt;$&amp;gamma;, &amp;beta;$: 학습 가능한(learnable) 파라미터&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Post-LN Transformer&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Post-LN: LN이 각 서브 레이어(self-attention, FFN)의 출력과 잔여 연결이 합쳐진 &lt;b&gt;후에&lt;/b&gt; 적용
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;(기존 트랜스포머)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Pre-LN: LN이 각 서브 레이어의 &lt;b&gt;입력 전&lt;/b&gt;에 먼저 적용, 추가적인 최종 LN이 예측 전에 적용&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1071&quot; data-origin-height=&quot;283&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b32EgF/dJMcahJ6CJL/NKiMEPTOV8E0pOfSKJFNEk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b32EgF/dJMcahJ6CJL/NKiMEPTOV8E0pOfSKJFNEk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b32EgF/dJMcahJ6CJL/NKiMEPTOV8E0pOfSKJFNEk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb32EgF%2FdJMcahJ6CJL%2FNKiMEPTOV8E0pOfSKJFNEk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;803&quot; height=&quot;212&quot; data-origin-width=&quot;1071&quot; data-origin-height=&quot;283&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;3.2. The learning rate warm-up stage&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;다른 아키텍처들&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;큰 학습률(learning-rate)에서 점점 감소&lt;/li&gt;
&lt;li&gt;learning rate warm-up stage&lt;/li&gt;
&lt;li&gt;작은 학습률로 시작하며 점점 커짐&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignLeft&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;439&quot; data-origin-height=&quot;61&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b2BO11/dJMcadgBNvI/5lIWJOGlSJoCM7v2YWvFXK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b2BO11/dJMcadgBNvI/5lIWJOGlSJoCM7v2YWvFXK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b2BO11/dJMcadgBNvI/5lIWJOGlSJoCM7v2YWvFXK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb2BO11%2FdJMcadgBNvI%2F5lIWJOGlSJoCM7v2YWvFXK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;374&quot; height=&quot;52&quot; data-origin-width=&quot;439&quot; data-origin-height=&quot;61&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$lr(t)$: t번째 반복(iteration) 에서의 학습률&lt;/li&gt;
&lt;li&gt;t: 현재 훈련 반복 횟수&lt;/li&gt;
&lt;li&gt;$T_{warmup}$: 웜업 반복의 총 횟수&lt;/li&gt;
&lt;li&gt;$lr_{max}$: 웜업 단계가 끝날 때 도달하는 최대 학습률&lt;/li&gt;
&lt;li&gt;웜업 단계 이후 &amp;rarr; 일반적인 학습률 스케쥴러 적용(선형, 역제곱근 감소 등)&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1071&quot; data-origin-height=&quot;309&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b7mstn/dJMcadAQQvU/8HggMAnjyh9Ph4c2Qmnurk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b7mstn/dJMcadAQQvU/8HggMAnjyh9Ph4c2Qmnurk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b7mstn/dJMcadAQQvU/8HggMAnjyh9Ph4c2Qmnurk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb7mstn%2FdJMcadAQQvU%2F8HggMAnjyh9Ph4c2Qmnurk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;714&quot; height=&quot;206&quot; data-origin-width=&quot;1071&quot; data-origin-height=&quot;309&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Experimental setting&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;목적
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;학습률 웜업 단계&lt;/b&gt;가 Post-LN 트랜스포머 훈련에 &lt;b&gt;필수적인지&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;최종 &lt;b&gt;모델 성능이&lt;/b&gt; 웜업 기간(&lt;b&gt;Twarmup&lt;/b&gt;) 값에 얼마나 &lt;b&gt;민감한지&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;실험 세팅
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;평가 지표: 검증 손실(Validation Loss), BLEU score&lt;/li&gt;
&lt;li&gt;모델: Post-LN Transformer&lt;/li&gt;
&lt;li&gt;훈련 중, 매 에폭마다 loss, BLEU 스코어 기록&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%; height: 359px;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr style=&quot;height: 359px;&quot;&gt;
&lt;td style=&quot;width: 100%; height: 359px;&quot;&gt;  &lt;span&gt;&lt;b&gt;BLEU Score&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;(Bilingual Evaluation Understudy Score)&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&amp;rarr;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;기계 번역(Machine Translation) 성능평가지표&lt;/b&gt;&lt;br /&gt;&amp;rarr; 기계가 번역한 문장이 사람이 번역한 정답(Reference)과 얼마나 비슷한가?&lt;/span&gt;&lt;br /&gt;&lt;span&gt;$\text{BLEU} = \text{BP} \times \exp\left( \sum_{n=1}^{N} w_n \log p_n \right)$&lt;/span&gt;&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc; color: #333333; text-align: start;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;$\text{BP}$ (Brevity Penalty):&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;길이 페널티($&lt;i&gt;c$: 예측 문장 길이, $r$: 정답 문장 길이&lt;/i&gt;)&lt;/li&gt;
&lt;li&gt;$\text{BP} =&lt;br /&gt;\begin{cases}&lt;br /&gt;1 &amp;amp; \text{if } c &amp;gt; r \&lt;br /&gt;e^{(1 - r/c)} &amp;amp; \text{if } c \le r&lt;br /&gt;\end{cases}$&lt;/li&gt;
&lt;li&gt;&lt;b&gt;$w_n$:&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;각 $n$-gram의 가중치 (보통 모두 1/4로 동일하게 설정)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;$p_n$:&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;$n$-gram 정밀도 (보통 $N=4$까지 사용)&lt;/li&gt;
&lt;li&gt;= 예측문장, 정답문장간 일치하는 n-gram 수 / 예측 문장 총 n-gram 수&lt;/li&gt;
&lt;/ul&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Results and discussions&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;학습률 웜업 단계&lt;/b&gt;가 Post-LN 트랜스포머 훈련에 &lt;b&gt;필수적&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;웜업 없음(w/o warm-up) 모델 성능 저조&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Post-LN 트랜스포머의 최종 모델 성능은 Twarmup 파라미터(&lt;b&gt;웜업 기간&lt;/b&gt;) 에 &lt;b&gt;매우 민감&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Twarmup 4000 &amp;rarr; 500 (lrmax = $1e^{-3}$) 성능 크게 저하&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;웜업이 Adam과 SGD 모두에 도움 &amp;rarr; &lt;b&gt;특정 옵티마이저에 국한된 것이 아닌&lt;/b&gt;, &lt;b&gt;Post-LN 트랜스포머 자체의 불안정성&lt;/b&gt; 문제 시사&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;3.3. Understanding the Transformer at initialization&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; LN 위치의 차이가 초기화 시점의 기울기에 어떻게 영향을 미치는지를 분석&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Post-LN Transformer VS Pre-LN Transformer&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;서브 레이어(sublayer): Attention, FFN&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Post-LN&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;LN이 잔여 블록 바깥에 위치&lt;/li&gt;
&lt;li&gt;즉, 서브 레이어의 출력과 입력에 잔여 연결이 적용된 후 LN이 적용&lt;/li&gt;
&lt;li&gt;$x_{l+1, i}^{\text{post}} = \text{LayerNorm}\Big( x_{l, i}^{\text{post}} + \text{SubLayer}(x_{l, i}^{\text{post}}) \Big)$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Pre-LN&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;LN이 잔여 블록 내부에 위치&lt;/li&gt;
&lt;li&gt;비선형 변환 전에 적용, 예측 직전에 최종 계층 정규화가 추가&lt;/li&gt;
&lt;li&gt;$x_{l+1, i}^{\text{pre}} = x_{l, i}^{\text{pre}} + \text{SubLayer}\Big( \text{LayerNorm}(x_{l, i}^{\text{pre}}) \Big)$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;요약&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;이론적 분석을 위한 단순화:&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;단일 헤드 어텐션:&lt;/b&gt; 복잡한 Multi-head 대신 Single-head 어텐션 가정&lt;/li&gt;
&lt;li&gt;&lt;b&gt;특정 가중치 초기화&lt;/b&gt;: Self-attention 서브 레이어의 가중치 행렬($W^Q, W^K$)을 0 행렬로 초기화&lt;/li&gt;
&lt;li&gt;&lt;b&gt;가우시안 입력&lt;/b&gt;: 입력 벡터 또한 동일한 가우시안 분포에서 샘플링 가정&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;초기화(initialization) 정의&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 학습 시작 전, 각 신경망 가중치(Weight) 파라미터에 최초 값을 부여하는 것&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 표준적인 초기화 값(무작위)을 썼을 때, 구조(LN, Layer Norm 위치)가 &lt;b&gt;그래디언트 크기&lt;/b&gt;에 어떤 영향을 미치는가&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Post-LN (기존):&lt;/b&gt; 초기화된 가중치 값들이 Layer Norm을 통과하면서, 역전파될 때 그래디언트가 &lt;b&gt;사라지지 않고 유지되거나 커짐 &amp;rarr;&lt;/b&gt;학습률이 높으면 발산함&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Pre-LN (제안):&lt;/b&gt; 초기화된 가중치 값들이 층을 지날수록 커지는데(Norm 증가), Layer Norm이 이를 역으로 눌러주는 역할(Scaling Down)을 함 &amp;rarr; &lt;b&gt;그래디언트가 안정됨&lt;/b&gt;&amp;rarr; 학습률이 높아도 수렴함&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;파라미터 초기화 설정 (Parameter Initialization)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;일반적으로 Transformer 계층의 파라미터 행렬은 일반적으로 &lt;b&gt;Xavier Initialization&lt;/b&gt;을 사용&lt;br /&gt;행렬이 Xavier 초기화됨&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;분포:&lt;/b&gt; $W \sim N(0, \frac{2}{n_{in}+n_{out}})$&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 100%;&quot;&gt; &lt;span&gt;&lt;b&gt;Xavier Initialization&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&lt;b&gt;Paper&lt;/b&gt;:&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;Understanding the difficulty of training deep feedforward neural networks (Glorot &amp;amp; Bengio, NIPS 2010)&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&lt;b&gt;문제점&lt;/b&gt;: 모델 학습시, 초기 가중치 설정 중요&lt;/span&gt;&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;가중치 너무&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;작게 시작&lt;/b&gt;: 기울기 소실&lt;/li&gt;
&lt;li&gt;가중치 너무&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;크게 시작&lt;/b&gt;: 기울기 폭주&lt;/li&gt;
&lt;/ul&gt;
&lt;span&gt;&lt;b&gt;&amp;rarr; 가중치를 적절한 크기로 설정하는 방법&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&lt;b&gt;&amp;rarr;&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;각 레이어마다&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;입력 및 출력 뉴런 수($n_{in}$, $n_{out}$)를 고려&lt;/b&gt;하여 해당 레이어의&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;초기 가중치를 어느 정도로 설정&lt;/b&gt;할지 결정&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&lt;b&gt;방법&lt;/b&gt;: 각 레이어를 통과하는 활성화 값의 분산(variance)이 일정하게 유지 (입/출력의 분산이 같게)&lt;/span&gt;&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;정규 분포&lt;/b&gt;: 평균 0, 표준편차 $\sqrt{\frac{2}{n_{in} + n_{out}}}$ 에서 가중치 샘플링&lt;/li&gt;
&lt;li&gt;&lt;b&gt;균등 분포:&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;범위 $[-\sqrt{\frac{6}{n_{in} + n_{out}}}, \sqrt{\frac{6}{n_{in} + n_{out}}}]$ 에서 가중치 샘플링&lt;/li&gt;
&lt;/ul&gt;
&lt;span&gt;&lt;b&gt;활성화 함수에 따른 Initialization 종류:&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Xavier&lt;/b&gt;: sigmoid, tanh&lt;/li&gt;
&lt;li&gt;&lt;b&gt;He&lt;/b&gt;: ReLU, Leaky ReLU, ELU 등 ReLU 계열&lt;/li&gt;
&lt;/ul&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;color: #333333; text-align: start;&quot;&gt;&lt;b&gt;분석 방법: 평균장 이론 (Mean Field Theory)&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;&lt;span style=&quot;color: #333333; text-align: start;&quot;&gt;전체 뉴런에 대해 계산할 수 없음 &amp;rarr; 평균장 이론을 사용하여 전체 뉴런의 통계값을 기반으로&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;근사&lt;/b&gt;하여 초기 학습이 잘 되는지 확인&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 100%;&quot;&gt; &lt;span&gt;&lt;b&gt;평균장 이론(Mean Field Theory, MFT)&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&amp;rarr; 물리학(통계역학)에서 시작 - 복잡하게 얽힌 수많은 입자들의 상호작용을&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;단순화&lt;/b&gt;하여&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;평균적인 하나의 장(Field)&lt;/b&gt;으로&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;근사&lt;/b&gt;하는 방법&lt;br /&gt;&lt;b&gt;&amp;rarr; 거대한 신경망의 학습을 수학적으로 파악하기 위해 이용&lt;/b&gt;&lt;/span&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;aside&gt;&lt;/aside&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Theoretical Findings - Gradients at Initialization&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;보조정리(Lemma 1,2,3)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 구체적인 증명은 논문 Appendix&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Lemma 1: ReLU 통과 이후 크기(Norm) 변화&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;활성화 함수 ReLU가 입력 데이터의 크기에 미치는 영향을 수학적으로 정의&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 가우시안 분포 $N(0, \sigma^2 I_d)$를 따르는 입력 벡터 X가 ReLU를 통과하면, 그 크기(Norm)의 &lt;b&gt;기댓값은 절반이 됨&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$\mathbb{E}(|ReLU(X)|_2^2) = \frac{1}{2}\sigma^2 d$&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 크기 $d \times \sigma^2$ &amp;rarr; $\frac{1}{2} d \sigma^2$&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Lemma 2 : Forward Pass에서의 Hidden State 크기(Norm) 변화&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 초기화(Initialization) 상태에서 데이터가 레이어를 통과할 때, &lt;b&gt;Hidden State 벡터의 크기(Norm)&lt;/b&gt;가 어떻게 변하는지&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Post-LN (기존)&lt;/li&gt;
&lt;li&gt;$\mathbb{E}(|x_{l,i}^{post,5}|_2^2) = \frac{3}{2}d$&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; Residual Block을 거친 후 매번 Layer Norm(LN)으로 정규화&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; LN이 매번 크기를 잡아주기 때문에 층의 깊이($l$) 상관없이 기댓값이 &lt;b&gt;일정하게 유지&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Pre-LN (제안)&lt;/li&gt;
&lt;li&gt;$(1 + \frac{l}{2})d \le \mathbb{E}(|x_{l,i}^{pre}|_2^2) \le (1 + \frac{3l}{2})d$&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; LN이 Residual Path 내부에 있어 값이 계속 누적&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 층이 깊어질수록 값이 &lt;b&gt;선형적으로 증가&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Lemma 3 : Backward Pass에서의 기울기 스케일링 효과&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; Layer Norm의 미분값(Jacobian)은 &lt;b&gt;입력 벡터의 크기에 반비례&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$|J_{LN}(x)|_2 = \mathcal{O}\left(\frac{\sqrt{d}}{|x|_2}\right)$&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉, 입력 x가 클수록, 역전파되는 그래디언트는 작아짐&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;결론 - Theorem 1: 왜 Pre-LN은 Warm-up이 필요 없는가?&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 마지막 레이어($L$)의 그래디언트 확인 (다른 레이어는 논문 Appendix 참고)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;연쇄법칙(Chain Rule) 이용&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$\frac{\partial \mathcal{L}}{\partial W} = \underbrace{\frac{\partial \mathcal{L}}{\partial y}}&lt;i&gt;{\text{(1) Loss Grad}} \times \underbrace{\frac{\partial y}{\partial x}}&lt;/i&gt;{\text{(2) LN Jacobian } (J_{LN})} \times \underbrace{\frac{\partial x}{\partial W}}_{\text{(3) Input Grad}}$&lt;/p&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;b&gt;Post-LN&lt;/b&gt;: 입력 크기가 상수이므로 그래디언트가 &lt;b&gt;줄어들지 않고 크게 유지&lt;/b&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$|\frac{\partial \mathcal{L}}{\partial W^{2,L}}|_F \le \mathcal{O}(d\sqrt{\ln d})$ (매우 큼)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉,&amp;nbsp;초기&amp;nbsp;그래디언트&amp;nbsp;폭주를&amp;nbsp;막기&amp;nbsp;위해&amp;nbsp;아주&amp;nbsp;작은&amp;nbsp;학습률로&amp;nbsp;시작하는&amp;nbsp;**Warm-up이&amp;nbsp;필수**&lt;/p&gt;
&lt;aside&gt;&lt;/aside&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 100%;&quot;&gt; &lt;span&gt;&lt;b&gt;Step A. Lemma 2 대입&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;$|x^{post}|_2 \approx \sqrt{\frac{3}{2}d} \approx \mathcal{O}(\sqrt{d})$&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&lt;b&gt;Step B. Lemma 3 대입&lt;/b&gt;&lt;br /&gt;$|J_{LN}|_2 \approx \frac{\sqrt{d}}{|x^{post}|_2} \approx \frac{\sqrt{d}}{\sqrt{d}} \approx \mathbf{\mathcal{O}(1)}$&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&lt;b&gt;Step C. 최종 계산&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;$\left|\frac{\partial \mathcal{L}}{\partial W}\right|F \approx \underbrace{\mathcal{O}(1)}_{\text{Jacobian}} \times \mathcal{O}(d\sqrt{\ln d}) = \mathbf{\mathcal{O}(d\sqrt{\ln d})}$&lt;/span&gt;&lt;br /&gt;
&lt;ul style=&quot;list-style-type: disc; color: #333333; text-align: start;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$\mathcal{O}(d\sqrt{\ln d})$
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;표준 정규 분포 $N(0, 1)$에서 어떤 값 X가 특정 임계치 a보다 클 확률&lt;br /&gt;$P(|X| \ge a) \le \exp\left(-\frac{a^2}{2}\right)$ &amp;rarr; 평균에서 멀어질수록 지수적으로 작아짐&lt;/li&gt;
&lt;li&gt;$d \times \exp\left(-\frac{a^2}{2}\right) \le \delta$&lt;/li&gt;
&lt;li&gt;$\exp\left(-\frac{a^2}{2}\right) \le \frac{\delta}{d}$&lt;/li&gt;
&lt;li&gt;$-\frac{a^2}{2} \le \ln \delta - \ln d$&lt;/li&gt;
&lt;li&gt;$a^2 \ge 2(\ln d - \ln \delta)$&lt;/li&gt;
&lt;li&gt;$a \approx \sqrt{2 \ln d}$&lt;/li&gt;
&lt;li&gt;$a$는 대략&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;$\sqrt{2 \ln d}$ &amp;rarr; $d$&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;차원으로 확장&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;b&gt;&amp;rarr;&lt;/b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;$\mathcal{O}(d\sqrt{\ln d})$&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;aside&gt;&lt;/aside&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;b&gt;Pre-LN&lt;/b&gt;: 입력 크기가 깊이($L$)에 &lt;b&gt;비례해 커지므로&lt;/b&gt;, LN이 그래디언트를 억제&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$|\frac{\partial \mathcal{L}}{\partial W^{2,L}}|_F \le \mathcal{O}(d\sqrt{\frac{\ln d}{L}})$ (층이 깊을수록 안정됨)&lt;/p&gt;
&lt;aside&gt;&lt;/aside&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉,&amp;nbsp;&amp;nbsp;그래디언트가&amp;nbsp;자동으로&amp;nbsp;관리되므로&amp;nbsp;**Warm-up&amp;nbsp;없이**&amp;nbsp;바로&amp;nbsp;높은&amp;nbsp;학습률로&amp;nbsp;**빠르게&amp;nbsp;학습&amp;nbsp;가능**&lt;/p&gt;
&lt;table style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 100%;&quot;&gt; &lt;span&gt;&lt;b&gt;Step A. Lemma 2 대입&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;$|x^{pre}|_2 \approx \mathcal{O}(\sqrt{Ld})$&lt;br /&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&lt;b&gt;Step B. Lemma 3 대입&lt;/b&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;$|J_{LN}|_2 \approx \frac{\sqrt{d}}{|x^{pre}|_2} \approx \frac{\sqrt{d}}{\sqrt{Ld}} = \mathbf{\frac{1}{\sqrt{L}}}$&lt;br /&gt;&lt;/span&gt;&lt;br /&gt;&lt;span&gt;&lt;b&gt;Step C. 최종 계산&lt;/b&gt;&lt;/span&gt;&lt;span&gt;&lt;span&gt;&lt;br /&gt;&lt;br /&gt;&lt;/span&gt;&lt;/span&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;531&quot; data-origin-height=&quot;100&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bfWfZR/dJMcagqRPdi/0fNiL29OQxcBk0rgT1qugk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bfWfZR/dJMcagqRPdi/0fNiL29OQxcBk0rgT1qugk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bfWfZR/dJMcagqRPdi/0fNiL29OQxcBk0rgT1qugk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbfWfZR%2FdJMcagqRPdi%2F0fNiL29OQxcBk0rgT1qugk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;329&quot; height=&quot;62&quot; data-origin-width=&quot;531&quot; data-origin-height=&quot;100&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;span&gt;&lt;br /&gt;&lt;br /&gt;&lt;/span&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;aside&gt;&lt;/aside&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;3.4. Empirical verification of the theory and discussion&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉, 제시된 이론적 통찰이 실제 Transformer 훈련 시나리오와 일관됨&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; Pre-LN Transformer는 초기화 시 기울기가 잘 제어되므로 warm-up 단계 없이도 더 안정적인 훈련 가능&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;4. Experiments&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; Pre-LN Transformer가 학습률 웜업 단계 없이도 &lt;b&gt;안정적으로 훈련&lt;/b&gt;될 수 있고 &lt;b&gt;더 빠른 수렴 속도&lt;/b&gt;를 보이는지 확인&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4.1. Experiment Settings&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Machine Translation&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;작업
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;IWSLT14 German-to-English(독일어 &amp;rarr; 영어 번역)&lt;/li&gt;
&lt;li&gt;WMT14 English-to-German(영어 &amp;rarr; 독일어 번역)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;비교군
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Post-LN Transformer 학습 &amp;rarr; Learning Rate Warm-up Stage 포함 유/무&lt;/li&gt;
&lt;li&gt;Pre-LN Transformer 학습 &amp;rarr; Learning Rate Warm-up Stage 제거&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Unsupervised Pre-training (BERT)&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;작업
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;BERT 모델 사전학습&lt;/li&gt;
&lt;li&gt;BERT 모델&amp;rarr; MRPC(Microsoft Research Paraphrase Corpus) 데이터셋에 미세 조정&lt;/li&gt;
&lt;li&gt;BERT 모델&amp;rarr; RTE(Recognizing Textual Entailment) 데이터셋에 미세 조정&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;비교군
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Post-LN Transformer 학습 &amp;rarr; Learning Rate Warm-up Stage 포함&lt;/li&gt;
&lt;li&gt;Pre-LN Transformer 학습 &amp;rarr; Learning Rate Warm-up Stage 제거&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4.2. Experiment Results&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Machine Translation&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;1071&quot; data-origin-height=&quot;215&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/OqCB2/dJMcabiOXna/GHfVFGykdTcTCEHXy37k3K/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/OqCB2/dJMcabiOXna/GHfVFGykdTcTCEHXy37k3K/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/OqCB2/dJMcabiOXna/GHfVFGykdTcTCEHXy37k3K/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FOqCB2%2FdJMcabiOXna%2FGHfVFGykdTcTCEHXy37k3K%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;1071&quot; height=&quot;215&quot; data-origin-width=&quot;1071&quot; data-origin-height=&quot;215&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; Post-LN(웜없 O) vs Post-LN(웜업 X) vs Pre-LN(웜업X)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Post-LN(웜업 X) vs Pre-LN(웜업X)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Pre-LN(웜업 X)은 Post-LN(웜업 X)보다 압도적으로 &lt;b&gt;우수한 성능&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Post-LN(웜업 O) vs Pre-LN(웜업X)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Pre-LN(웜업 X)이 Post-LN(웜업 O)와 비슷한 최종 성능을 달성하면서도 &lt;b&gt;훨씬 빠른 수렴 속도&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;즉, 웜업 없는 Pre-LN 이 Post-LN 웜업 있든 없든 더 빠른 수렴&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Unsupervised Preㄴ-training (BERT)&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;811&quot; data-origin-height=&quot;289&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/m6mdk/dJMcabQCCAq/J5ddzsjKzyJ8t3Zh9Egxg1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/m6mdk/dJMcabQCCAq/J5ddzsjKzyJ8t3Zh9Egxg1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/m6mdk/dJMcabQCCAq/J5ddzsjKzyJ8t3Zh9Egxg1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fm6mdk%2FdJMcabQCCAq%2FJ5ddzsjKzyJ8t3Zh9Egxg1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;631&quot; height=&quot;225&quot; data-origin-width=&quot;811&quot; data-origin-height=&quot;289&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 세가지 task 조건 (a,b,c) 에서 더 빠르고 낮은 손실 / 더 높은 정확도 달성&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;3. Discussion&lt;/b&gt;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Peri-LN (Peripheral Layer Normalization)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Paper: &lt;b&gt;Peri-LN: Revisiting Normalization Layer in the Transformer Architecture&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;김정훈(Jeonghoon Kim, NAVER Cloud/KAIST), 이병찬(Byeongchan Lee, KAIST), 박천복(Cheonbok Park, NAVER Cloud)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.02732&quot;&gt;https://arxiv.org/abs/2502.02732&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1770566853429&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Peri-LN: Revisiting Normalization Layer in the Transformer Architecture&quot; data-og-description=&quot;Selecting a layer normalization (LN) strategy that stabilizes training and speeds convergence in Transformers remains difficult, even for today's large language models (LLM). We present a comprehensive analytical foundation for understanding how different &quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2502.02732&quot; data-og-url=&quot;https://arxiv.org/abs/2502.02732v3&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/bDT0SG/dJMb9jOiGeu/kZ4rfVoKd0BZtBcWxDndO1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/kYEN3/dJMb9frA93n/IRXpe365THkq7ai7cSDjW1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2502.02732&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2502.02732&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/bDT0SG/dJMb9jOiGeu/kZ4rfVoKd0BZtBcWxDndO1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/kYEN3/dJMb9frA93n/IRXpe365THkq7ai7cSDjW1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Peri-LN: Revisiting Normalization Layer in the Transformer Architecture&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Selecting a layer normalization (LN) strategy that stabilizes training and speeds convergence in Transformers remains difficult, even for today's large language models (LLM). We present a comprehensive analytical foundation for understanding how different&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;(ICML 2025)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;reference&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://clova.ai/tech-blog/%ED%9D%94%EB%93%A4%EB%A6%BC-%EC%97%86%EB%8A%94-%EC%95%88%EC%A0%95%EC%84%B1-peri-ln%EC%9C%BC%EB%A1%9C-%ED%95%99%EC%8A%B5-%EB%B0%9C%EC%82%B0%EC%9D%84-%EB%A7%89%EB%8B%A4&quot;&gt;https://clova.ai/tech-blog/흔들림-없는-안정성-peri-ln으로-학습-발산을-막다&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1770566848812&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;CLOVA&quot; data-og-description=&quot;하이퍼스케일 AI로 플랫폼 경쟁력을 강화하고 비즈니스 시너지를 확장합니다.&quot; data-og-host=&quot;clova.ai&quot; data-og-source-url=&quot;https://clova.ai/tech-blog/%ED%9D%94%EB%93%A4%EB%A6%BC-%EC%97%86%EB%8A%94-%EC%95%88%EC%A0%95%EC%84%B1-peri-ln%EC%9C%BC%EB%A1%9C-%ED%95%99%EC%8A%B5-%EB%B0%9C%EC%82%B0%EC%9D%84-%EB%A7%89%EB%8B%A4&quot; data-og-url=&quot;https://clova.ai/tech-blog/%ED%9D%94%EB%93%A4%EB%A6%BC-%EC%97%86%EB%8A%94-%EC%95%88%EC%A0%95%EC%84%B1-peri-ln%EC%9C%BC%EB%A1%9C-%ED%95%99%EC%8A%B5-%EB%B0%9C%EC%82%B0%EC%9D%84-%EB%A7%89%EB%8B%A4&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/QI7Am/dJMb84p4qT4/UBOkaAGdwHanSVFaku33x1/img.jpg?width=1200&amp;amp;height=630&amp;amp;face=0_0_1200_630,https://scrap.kakaocdn.net/dn/uvER2/dJMb8864ATk/Cxe27B1qpMEiyoE5XNjJI1/img.png?width=1280&amp;amp;height=800&amp;amp;face=0_0_1280_800,https://scrap.kakaocdn.net/dn/nylnY/dJMb84XUr8M/0WzHe9UpVdPiQaKxZXXJ21/img.jpg?width=1200&amp;amp;height=630&amp;amp;face=0_0_1200_630&quot;&gt;&lt;a href=&quot;https://clova.ai/tech-blog/%ED%9D%94%EB%93%A4%EB%A6%BC-%EC%97%86%EB%8A%94-%EC%95%88%EC%A0%95%EC%84%B1-peri-ln%EC%9C%BC%EB%A1%9C-%ED%95%99%EC%8A%B5-%EB%B0%9C%EC%82%B0%EC%9D%84-%EB%A7%89%EB%8B%A4&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://clova.ai/tech-blog/%ED%9D%94%EB%93%A4%EB%A6%BC-%EC%97%86%EB%8A%94-%EC%95%88%EC%A0%95%EC%84%B1-peri-ln%EC%9C%BC%EB%A1%9C-%ED%95%99%EC%8A%B5-%EB%B0%9C%EC%82%B0%EC%9D%84-%EB%A7%89%EB%8B%A4&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/QI7Am/dJMb84p4qT4/UBOkaAGdwHanSVFaku33x1/img.jpg?width=1200&amp;amp;height=630&amp;amp;face=0_0_1200_630,https://scrap.kakaocdn.net/dn/uvER2/dJMb8864ATk/Cxe27B1qpMEiyoE5XNjJI1/img.png?width=1280&amp;amp;height=800&amp;amp;face=0_0_1280_800,https://scrap.kakaocdn.net/dn/nylnY/dJMb84XUr8M/0WzHe9UpVdPiQaKxZXXJ21/img.jpg?width=1200&amp;amp;height=630&amp;amp;face=0_0_1200_630');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;CLOVA&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;하이퍼스케일 AI로 플랫폼 경쟁력을 강화하고 비즈니스 시너지를 확장합니다.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;clova.ai&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Post-LN (기존 Transformer):&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;장점: &lt;b&gt;깊은 모델에서 성능 유지&lt;/b&gt; (LN층이 뒤에 있으므로, 깊어져도 신호 크기가 일정하게 관리됨 = 성능 쥐어짜기)&lt;/li&gt;
&lt;li&gt;단점: 학습 초기단계 학습률 웜업(Warm-up) 같은 조절이 필수적&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Pre-LN:&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;장점: 학습 초기에도 웜업(Warm-up) 과정 없이도 &lt;b&gt;안정적으로 학습&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;단점: 층이 깊어질수록 출력값의 분산이 커져(선형 증가) 일부 성능 저하가 발생할 수 있음&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 기존 방식들이 정규화 층(Layer Norm, LN)을 모듈의 앞(Pre)이나 뒤(Post) 중 한 곳에만 두는 것과 달리, &lt;b&gt;Peri-LN은 서브 레이어(Attention, MLP)의 앞과 뒤 모두에 정규화를 적용&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Peri-LN &amp;rarr;&lt;/b&gt; 두 방식의 장점을 합친 효과 (&lt;b&gt;웜업 없는 안정적인 학습&lt;/b&gt; + &lt;b&gt;깊은 모델에서의 성능 유지&lt;/b&gt; 동시에 달성)&lt;/p&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;RevIN (Reversible Instance Normalization) vs Pre-LN (Layer Norm)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;RevIN&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;데이터 분포 안정화&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;모델 외부&lt;/b&gt; (입력층 직후 &amp;amp; 출력층 직전)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;학습 안정화&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;모델 내부&lt;/b&gt; (각 Sub-layer 입력 전) &lt;b&gt;Pre-LN&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>Paper review</category>
      <category>Pre-Layer Normalization</category>
      <category>pre-ln</category>
      <author>Hippo's data</author>
      <guid isPermaLink="true">https://hipposdata.tistory.com/157</guid>
      <comments>https://hipposdata.tistory.com/entry/Paper-review-Pre-LNPre-Layer-Normalization#entry157comment</comments>
      <pubDate>Mon, 9 Feb 2026 01:17:48 +0900</pubDate>
    </item>
    <item>
      <title>[Paper review] iTransformer</title>
      <link>https://hipposdata.tistory.com/entry/Paper-review-iTransformer</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;span style=&quot;background-color: #ffffff; color: #333333; text-align: start;&quot;&gt;오늘은&lt;b&gt;&lt;span&gt; iTransformer &lt;/span&gt;&lt;/b&gt;&lt;/span&gt;&lt;span style=&quot;background-color: #ffffff; color: #333333; text-align: start;&quot;&gt;모델이 제안된 논문을 리뷰해보도록&lt;span&gt; &lt;span style=&quot;background-color: #ffffff; color: #333333; text-align: start;&quot;&gt;하겠습니다!&lt;/span&gt; &lt;/span&gt;&lt;/span&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;기존 시계열 예측(TSF)&lt;b&gt; Transformer 기반 모델&lt;/b&gt;의 대다수 방식이었던 기존 시간축 단위 토큰화에서 &lt;b&gt;변수축 단위&lt;/b&gt;로 &lt;b&gt;토큰화&lt;/b&gt;해서 어텐션 계산을 시도한 논문입니다!&lt;/p&gt;
&lt;h1&gt;ITRANSFORMER&lt;/h1&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Paper&lt;/b&gt;: ITRANSFORMER: INVERTED TRANSFORMERS ARE EFFECTIVE FOR TIME SERIES FORECASTING (Yongliu Liu, Tengge Hu, Haixu Zhang, Haoran Wu, Shiyu Wang, Maobing Ma, Jianmin Wang, Mingsheng Long)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Conference&lt;/b&gt;: ICLR 2024&lt;/li&gt;
&lt;li&gt;&lt;b&gt;GitHub Repository:&lt;/b&gt; &lt;a href=&quot;https://github.com/thuml/iTransformer&quot;&gt;https://github.com/thuml/iTransformer&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;ArXiv:&lt;/b&gt; &lt;a href=&quot;https://arxiv.org/abs/2310.06625&quot;&gt;https://arxiv.org/abs/2310.06625&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;figure id=&quot;og_1770133926590&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - thuml/iTransformer: Official implementation for &amp;quot;iTransformer: Inverted Transformers Are Effective for Time Series Fore&quot; data-og-description=&quot;Official implementation for &amp;quot;iTransformer: Inverted Transformers Are Effective for Time Series Forecasting&amp;quot; (ICLR 2024 Spotlight) - thuml/iTransformer&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/thuml/iTransformer&quot; data-og-url=&quot;https://github.com/thuml/iTransformer&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/iItGn/dJMb86nSMLj/VnEGskKMeObZx6Xwb3sy8K/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/Ali6M/dJMb81GSqk2/32b54FaXwIAQ52vfxcOs4k/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/thuml/iTransformer&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/thuml/iTransformer&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/iItGn/dJMb86nSMLj/VnEGskKMeObZx6Xwb3sy8K/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/Ali6M/dJMb81GSqk2/32b54FaXwIAQ52vfxcOs4k/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - thuml/iTransformer: Official implementation for &quot;iTransformer: Inverted Transformers Are Effective for Time Series Fore&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Official implementation for &quot;iTransformer: Inverted Transformers Are Effective for Time Series Forecasting&quot; (ICLR 2024 Spotlight) - thuml/iTransformer&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;figure id=&quot;og_1770133925503&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;iTransformer: Inverted Transformers Are Effective for Time Series Forecasting&quot; data-og-description=&quot;The recent boom of linear forecasting models questions the ongoing passion for architectural modifications of Transformer-based forecasters. These forecasters leverage Transformers to model the global dependencies over temporal tokens of time series, with &quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2310.06625&quot; data-og-url=&quot;https://arxiv.org/abs/2310.06625v4&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/T10Ls/dJMb8RRNaFg/YD2f04YK7ekvtoMPmP15xK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/Y7uvf/dJMb8Z3mvVz/0YPG23NyhAHZtdsdKuL8p0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2310.06625&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2310.06625&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/T10Ls/dJMb8RRNaFg/YD2f04YK7ekvtoMPmP15xK/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/Y7uvf/dJMb8Z3mvVz/0YPG23NyhAHZtdsdKuL8p0/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;iTransformer: Inverted Transformers Are Effective for Time Series Forecasting&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;The recent boom of linear forecasting models questions the ongoing passion for architectural modifications of Transformer-based forecasters. These forecasters leverage Transformers to model the global dependencies over temporal tokens of time series, with&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;ITRANSFORMER = &lt;b&gt;Inverted&lt;/b&gt; + TRANSFORMER&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;Inverted &amp;rarr; 뒤바꿈, 반전&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 기존 TRANSFORMER의 &lt;b&gt;어텐션 계산&lt;/b&gt;이 &lt;b&gt;시간축 단위&lt;/b&gt;였다면, &lt;b&gt;변수축 단위&lt;/b&gt;로 &lt;b&gt;뒤바꿈&lt;/b&gt;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;1. SUMMARIZE&lt;/b&gt;&lt;/h2&gt;
&lt;table id=&quot;2e7bd201-015f-802c-a448-fe446bdc5fb6&quot; style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style12&quot;&gt;
&lt;tbody&gt;
&lt;tr id=&quot;2e7bd201-015f-802a-9105-ef6c74d683af&quot;&gt;
&lt;td id=&quot;Hbe&amp;#96;&quot; style=&quot;width: 12.5581%;&quot;&gt;&lt;b&gt;항목&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;;YYT&quot; style=&quot;width: 87.3256%;&quot;&gt;&lt;b&gt;핵심 내용&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e7bd201-015f-8072-a3c2-ffe467f58600&quot;&gt;
&lt;td id=&quot;Hbe&amp;#96;&quot; style=&quot;width: 12.5581%;&quot;&gt;&lt;b&gt;Problem&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;;YYT&quot; style=&quot;width: 87.3256%;&quot;&gt;&lt;b&gt;기존 트랜스포머의 '토큰화' 방식의 부적절함&lt;/b&gt;&lt;br /&gt;&amp;rarr; 기존 모델은 동일 시점의 여러 변수(Multivariate)를 묶어 하나의 토큰으로 만듦&lt;br /&gt;&amp;rarr; 서로 다른 의미를 가진 변수들이 뒤섞이게 하고, 변수 간 상관관계를 학습하기 어렵게 함&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e7bd201-015f-8011-a2a1-e21d65b84628&quot;&gt;
&lt;td id=&quot;Hbe&amp;#96;&quot; style=&quot;width: 12.5581%;&quot;&gt;&lt;b&gt;Motivation&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;;YYT&quot; style=&quot;width: 87.3256%;&quot;&gt;&lt;b&gt;시계열 데이터의 특성 재해석 (Inverted)&lt;/b&gt;&lt;br /&gt;1. &lt;b&gt;독립적 변수 특성:&lt;/b&gt; 각 변수는 고유한 패턴을 가짐. 시점 단위가 아니라 '변수 단로 정보를 추출해야 함&lt;br /&gt;2. &lt;b&gt;어텐션의 역할 재정의:&lt;/b&gt; 시간 순서에 따른 어텐션보다, 변수들 사이의 관계를 파악하는 어텐션이 다변량 예측에서 더 효과적일 것이라는 가설&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e7bd201-015f-809d-9faa-fa8293fc4204&quot;&gt;
&lt;td id=&quot;Hbe&amp;#96;&quot; style=&quot;width: 12.5581%;&quot;&gt;&lt;b&gt;Method&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;;YYT&quot; style=&quot;width: 87.3256%;&quot;&gt;&lt;b&gt;Inverted Structure (구조 뒤바꿈)&lt;/b&gt;&lt;br /&gt;&amp;bull; &lt;b&gt;Variable as Token:&lt;/b&gt; 각 변수의 전체 시계열 데이터(Look-back window) 자체를 하나의 토큰으로 임베딩함&lt;br /&gt;&amp;bull; &lt;b&gt;Self-Attention:&lt;/b&gt; 변수 토큰들 간의 상호작용을 계산하여 &lt;b&gt;변수 간 상관관계&lt;/b&gt;(Multivariate Correlation) &lt;b&gt;학습&lt;/b&gt;&lt;br /&gt;&amp;bull; &lt;b&gt;Feed-Forward Network (FFN):&lt;/b&gt; 각 변수 토큰 내의 &lt;b&gt;시간적 패턴&lt;/b&gt;(Temporal patches)은 FFN을 통해 개별적으로 인코딩&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e7bd201-015f-8024-86f8-c63e15588b25&quot;&gt;
&lt;td id=&quot;Hbe&amp;#96;&quot; style=&quot;width: 12.5581%;&quot;&gt;&lt;b&gt;Results&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;;YYT&quot; style=&quot;width: 87.3256%;&quot;&gt;&lt;b&gt;다변량 시계열 데이터에서 좋은 성능&lt;/b&gt;&lt;br /&gt;&amp;bull; DLinear가 강점을 보였던 데이터셋뿐만 아니라, 변수 간 복잡한 관계가 중요한 데이터셋에서&lt;b&gt; DLinear를 능가&lt;/b&gt;&lt;br /&gt;&amp;bull; Look-back window가 길어질수록 성능이 지속적으로 향상 (기존 트랜스포머는 성능이 정체되거나 하락했음)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e7bd201-015f-8031-8d75-c03ed96999e1&quot;&gt;
&lt;td id=&quot;Hbe&amp;#96;&quot; style=&quot;width: 12.5581%;&quot;&gt;&lt;b&gt;Contribution&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;;YYT&quot; style=&quot;width: 87.3256%;&quot;&gt;&lt;b&gt;트랜스포머 시계열 모델의 새로운 구조 제시&lt;/b&gt;&lt;br /&gt;1. &lt;b&gt;구조 뒤바꿈 (inverted) 효과성:&lt;/b&gt; 복잡한 모듈 추가 없이, &lt;b&gt;데이터의 축(Time vs Variable)&lt;/b&gt;을 바꾸는 것만으로 트랜스포머의 한계를 극복&lt;br /&gt;2. &lt;b&gt;범용성:&lt;/b&gt; 임베딩 방식만 바꾼 것이기에, &lt;b&gt;기존의 다양한 트랜스포머 변형 모델&lt;/b&gt;(Informer, Flowformer 등)에 즉시&lt;b&gt; 적용 가능&lt;/b&gt;한 프레임워크 제공&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;2. DETAIL&lt;/b&gt;&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;1. Introduction&lt;/b&gt;&lt;/h3&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;726&quot; data-origin-height=&quot;299&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/caWzjf/dJMcacaVlYv/Kxn8ANgCuDoqMCukqYKKz1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/caWzjf/dJMcacaVlYv/Kxn8ANgCuDoqMCukqYKKz1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/caWzjf/dJMcacaVlYv/Kxn8ANgCuDoqMCukqYKKz1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FcaWzjf%2FdJMcacaVlYv%2FKxn8ANgCuDoqMCukqYKKz1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;726&quot; height=&quot;299&quot; data-origin-width=&quot;726&quot; data-origin-height=&quot;299&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Transformer, iTransformer 시계열 데이터 처리방식 비교
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Transformer
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Time Step 기준&lt;/b&gt; 토큰, 특정 시점의 &lt;b&gt;모든 변수&lt;/b&gt;가 &lt;b&gt;하나의 토큰&lt;/b&gt;에 포함됨
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;각 변수의 특징 학습&lt;/b&gt; 한계&lt;/li&gt;
&lt;li&gt;&lt;b&gt;무의미한 어텐션 맵&lt;/b&gt;(meaningless attention maps)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;어텐션 &amp;rarr; &lt;b&gt;시간 종속성&lt;/b&gt;(Temporal Dependencies) 파악 목적&lt;/li&gt;
&lt;li&gt;FFN(Feed foward network): &lt;b&gt;혼합된 토큰&lt;/b&gt;에서 시계열 특징 학습&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;iTransformer
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;변수(Variate) 기준&lt;/b&gt; 토큰, 총 토큰의 수는 변수 개수&lt;/li&gt;
&lt;li&gt;어텐션 &amp;rarr; &lt;b&gt;변수간 상관관계&lt;/b&gt;(Multivariate Correlations) 파악 목적&lt;/li&gt;
&lt;li&gt;FFN(Feed foward network): &lt;b&gt;각 변수별&lt;/b&gt; 시계열 특징 학습&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;table data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style12&quot;&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&amp;nbsp;&lt;/th&gt;
&lt;th&gt;&lt;b&gt;Transforme&lt;/b&gt;&lt;/th&gt;
&lt;th&gt;&lt;b&gt;iTransformer (Inverted)&lt;/b&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;토큰의 의미&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;동일 시점의 변수 묶음 ($[v_1, v_2, \dots]$)&lt;/td&gt;
&lt;td&gt;한 변수의 전체 시계열($[t_1, t_2, \dots, t_L]$)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;어텐션 대상&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;시간(Time)&lt;/b&gt; 간의 상관관계&lt;/td&gt;
&lt;td&gt;&lt;b&gt;변수(Variate)&lt;/b&gt; 간의 상관관계&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;FFN의 입력&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;시점별&lt;/b&gt; &lt;b&gt;다변량&lt;/b&gt; 벡터&lt;/td&gt;
&lt;td&gt;&lt;b&gt;변수별&lt;/b&gt; 전체 &lt;b&gt;시계열&lt;/b&gt; 벡터&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;b&gt;FFN의 역할&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;변수 간 특징 추출 (Variate-Mixed)&lt;/b&gt;&lt;/td&gt;
&lt;td&gt;&lt;b&gt;시간적 패턴 추출 (Variate-Unmixed)&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;2. RELATED WORK&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;기존 Transformer 기반 시계열 예측 모델 분류&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;854&quot; data-origin-height=&quot;224&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/b4eeOC/dJMcagEoVkg/Q5A6JQVXjqr0Yok2Gw2kPK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/b4eeOC/dJMcagEoVkg/Q5A6JQVXjqr0Yok2Gw2kPK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/b4eeOC/dJMcagEoVkg/Q5A6JQVXjqr0Yok2Gw2kPK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fb4eeOC%2FdJMcagEoVkg%2FQ5A6JQVXjqr0Yok2Gw2kPK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;854&quot; height=&quot;224&quot; data-origin-width=&quot;854&quot; data-origin-height=&quot;224&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; &lt;b&gt;구성요소(어텐션, Feed-forward network 등), 아키텍처(Transformer 구조) 수정 여부&lt;/b&gt;에 따라 4가지 범주로 구분 (modify the component and architecture)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;구성요소(&lt;/b&gt;Component) 수정
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Transformer를 구성하는 각각의 부품을 수정하는 것&lt;/li&gt;
&lt;li&gt;예) 기존 Attention을 효율적인 Sparse Attention으로 바꿈&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;아키텍처&lt;/b&gt; (Architecture) 수정
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;기존 Transformer 구성 부품은 그대로, 부품을 조립하는 방식 변경&lt;/li&gt;
&lt;li&gt;예) iTransformer: 기존 Attention은 시간관계 파악, inverted &amp;rarr; 각 변수관계 파악&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;구성요소 수정 O, 아키텍처 수정 X&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;가장 일반적인 방식&lt;/li&gt;
&lt;li&gt;어텐션 자체 수정(Sparse Attention 등)&lt;/li&gt;
&lt;li&gt;Autoformer, Informer&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;구성요소 수정 X, 아키텍처 수정 X&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;추가적인 시계열 처리(Series Processing) 도입
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Normalization, Patching 등&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;PatchTST, NSTransformer&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;구성요소 수정 O, 아키텍처 수정 O&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Crossformer&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;구성요소 수정 X, 아키텍처 수정 O&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;iTransformer
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;단치 각 구성요소 입력차원 inverted&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;3. ITRANSFORMER&lt;/b&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;historical observations&lt;/b&gt;T : time steps&lt;/li&gt;
&lt;li&gt;N : variates&lt;/li&gt;
&lt;li&gt;$X = {x_1, \dots, x_T} \in \mathbb{R}^{T \times N}$&lt;/li&gt;
&lt;/ul&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;predict the future&lt;/b&gt;S: time steps&lt;/li&gt;
&lt;li&gt;N : variates&lt;/li&gt;
&lt;li&gt;$Y = {x_{T+1}, \dots, x_{T+S}} \in \mathbb{R}^{S \times N}$&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Xt,&lt;/b&gt;: 특정 시간 스텝 t에서 동시에 기록된 &lt;b&gt;모든 N개 변수의 값&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;X:,n&lt;/b&gt;: n번째 변수의 &lt;b&gt;전체 시계열&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size18&quot;&gt;&lt;b&gt;3.1 STRUCTURE OVERVIEW&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;iTransformer 전체 흐름&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;384&quot; data-origin-height=&quot;105&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/daVwyB/dJMcab37MVD/yssrm8JGvSu7nuKcO1u341/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/daVwyB/dJMcab37MVD/yssrm8JGvSu7nuKcO1u341/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/daVwyB/dJMcab37MVD/yssrm8JGvSu7nuKcO1u341/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdaVwyB%2FdJMcab37MVD%2Fyssrm8JGvSu7nuKcO1u341%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;384&quot; height=&quot;105&quot; data-origin-width=&quot;384&quot; data-origin-height=&quot;105&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;$\mathbf{h}_n^0$:&lt;/b&gt; n번째 변수의 전체 과거 시계열 &lt;b&gt;X:,n&lt;/b&gt;을 &lt;b&gt;*&lt;i&gt;임베딩&lt;br /&gt;*&lt;/i&gt;$\mathbf{H}^l$&lt;/b&gt;: $l$번째 트랜스포머 블록을 통과한 hidden state 행렬&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;$\hat{\mathbf{Y}}_{:,n}$&lt;/b&gt;: 번째 변수에 대한 최종 미래 예측값 (각 변수별로 미래 예측됨) / 최종적으로 선형레이어 통과(프로젝션)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;iTransformer 세부 구조 - encoder-only&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;854&quot; data-origin-height=&quot;357&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/oJi8K/dJMcafrVzh1/7iAoVu71izg6yYSNmpYXOK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/oJi8K/dJMcafrVzh1/7iAoVu71izg6yYSNmpYXOK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/oJi8K/dJMcafrVzh1/7iAoVu71izg6yYSNmpYXOK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FoJi8K%2FdJMcafrVzh1%2F7iAoVu71izg6yYSNmpYXOK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;854&quot; height=&quot;357&quot; data-origin-width=&quot;854&quot; data-origin-height=&quot;357&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;(a) Embedding&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;MLP(Multi-Layer Perceptron)&lt;/li&gt;
&lt;li&gt;각 변수별로 전체 시계열을 Token으로 임베딩&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;(b) Multivariate Attention&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 변수별 임베딩된 토큰간 다변량 상관 관계(Multivariate Correlations) 포착&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;(c) Feed-forward Network(FFN)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 변수별 독립적으로 적용&lt;/li&gt;
&lt;li&gt;두 개의 선형 변환, 비선형 활성화 함수, 드롭아웃&lt;/li&gt;
&lt;li&gt;시계열 특징 포착&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;(d) Layer Normalization&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;기존 Transformer: &lt;b&gt;각 시점&lt;/b&gt; 내에서 정규화&lt;/li&gt;
&lt;li&gt;iTransformer: &lt;b&gt;각 변수&lt;/b&gt;의 전체 시계열(Token)에 대해 정규화
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;비정상성(Non-stationarity)&lt;/b&gt; 해결에 도움&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size18&quot;&gt;&lt;b&gt;3.2 INVERTED TRANSFORMER COMPONENTS&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Layer normalization&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;491&quot; data-origin-height=&quot;72&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/xqGce/dJMb99Zz8cL/oMoJlhGWkqTkK7T7NZRmm1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/xqGce/dJMb99Zz8cL/oMoJlhGWkqTkK7T7NZRmm1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/xqGce/dJMb99Zz8cL/oMoJlhGWkqTkK7T7NZRmm1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FxqGce%2FdJMb99Zz8cL%2FoMoJlhGWkqTkK7T7NZRmm1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;491&quot; height=&quot;72&quot; data-origin-width=&quot;491&quot; data-origin-height=&quot;72&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 각 변수에 대해 임베딩 (h_n)한 각 토큰을 독립적으로 평균이 0이고 분산이 1인 분포로 정규화&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;비정상 문제(non-stationary problem) 해결 효과적
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;비정상성(Non-stationarity): 시간에 따라 데이터 통계적 특성(평균, 분산)이 변함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;기존 Transformer vs iTransformer
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;기존 Transformer
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;특정 시점(timestamp)의 다변량(multivariate) 데이터를 임베딩 &amp;rarr;&lt;b&gt;각 시간 토큰&lt;/b&gt;에 대해 정규화&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;iTransformer
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 변수(variate)의 전체 시계열을 임베딩 &amp;rarr; &lt;b&gt;각 변수 토큰&lt;/b&gt;에 대해 정규화&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Feed-forward network (FFN)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;$FFN(x)=max(0,xW1​+b1​)W2​+b2​$&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 간단한 MLP 구조, 비선형성 학습(Relu 구조)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Self-attention&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;기존 attention
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;한 시점의 여러변수를 한 토큰으로 묶어서 어텐션 적용&lt;/li&gt;
&lt;li&gt;시간적 의존성(temporal dependencies) 모델링&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;iTransformer attention
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 변수 전체를 한 토큰으로 묶어서 어텐션 적용&lt;/li&gt;
&lt;li&gt;&lt;b&gt;변수간 상관관계&lt;/b&gt; 표현(&lt;b&gt;multivariate correlation&lt;/b&gt;) - 밀접한 변수들에 더 높은 가중치 적용&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;4. EXPERIMENTS&lt;/b&gt;&lt;/h3&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4.1 FORECASTING RESULTS&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Baselines&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;트랜스포머 기반: Autoformer, FEDformer, Stationary, Crossformer, PatchTST&lt;/li&gt;
&lt;li&gt;선형 기반: DLinear, TiDE, RLinear&lt;/li&gt;
&lt;li&gt;TCN(Temporal Convolutional Network) 기반: SCINet, TimesNet&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;lookback length&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;96&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;prediction length&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;PEMS 데이터셋: 12, 24, 36, 48&lt;/li&gt;
&lt;li&gt;나머지: 96, 192, 336, 720&lt;/li&gt;
&lt;li&gt;각 결과의 평균 MSE, MAE (전체 개별 예측값은 Appendix)&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;822&quot; data-origin-height=&quot;226&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/8Hemd/dJMcagxAFE5/7OavxvzM7DKzHWPony8FO0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/8Hemd/dJMcagxAFE5/7OavxvzM7DKzHWPony8FO0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/8Hemd/dJMcagxAFE5/7OavxvzM7DKzHWPony8FO0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2F8Hemd%2FdJMcagxAFE5%2F7OavxvzM7DKzHWPony8FO0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;822&quot; height=&quot;226&quot; data-origin-width=&quot;822&quot; data-origin-height=&quot;226&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;red: &lt;b&gt;first&lt;/b&gt; best&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;blue: &lt;b&gt;second&lt;/b&gt; best&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;results&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;iTransformer &lt;b&gt;SOTA&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;변동성 대처
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;기존 SOTA 모델 PatchTST 한계&lt;/b&gt;: PEMS 데이터셋과 같이 변동성이 심한 시계열에서 성능 저하&lt;/li&gt;
&lt;li&gt;iTransformer는 변동성에 잘 대처 (전체 시계열을 한 토큰으로 임베딩하므로)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;다변량 상관관계 포착
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Crossformer 한계:&lt;/b&gt; 다변량 상관관계를 명시적으로 포착하는 모델 성능 떨어지는 경우 존재&lt;/li&gt;
&lt;li&gt;iTransformer는 변수간 상관성 포착에 강점 (변수별 토큰으로 어텐션 적용) &amp;rarr; &lt;b&gt;고차원 데이터 뛰어남&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4.2 ITRANSFORMERS GENERALITY&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Performance promotion&lt;/b&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;기존 Transformer 모델에 &lt;b&gt;inverted&lt;/b&gt; 구조 적용
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;전체적으로 &lt;b&gt;성능향상&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;기존 Transformer 아키텍처&lt;/b&gt;가 &lt;b&gt;시계열 예측&lt;/b&gt;에 &lt;b&gt;부적절하게 사용&lt;/b&gt;됨을 시사&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;820&quot; data-origin-height=&quot;336&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cibeji/dJMcagxAFF2/fb5Xj9NT1JfPMIq6khFEdK/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cibeji/dJMcagxAFF2/fb5Xj9NT1JfPMIq6khFEdK/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cibeji/dJMcagxAFF2/fb5Xj9NT1JfPMIq6khFEdK/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcibeji%2FdJMcagxAFF2%2Ffb5Xj9NT1JfPMIq6khFEdK%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;820&quot; height=&quot;336&quot; data-origin-width=&quot;820&quot; data-origin-height=&quot;336&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Variate generalization&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;830&quot; data-origin-height=&quot;222&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/EmWKQ/dJMcagRVb7O/y1dF7XgNHDW6tq4iVuCpik/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/EmWKQ/dJMcagRVb7O/y1dF7XgNHDW6tq4iVuCpik/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/EmWKQ/dJMcagRVb7O/y1dF7XgNHDW6tq4iVuCpik/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FEmWKQ%2FdJMcagRVb7O%2Fy1dF7XgNHDW6tq4iVuCpik%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;830&quot; height=&quot;222&quot; data-origin-width=&quot;830&quot; data-origin-height=&quot;222&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;실험&lt;/b&gt;: CI-Transformers, iTransformer 간의 훈련 중에 보지 못한 시계열 변량(variates, 변수)에 대해 얼마나 잘 일반화되는지 성능 측정&lt;/li&gt;
&lt;li&gt;&lt;b&gt;결과&lt;/b&gt;: CI-Transformers 보다 iTransformer가 (100% &amp;rarr; 20% variates 전환 시) 전반적으로 작은 예측성능 저하&lt;/li&gt;
&lt;li&gt;&amp;rarr; &lt;b&gt;iTransformer&lt;/b&gt;가 훈련에 보지 못한 변량에 대해 &lt;b&gt;더 뛰어난 일반화 능력&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;이유&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;기존 Transformer
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;특정 시점의 모든 변수를 묶어 시간적 토큰화(temporal token) &amp;rarr; &lt;b&gt;토큰 개수 고정 (&lt;/b&gt;= input sequence 길이)&lt;/li&gt;
&lt;li&gt;Feed-Forward Network(FFN) &amp;rarr; 시간적 토큰 독립적으로 적용 &amp;rarr; 각 개별 변수의 시계열 패턴 포착 어려움&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;iTransformer
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 변수의 전체 시계열 변량 토큰화(variate token) &amp;rarr; &lt;b&gt;토큰 개수 유동적&lt;/b&gt; (데이터 셋 변수 수에 따라 토큰 개수가 결정됨)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;훈련, 추론단계 변수 수 달라져도 문제없이 동작 가능&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;Feed-Forward Network(FFN) &amp;rarr; 변량 토큰 독립적으로 적용 &amp;rarr; 각 개별 변수의 시계열 패턴 포착 용이&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Increasing lookback length&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;789&quot; data-origin-height=&quot;334&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/evkzOz/dJMcadgzA9K/YukBkosoIK06xn9FdEeO21/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/evkzOz/dJMcadgzA9K/YukBkosoIK06xn9FdEeO21/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/evkzOz/dJMcadgzA9K/YukBkosoIK06xn9FdEeO21/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FevkzOz%2FdJMcadgzA9K%2FYukBkosoIK06xn9FdEeO21%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;789&quot; height=&quot;334&quot; data-origin-width=&quot;789&quot; data-origin-height=&quot;334&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;lookback length: 48, 96, 192, 336, 720&lt;/li&gt;
&lt;li&gt;prediction length: 96&lt;/li&gt;
&lt;li&gt;&lt;b&gt;배경&lt;/b&gt;: 이전 연구(DLinear, PatchTST) 에서 &lt;b&gt;lookback length가 늘어난다고 해서 예측성능이 반드시 늘어나지는 않음&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;기존 Transformer , inverted Transformer 의 성능 비교
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;기존 Transformer (채워진 도형)&lt;/b&gt; : lookback length 늘어나도 성능 오히려 악화되는 부분 존재&lt;/li&gt;
&lt;li&gt;&lt;b&gt;inverted Transformer (구멍뚫린 도형)&lt;/b&gt; : lookback length 늘어날수록 성능 일관되게 향상됨&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; inverted 된 어텐션, FFN(MLP 구조)가 시간 관계를 잘 포착함을 시사&lt;/b&gt;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4.3 MODEL ANALYSIS&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Ablation study&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;835&quot; data-origin-height=&quot;223&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/rtDtV/dJMb99Zz8cP/kWKKk6Xi2cngiEKVOA9rbk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/rtDtV/dJMb99Zz8cP/kWKKk6Xi2cngiEKVOA9rbk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/rtDtV/dJMb99Zz8cP/kWKKk6Xi2cngiEKVOA9rbk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FrtDtV%2FdJMb99Zz8cP%2FkWKKk6Xi2cngiEKVOA9rbk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;835&quot; height=&quot;223&quot; data-origin-width=&quot;835&quot; data-origin-height=&quot;223&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;실험&lt;/b&gt;: 변수차원(Variate), 시점차원(Temporal) 각각 어텐션/FFN 구성요소 교체, 제거(w/o) 에 따른 성능 비교 실험&lt;/li&gt;
&lt;li&gt;&lt;b&gt;결과&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;iTransformer&lt;/b&gt; (변수 차원에 어텐션 사용, 시점 차원에 FFN사용) 구조 가장 &lt;b&gt;우수한&lt;/b&gt; 결과&lt;/li&gt;
&lt;li&gt;&lt;b&gt;바닐라 Transformer&lt;/b&gt; (시점 차원에 어텐션 사용, 변수차원에 FFN사용) 구조 가장 &lt;b&gt;최악&lt;/b&gt; 결과&lt;/li&gt;
&lt;li&gt;&lt;b&gt;&amp;rarr; inverted 방식 효과성 입증&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Analysis of series representations &amp;amp; Analysis of multivariate correlations&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;787&quot; data-origin-height=&quot;286&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/ruM9R/dJMcaa5ed1F/QozzEDBpSk1DwWvkqFPoZ1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/ruM9R/dJMcaa5ed1F/QozzEDBpSk1DwWvkqFPoZ1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/ruM9R/dJMcaa5ed1F/QozzEDBpSk1DwWvkqFPoZ1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FruM9R%2FdJMcaa5ed1F%2FQozzEDBpSk1DwWvkqFPoZ1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;787&quot; height=&quot;286&quot; data-origin-width=&quot;787&quot; data-origin-height=&quot;286&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;(좌) MSE, CKA 유사성 비교&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;CKA (Centered Kernel Alignment) 유사성: 두 신경망 계층이 학습한 표현이 얼마나 유사한지 측정하는 지표 (&lt;b&gt;클수록 표현 유사성이 큼&lt;/b&gt;)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;CKA 유사성이 높을수록&lt;/b&gt; &lt;b&gt;더 정확한 예측&lt;/b&gt;으로 이어짐&lt;/li&gt;
&lt;li&gt;&lt;b&gt;iTransformer&lt;/b&gt;가 일반 Transformer에 비해 &lt;b&gt;더 높은 CKA 유사성&lt;/b&gt; 달성&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;(우) 다변량 상관관계 학습&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;목적&lt;/b&gt;: iTransformer에서 어텐션 메커니즘이 &lt;b&gt;변수간 상관관계 학습&lt;/b&gt;을 잘하고 있는지 확인&lt;/li&gt;
&lt;li&gt;&lt;b&gt;실험&lt;/b&gt;: 각 변수간 실제 데이터(과거, 미래) 피어슨 상관관계 히트맵, 어텐션 스코어맵(첫번째, 마지막 레이어) 비교&lt;/li&gt;
&lt;li&gt;&lt;b&gt;결과&lt;/b&gt;: 각 레이어의 어텐션 스코어 맵이 실제 데이터의 상관관계 히트맵과 유사&lt;/li&gt;
&lt;li&gt;&amp;rarr; &lt;b&gt;어텐션&lt;/b&gt;의 &lt;b&gt;높은 해석 가능성, inverted 된 아키텍처가 다변량 상관관계 효과적을 포착&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Efficient training strategy&lt;/b&gt;&lt;/p&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;789&quot; data-origin-height=&quot;260&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/brM0HL/dJMcabiMQcl/kEkzKgCuEzdZIaPYewPVRk/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/brM0HL/dJMcabiMQcl/kEkzKgCuEzdZIaPYewPVRk/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/brM0HL/dJMcabiMQcl/kEkzKgCuEzdZIaPYewPVRk/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbrM0HL%2FdJMcabiMQcl%2FkEkzKgCuEzdZIaPYewPVRk%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;789&quot; height=&quot;260&quot; data-origin-width=&quot;789&quot; data-origin-height=&quot;260&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;배경&lt;/b&gt;: Self-attention 메커니즘 복잡도 O(N^2) (N: 토큰 수) &amp;rarr; 변수(variate) 수가 많을 경우 훈련 부담스러움&lt;/li&gt;
&lt;li&gt;&lt;b&gt;실험&lt;/b&gt;: 각 &lt;b&gt;배치&lt;/b&gt;(batch)마다 &lt;b&gt;일부 변수(variate)&lt;/b&gt;만 이용하여 학습 &amp;rarr; &lt;b&gt;예측성능(MSE, 좌), 메모리(GB, 우) 비교&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;iTransformer는 학습, 추론의 변수(토큰) 수가 동일하지 않아도 됨&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;결과&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;학습 변량 비율(Sample Ratio) 감소&lt;/b&gt;하더라도 &lt;b&gt;성능(MSE)이&lt;/b&gt; &lt;b&gt;안정적으로 유지&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;학습 변량 비율(Sample Ratio) 감소&lt;/b&gt;하더라도 &lt;b&gt;메모리 사용량이 크게 감소&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&amp;rarr; &lt;b&gt;학습 시&lt;/b&gt;, &lt;b&gt;일부 변량&lt;/b&gt;만 사용하여 효율성을 높임 / &lt;b&gt;추론 시&lt;/b&gt;, &lt;b&gt;모든 변량&lt;/b&gt;에 대해 예측을 수행&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;효과&lt;/b&gt;:
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;배치마다 변수 무작위 샘플링 &amp;rarr; 일반화 효과 (특정 변수에 과하게 의존 방지)&lt;/li&gt;
&lt;li&gt;메모리 효율성&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;3. Implementation&lt;/b&gt;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://github.com/thuml/iTransformer&quot;&gt;https://github.com/thuml/iTransformer&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1770134143898&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - thuml/iTransformer: Official implementation for &amp;quot;iTransformer: Inverted Transformers Are Effective for Time Series Fore&quot; data-og-description=&quot;Official implementation for &amp;quot;iTransformer: Inverted Transformers Are Effective for Time Series Forecasting&amp;quot; (ICLR 2024 Spotlight) - thuml/iTransformer&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/thuml/iTransformer&quot; data-og-url=&quot;https://github.com/thuml/iTransformer&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/iItGn/dJMb86nSMLj/VnEGskKMeObZx6Xwb3sy8K/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/Ali6M/dJMb81GSqk2/32b54FaXwIAQ52vfxcOs4k/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/thuml/iTransformer&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/thuml/iTransformer&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/iItGn/dJMb86nSMLj/VnEGskKMeObZx6Xwb3sy8K/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/Ali6M/dJMb81GSqk2/32b54FaXwIAQ52vfxcOs4k/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - thuml/iTransformer: Official implementation for &quot;iTransformer: Inverted Transformers Are Effective for Time Series Fore&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Official implementation for &quot;iTransformer: Inverted Transformers Are Effective for Time Series Forecasting&quot; (ICLR 2024 Spotlight) - thuml/iTransformer&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;TS shape&lt;/b&gt;&lt;/h3&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Raw Data [Time_steps, Variates] : 2차원&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Input Tensor&lt;/b&gt; : 3차원&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;일반적인 구성:&lt;/b&gt; &lt;code&gt;[B, L, N]&lt;/code&gt;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;B (Batch Size):&lt;/b&gt; 한 번에 학습할 샘플의 개수&lt;/li&gt;
&lt;li&gt;&lt;b&gt;L (Look-back Window / Seq_Len):&lt;/b&gt; 모델이 과거를 얼마나 길게 보는지(입력 길이)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;N (Number of Variates):&lt;/b&gt; 변수 개수&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;* **iTransformer&lt;/b&gt; &amp;rarr; &lt;b&gt;[B, N, L]&lt;/b&gt; : 변수(N)를 토큰(Token)으로 취급하여 &lt;b&gt;차원을 바꿈(Inverted)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;-&amp;gt; &lt;b&gt;각 변수&lt;/b&gt; &lt;b&gt;전체 시계열은 압축&lt;/b&gt;되어 &lt;b&gt;토큰화&lt;/b&gt;됨&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;-&amp;gt; 변수별 &lt;b&gt;결측치&lt;/b&gt;(Missing Values), &lt;b&gt;시점 불일치&lt;/b&gt;(Misalignment) 등 &lt;b&gt;불규칙한 데이터에도 별도의 전처리 없이 유연하게 적용 가능 &lt;/b&gt;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;4. Discussion&lt;/b&gt;&lt;/h2&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;변수가 1~2개&lt;/b&gt;뿐인 경우의 성능? (Univariate vs. Multivariate)&lt;/li&gt;
&lt;li&gt;***&amp;rarr; 어텐션 계산 유의미 &amp;rarr; 단지 비선형 층을 통과하는 FFN(MLP) 모델과 동일할 가능성 큼&lt;/li&gt;
&lt;li&gt;iTransformer &lt;b&gt;한계&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;FFN(feed-foward network)의 역할&lt;/b&gt;: &lt;b&gt;각 변수 상관관계 고려시, 변수별 거시적 패턴 학습&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;변수별 &lt;b&gt;전체 시계열&lt;/b&gt;(Look-back Window)을 하나의 &lt;b&gt;독립된 토큰&lt;/b&gt;으로 구성&lt;/li&gt;
&lt;li&gt;&lt;b&gt;한계&lt;/b&gt;: 시계열 전체를 하나의 토큰으로 보기 때문에, &lt;b&gt;특정 찰나의 순간에만 발생하는 미세한 변화&lt;/b&gt; (시점별로 다른 변수의 상관관계)는 포착하기 힘듦&lt;/li&gt;
&lt;li&gt;&amp;rarr; &lt;b&gt;제안&lt;/b&gt;: iTransformer (inverted) + &lt;b&gt;Patching (&lt;/b&gt;관련해서 paper 있는지 찾아보기)&lt;/li&gt;
&lt;li&gt;기존 iTransformer는 한 변수의 전체 길이를 하나의 토큰으로 만듦&lt;/li&gt;
&lt;li&gt;기존 변수를 패치단위로 분할하여 여러 토큰으로 구성
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;$토큰 수: N(변수 개수) \times P(패치 개수)$&lt;/li&gt;
&lt;li&gt;시간 축(Patch)과 변수 축(Variate)을 나누어서 각각 어텐션 계산&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;</description>
      <category>Paper review</category>
      <category>iTransformer</category>
      <category>paper review</category>
      <category>tsf</category>
      <author>Hippo's data</author>
      <guid isPermaLink="true">https://hipposdata.tistory.com/156</guid>
      <comments>https://hipposdata.tistory.com/entry/Paper-review-iTransformer#entry156comment</comments>
      <pubDate>Wed, 4 Feb 2026 01:10:31 +0900</pubDate>
    </item>
    <item>
      <title>[TS] 시계열 용어 정리</title>
      <link>https://hipposdata.tistory.com/entry/TS-%EC%8B%9C%EA%B3%84%EC%97%B4-%EC%9A%A9%EC%96%B4-%EC%A0%95%EB%A6%AC</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;시계열(TS, Time Series) 논문을 읽다 보면, 의미가 헷갈리는 용어들이 있습니다!&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;오늘은 시계열 논문에서 자주 등장하지만, 매번 헷갈려서 검색해보는 단어들의 의미를 명확히 알아보겠습니다!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;1. Endogenous vs Exogenous &lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;2. Variable vs Variate vs Variation vs &lt;/b&gt;&lt;b&gt;Variance&lt;/b&gt;&lt;/p&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;1. Endogenous vs Exogenous &lt;/b&gt;&lt;/h2&gt;
&lt;h3 data-path-to-node=&quot;9&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b data-index-in-node=&quot;0&quot; data-path-to-node=&quot;9&quot;&gt;(1) Endogenous&lt;/b&gt; Variable&lt;b data-index-in-node=&quot;0&quot; data-path-to-node=&quot;9&quot;&gt; (내생변수)&lt;/b&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;어원&lt;/b&gt;: Endo(내부) + Genous(생성)&lt;/li&gt;
&lt;li&gt;&lt;b&gt; 의미&lt;/b&gt;: 모델 내부의 상호작용에 의해 값이 결정되는 변수. 즉, 우리가 예측하고자 하는 대상 (Target)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;예시&lt;/b&gt; (비트코인 예측): 과거 비트코인 가격 변수&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-path-to-node=&quot;11&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b data-index-in-node=&quot;0&quot; data-path-to-node=&quot;11&quot;&gt;(2) Exogenous &lt;/b&gt;Variable &lt;b data-index-in-node=&quot;0&quot; data-path-to-node=&quot;11&quot;&gt;(외생변수)&lt;/b&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt; 어원&lt;/b&gt;: Exo(외부) + Genous(생성)&lt;/li&gt;
&lt;li&gt;&lt;b&gt; 의미&lt;/b&gt;: 모델 외부에서 이미 결정되어 입력으로 들어오는 변수. 모델이 이 값을 바꿀 수는 없지만, 예측에 힌트를 주는&lt;b&gt; 참고 자료&lt;/b&gt;(Condition)&lt;/li&gt;
&lt;li data-path-to-node=&quot;12,3,0&quot;&gt;&lt;b&gt;예시&lt;/b&gt; (비트코인 예측): 미국 금리, 소비자 물가 지수(CPI), 다른 코인 거래량 등&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignLeft&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-filename=&quot;blob&quot; data-origin-width=&quot;221&quot; data-origin-height=&quot;330&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/cjooni/dJMcacWe8sY/CsXADhwvUZ3r8IIT1pmtK1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/cjooni/dJMcacWe8sY/CsXADhwvUZ3r8IIT1pmtK1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/cjooni/dJMcacWe8sY/CsXADhwvUZ3r8IIT1pmtK1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2Fcjooni%2FdJMcacWe8sY%2FCsXADhwvUZ3r8IIT1pmtK1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;190&quot; height=&quot;330&quot; data-filename=&quot;blob&quot; data-origin-width=&quot;221&quot; data-origin-height=&quot;330&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;TimeXer 논문 내 이미지 (TimeXer: Empowering Transformers for Time Series Forecasting with Exogenous Variables)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;내생변수 (Endogenous): $\mathbf{x}^{(1)}$
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;과거 $\mathbf{x}^{(1)}$으로 미래 $\mathbf{x}^{(1)}$ 맞춤&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;외생변수 (Exogenous): $\mathbf{z}^{(1)}, \mathbf{z}^{(2)}, \dots, \mathbf{z}^{(C)}$
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;예측의 대상은 아니지만, 예측을 돕기 위해 참조만 하는 외부 요인&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;2. Variable vs Variate vs Variation vs Variance &lt;/b&gt;&lt;/h2&gt;
&lt;h3 data-path-to-node=&quot;17&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b data-index-in-node=&quot;0&quot; data-path-to-node=&quot;17&quot;&gt;(1) Variable: &quot;가장 넓은 의미의 변수&quot;&lt;/b&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-path-to-node=&quot;18&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;우리가 수학이나 프로그래밍에서 쓰는 일반적인 &lt;b&gt;x, y 변수&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;Target variable 타겟 변수, Exogenous variable 외생 변수&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-path-to-node=&quot;19&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b data-index-in-node=&quot;0&quot; data-path-to-node=&quot;19&quot;&gt;(2) Variate: &quot;개별 채널 (Channel), 변수&quot;&lt;/b&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-path-to-node=&quot;20&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;통계학에서는 '확률 변수의 실현값(구체적인 값)'을 뜻하지만, &lt;b data-index-in-node=&quot;27&quot; data-path-to-node=&quot;20,0,0&quot;&gt;딥러닝 시계열 논문&lt;/b&gt;에서는 &lt;b data-index-in-node=&quot;41&quot; data-path-to-node=&quot;20,0,0&quot;&gt;'채널(Channel)'&lt;/b&gt;, &lt;b&gt;'피처(Feature)'&lt;/b&gt;와 동의어로 사용됨&lt;/li&gt;
&lt;li&gt;Multivariate Time Series 다변량 시계열, Variate-specific embedding 각 변수(채널)별 임베딩&amp;nbsp;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-path-to-node=&quot;21&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b data-index-in-node=&quot;0&quot; data-path-to-node=&quot;21&quot;&gt;(3) Variation: &quot;값의 움직임&quot;&lt;/b&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-path-to-node=&quot;22&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;대상이 아니라 '상태'나 '동작' -&amp;gt; 값이 시간에 따라 오르내리는 &lt;b data-index-in-node=&quot;43&quot; data-path-to-node=&quot;22,0,0&quot;&gt;변동&lt;/b&gt;이나 &lt;b data-index-in-node=&quot;48&quot; data-path-to-node=&quot;22,0,0&quot;&gt;변화 양상&lt;/b&gt; (Variance: 분산과 구별)&lt;/li&gt;
&lt;li&gt;Temporal variation 시간적 &lt;b data-index-in-node=&quot;24&quot; data-path-to-node=&quot;22,1,1,0,0&quot;&gt;변동&lt;/b&gt; (시간 흐름에 따라 값이 변화), Local variation 국소적 구간에서의 &lt;b&gt;변화&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-path-to-node=&quot;4&quot; data-ke-size=&quot;size23&quot;&gt;&lt;b data-index-in-node=&quot;0&quot; data-path-to-node=&quot;4&quot;&gt;(4) Variance: &quot;계산된 통계적 수치 (분산)&quot;&lt;/b&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-path-to-node=&quot;5&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;데이터가 평균으로부터 얼마나 퍼져있는지를 나타내는 통계적 척도(&lt;span data-index-in-node=&quot;35&quot; data-math=&quot;\sigma^2&quot;&gt;$\sigma^2$&lt;/span&gt;)&lt;/li&gt;
&lt;/ul&gt;
&lt;hr contenteditable=&quot;false&quot; data-ke-type=&quot;horizontalRule&quot; data-ke-style=&quot;style5&quot; /&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&quot;Capturing correlations among multiple &lt;b data-index-in-node=&quot;39&quot; data-path-to-node=&quot;16,0&quot;&gt;variates&lt;/b&gt; to model temporal &lt;b data-index-in-node=&quot;66&quot; data-path-to-node=&quot;16,0&quot;&gt;variation&lt;/b&gt; of each &lt;b data-index-in-node=&quot;84&quot; data-path-to-node=&quot;16,0&quot;&gt;variable&lt;/b&gt;.&quot;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;-&amp;gt; &quot;다수의 변량(채널, 변수)&lt;i data-index-in-node=&quot;15&quot; data-path-to-node=&quot;18,0&quot;&gt;들 사이의 상관관계를 포착하여, 각 &lt;b data-index-in-node=&quot;35&quot; data-path-to-node=&quot;18,0&quot;&gt;변수&lt;/b&gt;의 시간적 &lt;b data-index-in-node=&quot;43&quot; data-path-to-node=&quot;18,0&quot;&gt;변동&lt;/b&gt;을 모델링한다.&quot;&lt;/i&gt;&lt;/p&gt;</description>
      <category>Time Series Analysis (시계열 분석)</category>
      <category>time series</category>
      <author>Hippo's data</author>
      <guid isPermaLink="true">https://hipposdata.tistory.com/155</guid>
      <comments>https://hipposdata.tistory.com/entry/TS-%EC%8B%9C%EA%B3%84%EC%97%B4-%EC%9A%A9%EC%96%B4-%EC%A0%95%EB%A6%AC#entry155comment</comments>
      <pubDate>Sat, 31 Jan 2026 21:00:19 +0900</pubDate>
    </item>
    <item>
      <title>[Paper review] PatchTST</title>
      <link>https://hipposdata.tistory.com/entry/Paper-review-PatchTST</link>
      <description>&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p style=&quot;background-color: #ffffff; color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;오늘은 &lt;b&gt;PatchTST&lt;/b&gt; 모델이 제안된 논문을 리뷰해보도록 하겠습니다!&lt;/p&gt;
&lt;p style=&quot;background-color: #ffffff; color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;저번 리뷰에서 단순한 선형구조를 제안하여,&lt;b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/b&gt;&lt;b&gt;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&amp;ldquo;Transformer는 LTSF&lt;span style=&quot;background-color: #ffffff; color: #333333; text-align: start;&quot;&gt;(Long term time-series Forecast)&lt;/span&gt;에 별로다&amp;rdquo;&lt;span&gt;&amp;nbsp;&lt;/span&gt;&lt;/b&gt;라고 주장했던 Dlinear 관련 논문을 리뷰했었는데욥&lt;/p&gt;
&lt;p style=&quot;background-color: #ffffff; color: #333333; text-align: start;&quot; data-ke-size=&quot;size16&quot;&gt;이번에는 다시 &quot; &lt;b&gt;Transformer&lt;b&gt;도 제대로 쓰면 선형 모델보다 훨씬 좋다&quot; &lt;/b&gt;&lt;/b&gt;라는 주장으로 해당 내용을 반박한 논문입니다!&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Paper: A TIME SERIES IS WORTH 64 WORDS: LONG-TERM FORECASTING WITH TRANSFORMERS&lt;/b&gt; (Yuqi Nie, Nam H. Nguyen, Phanwadee Sinthong, Jayant Kalagnanam)&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Conference:&lt;/b&gt; ICLR 2023&lt;/li&gt;
&lt;li&gt;&lt;b&gt;GitHub Repository:&lt;/b&gt; &lt;a href=&quot;https://github.com/yuqinie98/PatchTST&quot;&gt;https://github.com/yuqinie98/PatchTST&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;ArXiv:&lt;/b&gt; &lt;a href=&quot;https://arxiv.org/abs/2211.14730&quot;&gt;https://arxiv.org/abs/2211.14730&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;figure id=&quot;og_1769749425785&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - yuqinie98/PatchTST: An offical implementation of PatchTST: &amp;quot;A Time Series is Worth 64 Words: Long-term Forecasting with&quot; data-og-description=&quot;An offical implementation of PatchTST: &amp;quot;A Time Series is Worth 64 Words: Long-term Forecasting with Transformers.&amp;quot; (ICLR 2023) https://arxiv.org/abs/2211.14730 - yuqinie98/PatchTST&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/yuqinie98/PatchTST&quot; data-og-url=&quot;https://github.com/yuqinie98/PatchTST&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/iF5bY/dJMb9ee8Neu/kEigxmbctQuFxprLNHLj8k/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/dnIyMC/dJMb85vJHuw/P5q4N2pDOUkYkovgEUvAg0/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/yuqinie98/PatchTST&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/yuqinie98/PatchTST&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/iF5bY/dJMb9ee8Neu/kEigxmbctQuFxprLNHLj8k/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/dnIyMC/dJMb85vJHuw/P5q4N2pDOUkYkovgEUvAg0/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - yuqinie98/PatchTST: An offical implementation of PatchTST: &quot;A Time Series is Worth 64 Words: Long-term Forecasting with&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;An offical implementation of PatchTST: &quot;A Time Series is Worth 64 Words: Long-term Forecasting with Transformers.&quot; (ICLR 2023) https://arxiv.org/abs/2211.14730 - yuqinie98/PatchTST&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;figure id=&quot;og_1769749424535&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;A Time Series is Worth 64 Words: Long-term Forecasting with Transformers&quot; data-og-description=&quot;We propose an efficient design of Transformer-based models for multivariate time series forecasting and self-supervised representation learning. It is based on two key components: (i) segmentation of time series into subseries-level patches which are serve&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2211.14730&quot; data-og-url=&quot;https://arxiv.org/abs/2211.14730v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/gKmeZ/dJMb9dHiSbV/o8piOrW8LSgfVHkWWt5Fs1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/buce14/dJMb83SdEYu/WtdN6DBqw05A97DUBIuoL1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2211.14730&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2211.14730&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/gKmeZ/dJMb9dHiSbV/o8piOrW8LSgfVHkWWt5Fs1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/buce14/dJMb83SdEYu/WtdN6DBqw05A97DUBIuoL1/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;A Time Series is Worth 64 Words: Long-term Forecasting with Transformers&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;We propose an efficient design of Transformer-based models for multivariate time series forecasting and self-supervised representation learning. It is based on two key components: (i) segmentation of time series into subseries-level patches which are serve&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 트랜스포머는 LTSF에 별로다 (LTSF-Linear (DLinear) 논문) 반박&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;&amp;rarr; 트랜스포머도 제대로 쓰면 선형 모델보다 훨씬 좋다 (Patch TST)&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;PatchTST = Patch Time Series Transform&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;= &lt;b&gt;패치단위&lt;/b&gt;(여러시점)로 처리 + 변수 독립적(&lt;b&gt;Channel Independence&lt;/b&gt;)&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;제목 의미&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;A TIME SERIES IS WORTH 64 WORDS&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 영미권 숙어 패러디: &amp;ldquo;A picture is worth a thousand words&amp;rdquo; (한 장의 그림이 천 마디 말의 가치가 있다)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;rarr; 시계열에서 64개의 말( = &lt;b&gt;패치(Patch&lt;/b&gt;))이 가치가 있다&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt; Vision Transformer (ViT) 논문에서 착안&amp;nbsp;&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;-&amp;gt;&lt;b&gt; An Image is Worth 16x16 Words&lt;/b&gt;: Transformers for Image Recognition at Scale (Dosovitskiy et al., ICLR 2021)&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;-&amp;gt; ViT가 이미지를 픽셀 단위가 아닌 &lt;b&gt;패치 단위로 분할&lt;/b&gt;하는 방식에서 착안&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt; 1. SUMMARIZE&lt;/b&gt;&lt;/h2&gt;
&lt;table id=&quot;2e2bd201-015f-8056-945b-e98d9a54c46a&quot; style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style12&quot;&gt;
&lt;tbody&gt;
&lt;tr id=&quot;2e2bd201-015f-802b-9c52-d4ac0b380786&quot;&gt;
&lt;td id=&quot;_SU&amp;#96;&quot; style=&quot;width: 12.907%;&quot;&gt;&lt;b&gt;항목&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;]^&amp;#96;M&quot; style=&quot;width: 87.0931%;&quot;&gt;&lt;b&gt;핵심 내용&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e2bd201-015f-8009-9d6c-e819455e67ae&quot;&gt;
&lt;td id=&quot;_SU&amp;#96;&quot; style=&quot;width: 12.907%;&quot;&gt;&lt;b&gt;Problem&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;]^&amp;#96;M&quot; style=&quot;width: 87.0931%;&quot;&gt;기존 논문(&lt;b&gt;Are Transformers Effective for Time Series Forecasting? - &lt;/b&gt;LTSF-Linear제안) 에서 LTSF에서 &lt;b&gt;Transformer가 별로임을 주장&lt;/b&gt;&lt;br /&gt;- 기존 Transformer는 &lt;b&gt;Point-wise&lt;/b&gt; 방식(데이터 포인트 하나씩 입력)을 사용하여 로컬한 의미 정보를 잃고, 시퀀스 길이가 길어질수록 계산 복잡도가 기하급수적으로 증가&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e2bd201-015f-80bd-9c1a-f8ba652f7148&quot;&gt;
&lt;td id=&quot;_SU&amp;#96;&quot; style=&quot;width: 12.907%;&quot;&gt;&lt;b&gt;Method&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;]^&amp;#96;M&quot; style=&quot;width: 87.0931%;&quot;&gt;&lt;b&gt;PatchTST (Patching + Transformer)&lt;/b&gt;&lt;br /&gt;&amp;bull; &lt;b&gt;Patching:&lt;/b&gt; 단일 데이터 포인트보다는 일정 구간(Patch)으로 나눠 시계열의 의미단위 학습&lt;br /&gt;&amp;bull; &lt;b&gt;Channel Independence(CI):&lt;/b&gt; 각 변수를 &lt;b&gt;별도의 샘플처럼 처리&lt;/b&gt;하여 하나의 인코더를 공유, 다변량 데이터에서 변수 간 상관관계를 억지로 학습하기보다 변수별로 &lt;b&gt;독립적으로 학습&lt;/b&gt;하는 것이 더&lt;b&gt; 일반화 성능이 좋음&lt;/b&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e2bd201-015f-80d7-bb7d-c83ad3b27f9b&quot;&gt;
&lt;td id=&quot;_SU&amp;#96;&quot; style=&quot;width: 12.907%;&quot;&gt;&lt;b&gt;Results&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;]^&amp;#96;M&quot; style=&quot;width: 87.0931%;&quot;&gt;LTSF-Linear를 포함한 모든 기존 SOTA 모델을 추월&lt;br /&gt;특히 &lt;b&gt;Look-back window가 길어질수록&lt;/b&gt; 성능이 훨씬 더 좋아짐&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e2bd201-015f-8050-860d-e813d5e78ca4&quot;&gt;
&lt;td id=&quot;_SU&amp;#96;&quot; style=&quot;width: 12.907%;&quot;&gt;&lt;b&gt;Contribution&lt;/b&gt;&lt;/td&gt;
&lt;td id=&quot;]^&amp;#96;M&quot; style=&quot;width: 87.0931%;&quot;&gt;&lt;b&gt;Transformer가 LTSF에서 효과적임을 재입증&lt;br /&gt;&lt;/b&gt;시계열에서의 &lt;b&gt;Self-supervised learning&lt;/b&gt; 가능성 제시&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;h1&gt;&amp;nbsp;&lt;/h1&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;2. DETAIL&lt;/b&gt;&lt;/h2&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;1. Introduction&lt;/b&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Transformer가 다양한 분야에서 성공을 거두며 시계열 분석에도 적용되고 있음&lt;/li&gt;
&lt;li&gt;최근 연구(Are Transformers Effective for Time Series Forecasting?)에서 &lt;b&gt;단순한 선형 모델(LTSF-Linear)이 더 좋은 성능&lt;/b&gt;을 보여주며 &lt;b&gt;Transformer의 유용성에 의문을 제기&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;b&gt;PatchTST 기법 제안&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Patching (패칭)&lt;/b&gt;: 시계열 데이터를 단일 시점(point-wise)이 아닌 하위 시계열 수준의 패치(patch)로 분할하여 입력 토큰으로 사용
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;계산 및 메모리 사용량 감소&lt;/li&gt;
&lt;li&gt;더 긴 과거 기록(longer look-back window) 활용 능력 (실험증명)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Channel-independence (채널 독립성&lt;/b&gt;): 다변량 시계열에서 각 채널(단일 변량 시계열)을 독립적으로 처리하여 모든채널에서 동일한 임베딩 및 Transformer 가중치를 공유
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;기존에는 channel-mixing 방식 다수&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;self-supervised learning &amp;rarr; &lt;b&gt;representation learning, transfer learning 우수&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt; &lt;span data-token-index=&quot;0&quot;&gt;2. RELATED WORK&lt;/span&gt; &lt;/b&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Patch in Transformer-based Models&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Transformer 기반 다양한 분야&lt;/b&gt;에서 &lt;b&gt;Patch 기법&lt;/b&gt;이 유용하게 사용됨&lt;/li&gt;
&lt;li&gt;NLP - BERT, CV - VIT, Speech 등등&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Transformer-based Long-term Time Series Forecasting&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;기존 Attention 매커니즘에서 복잡도(complexity) 낮추기(n^2) + 예측 성능 향상 목적&lt;/li&gt;
&lt;li&gt;대부분 아키텍처들 &lt;b&gt;패치 중요성 무시(point-wise attention)&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;table id=&quot;2e2bd201-015f-8051-80ea-d45cfa052431&quot; style=&quot;border-collapse: collapse; width: 100%;&quot; border=&quot;1&quot; data-ke-align=&quot;alignLeft&quot; data-ke-style=&quot;style12&quot;&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td style=&quot;width: 26.8605%;&quot;&gt;&lt;b&gt; 모델 &lt;/b&gt;&lt;/td&gt;
&lt;td style=&quot;width: 73.0233%;&quot;&gt;주요 메커니즘&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e2bd201-015f-80fc-b8b3-c041db8a8689&quot;&gt;
&lt;td id=&quot;[bjR&quot; style=&quot;width: 26.8605%;&quot;&gt;&lt;b&gt;LogTrans&lt;/b&gt; (Li et al., 2019)&lt;/td&gt;
&lt;td id=&quot;Thu&amp;gt;&quot; style=&quot;width: 73.0233%;&quot;&gt;컨볼루션(convolutional) 기반 self-attention layer, LogSparse design&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e2bd201-015f-8038-8287-cafad0b00d80&quot;&gt;
&lt;td id=&quot;[bjR&quot; style=&quot;width: 26.8605%;&quot;&gt;&lt;b&gt;Informer&lt;/b&gt; (Zhou et al., 2021)&lt;/td&gt;
&lt;td id=&quot;Thu&amp;gt;&quot; style=&quot;width: 73.0233%;&quot;&gt;ProbSparse self-attention, distilling 기법 &amp;rarr; 중요 key 추출&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e2bd201-015f-800c-ad6d-ec7fb59505ee&quot;&gt;
&lt;td id=&quot;[bjR&quot; style=&quot;width: 26.8605%;&quot;&gt;&lt;b&gt;Autoformer&lt;/b&gt; (Wu et al., 2021)&lt;/td&gt;
&lt;td id=&quot;Thu&amp;gt;&quot; style=&quot;width: 73.0233%;&quot;&gt;전통 시계열 분석 기법에서 차용한 decomposition and auto-correlation 아이디어&lt;br /&gt;&amp;rarr; 수동적(handcrafted) 설계, semantic 정보 얻지X&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e2bd201-015f-8097-b02f-cbada429fc14&quot;&gt;
&lt;td id=&quot;[bjR&quot; style=&quot;width: 26.8605%;&quot;&gt;&lt;b&gt;FEDformer&lt;/b&gt; (Zhou et al., 2022)&lt;/td&gt;
&lt;td id=&quot;Thu&amp;gt;&quot; style=&quot;width: 73.0233%;&quot;&gt;푸리에(Fourier) 기반 구조 &amp;rarr; 선형 복잡도&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e2bd201-015f-805c-90ef-e2c5b45b6232&quot;&gt;
&lt;td id=&quot;[bjR&quot; style=&quot;width: 26.8605%;&quot;&gt;&lt;b&gt;Pyraformer&lt;/b&gt; (Liu et al., 2022)&lt;/td&gt;
&lt;td id=&quot;Thu&amp;gt;&quot; style=&quot;width: 73.0233%;&quot;&gt;pyramidal attention module, intra-scale, inter-scale 연결 &amp;rarr; 선형 복잡도&lt;/td&gt;
&lt;/tr&gt;
&lt;tr id=&quot;2e2bd201-015f-80ac-8ca3-c36a11ddbd04&quot;&gt;
&lt;td id=&quot;[bjR&quot; style=&quot;width: 26.8605%;&quot;&gt;&lt;b&gt;Triformer&lt;/b&gt; (Cirstea et al., 2022)&lt;/td&gt;
&lt;td id=&quot;Thu&amp;gt;&quot; style=&quot;width: 73.0233%;&quot;&gt;patch attention 제안&lt;br /&gt;&amp;rarr; 단지 pseudo timestam를 쿼리로 사용하여 복잡도 줄임&lt;br /&gt;&amp;rarr; 패치 자체 입력단위X, semantic importance 포착X&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Time Series Representation Learning&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;다양한 &lt;b&gt;non-Transformer 기반&lt;/b&gt; TS Representation Learning 제안됨
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Franceschi et al., 2019, Tonekaboni et al., 2021, Yang &amp;amp; Hong, 2022, Yue et al., 2022&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Transformer 기반&lt;/b&gt; TS Representation Learning도 시도됨, 아직 잠재력 발휘되지 않음
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Time Series Transformer (TST) - Zerveas et al., 2021 , TS-TCC - Zerveas et al., 2021&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;3. PROPOSED METHOD&lt;/b&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;look-back window L&lt;/b&gt; : (x1, ..., xL)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;forecast T future values&lt;/b&gt; : (xL+1, ..., xL+T )&lt;/li&gt;
&lt;li&gt;&lt;b&gt;core architecture&lt;/b&gt; : vanilla Transformer encoder&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;3-1. MODEL STRUCTURE&lt;/b&gt;&lt;/h4&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;780&quot; data-origin-height=&quot;617&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bkG2Eb/dJMb99SK8sx/Y4mt1yWe1jAAiYTB63jD5k/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bkG2Eb/dJMb99SK8sx/Y4mt1yWe1jAAiYTB63jD5k/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bkG2Eb/dJMb99SK8sx/Y4mt1yWe1jAAiYTB63jD5k/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbkG2Eb%2FdJMb99SK8sx%2FY4mt1yWe1jAAiYTB63jD5k%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;643&quot; height=&quot;509&quot; data-origin-width=&quot;780&quot; data-origin-height=&quot;617&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Forward Process&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Input:&lt;/b&gt; 다변량(Multivariate) 시계열&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Process&lt;/b&gt;: M개의 단변량(univariate) 시계열로 분리 &amp;rarr; &lt;b&gt;Transformer 백본&lt;/b&gt;에 개별적으로 &lt;b&gt;독립적으로 입력&lt;/b&gt; (모든 채널이 동일한 Transformer 가중치를 공유하며 학습 및 추론)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Output:&lt;/b&gt; 각 단변량 시계열에 대해 &lt;b&gt;독립적으로 예측&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Patching&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;L: input 길이(look-back window)&lt;/li&gt;
&lt;li&gt;P: 패치 길이&lt;/li&gt;
&lt;li&gt;S: stride, 연속적 두 패치 사이의 겹치지 않는 영역의 길이(이동 길이)&lt;/li&gt;
&lt;li&gt;N: 패치 총 개수
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;마지막 패치를 만들기 위해(길이 맞추기 위함) 원본 시퀀스 끝에 S개만큼의 마지막 값을 반복하여 패딩(padding)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;$N = \left\lfloor \frac{L-P}{S} \right\rfloor + 2$&lt;/li&gt;
&lt;li&gt;&lt;b&gt;효과&lt;/b&gt;: 트랜스포머의 입력 토큰(input token) 수 감소
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;기존 트랜스포머 입력 토큰 수: L&lt;/li&gt;
&lt;li&gt;패치 후, 입력 토큰 수: $N&amp;asymp;L/S$&lt;/li&gt;
&lt;li&gt;연산 복잡도, 메모리 사용량 제곱(quadratically) 만큼 감소
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;O(N^2) &amp;rarr; O((L/S)^2)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;933&quot; data-origin-height=&quot;220&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/degIBB/dJMcai9WMBZ/80Q0SFwoKSN3pojo75tEo1/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/degIBB/dJMcai9WMBZ/80Q0SFwoKSN3pojo75tEo1/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/degIBB/dJMcai9WMBZ/80Q0SFwoKSN3pojo75tEo1/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FdegIBB%2FdJMcai9WMBZ%2F80Q0SFwoKSN3pojo75tEo1%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;933&quot; height=&quot;220&quot; data-origin-width=&quot;933&quot; data-origin-height=&quot;220&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;DSBA - &lt;b&gt;Paper Review 세미나 발표자료 참고&lt;/b&gt;&lt;/p&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://dsba.snu.ac.kr/seminar/?mod=document&amp;amp;uid=2670&quot;&gt;https://dsba.snu.ac.kr/seminar/?mod=document&amp;amp;uid=2670&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1769750103372&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;article&quot; data-og-title=&quot;[Paper Review] A Time Series Is Worth 64 Words: Long-Term Forecasting With Transformers&quot; data-og-description=&quot;[ 발표 요약 ] 1. Topic A Time Series Is Worth 64 Words: Long-Term Forecasting With Transformers &amp;nbsp; 2. Overview 이번 세미나 시간에는 ICLR 2023에 accept 된 long-term time series forecasting(LTSF) 방법론 PatchTST를 공유하고자 한다. &quot; data-og-host=&quot;dsba.snu.ac.kr&quot; data-og-source-url=&quot;https://dsba.snu.ac.kr/seminar/?mod=document&amp;amp;uid=2670&quot; data-og-url=&quot;https://dsba.snu.ac.kr/?kboard_content_redirect=2670&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/foItG/dJMb9jOhPTs/8NZFcL7jMhluKhVukozxZ1/img.png?width=1072&amp;amp;height=541&amp;amp;face=0_0_1072_541&quot;&gt;&lt;a href=&quot;https://dsba.snu.ac.kr/seminar/?mod=document&amp;amp;uid=2670&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://dsba.snu.ac.kr/seminar/?mod=document&amp;amp;uid=2670&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/foItG/dJMb9jOhPTs/8NZFcL7jMhluKhVukozxZ1/img.png?width=1072&amp;amp;height=541&amp;amp;face=0_0_1072_541');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;[Paper Review] A Time Series Is Worth 64 Words: Long-Term Forecasting With Transformers&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;[ 발표 요약 ] 1. Topic A Time Series Is Worth 64 Words: Long-Term Forecasting With Transformers &amp;nbsp; 2. Overview 이번 세미나 시간에는 ICLR 2023에 accept 된 long-term time series forecasting(LTSF) 방법론 PatchTST를 공유하고자 한다.&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;dsba.snu.ac.kr&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Transformer Encoder&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Transformer의 Multi-Head Attention 수행&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Loss Function&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;MSE loss&lt;/li&gt;
&lt;li&gt;각 시계열 채널(univariate series)에 대한 손실을 계산한 후, 모든 &lt;b&gt;M개 시계열&lt;/b&gt;에 대해 &lt;b&gt;평균&lt;/b&gt;하여 최종 손실을 구함&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;&lt;figure class=&quot;imageblock alignCenter&quot; data-ke-mobileStyle=&quot;widthOrigin&quot; data-origin-width=&quot;367&quot; data-origin-height=&quot;41&quot;&gt;&lt;span data-url=&quot;https://blog.kakaocdn.net/dn/bT94oW/dJMcagYDgNF/a1cHTParDS9tnvtuhROZS0/img.png&quot; data-phocus=&quot;https://blog.kakaocdn.net/dn/bT94oW/dJMcagYDgNF/a1cHTParDS9tnvtuhROZS0/img.png&quot;&gt;&lt;img src=&quot;https://blog.kakaocdn.net/dn/bT94oW/dJMcagYDgNF/a1cHTParDS9tnvtuhROZS0/img.png&quot; srcset=&quot;https://img1.daumcdn.net/thumb/R1280x0/?scode=mtistory2&amp;fname=https%3A%2F%2Fblog.kakaocdn.net%2Fdn%2FbT94oW%2FdJMcagYDgNF%2Fa1cHTParDS9tnvtuhROZS0%2Fimg.png&quot; onerror=&quot;this.onerror=null; this.src='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png'; this.srcset='//t1.daumcdn.net/tistory_admin/static/images/no-image-v1.png';&quot; loading=&quot;lazy&quot; width=&quot;367&quot; height=&quot;41&quot; data-origin-width=&quot;367&quot; data-origin-height=&quot;41&quot;/&gt;&lt;/span&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Instance Normalization&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 단변량(univariate) 시계열을 &lt;b&gt;독립적으로 정규화&lt;/b&gt;(평균0, 표준편차1)&lt;/li&gt;
&lt;li&gt;정규화 후, 패치분할 &amp;rarr; 모델 입력 &amp;rarr; 원래 스케일 복원하여 출력&lt;/li&gt;
&lt;li&gt;훈련, 테스트 데이터 간 &lt;b&gt;분포 변화(distribution shift) 효과를 완화&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;3-2. REPRESENTATION LEARNING&lt;/b&gt;&lt;/h4&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;b&gt;Masked Autoencoder&lt;/b&gt; : 입력 시퀀스의 일부를 숨기고(마스크 처리), 모델은 숨겨진 내용을 복원하도록 학습&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;기존 연구&lt;/b&gt; &amp;rarr; &lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;개별 시점(single time step) 마스킹&lt;/b&gt;&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;A Transformer-based Framework for Multivariate Time Series Representation Learning (Zerveas et al., 2021)&lt;/li&gt;
&lt;li&gt;&lt;b&gt;인접한 시점의 값으로 보간&lt;/b&gt;하여 쉽게 &lt;b&gt;유추&lt;/b&gt;가능
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;무작위 전략(randomization strategies)으로 해결시도&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;너무 많은 &lt;b&gt;매개변수&lt;/b&gt;로 인해 학습 데이터가 부족할 때, &lt;b&gt;과적합&lt;/b&gt;되기 쉬움
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;각 time step(L)의 잠재 표현(D)을 미래 예측(T)과 채널 수(M)에 매핑&amp;rarr; 최종 출력 layer 매우 큰 파라미터 행렬(w) 필요 &amp;rarr; w = (L&amp;middot;D) X (T&amp;middot;M)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;PatchTST&lt;/b&gt; &amp;rarr; &lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;패치(patch) 단위 마스킹&lt;/b&gt;&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;최종 출력 layer 재구성 &amp;rarr; linear layer (D X P)&lt;/li&gt;
&lt;li&gt;겹치지 않는(non-overlapping) 패치
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;마스킹 된 패치 정보가 다른 패치에 포함되지 않게&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;무작위 마스킹&lt;/li&gt;
&lt;li&gt;마스킹된 패치 복원 학습시, MSE loss 최소화 학습&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;4. EXPERIMENTS&lt;/b&gt;&lt;/h3&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4-1. LONG-TERM TIME SERIES FORECASTING&lt;/b&gt;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Datasets: 8개 (Weather, Traffic, Electricity, ETTh1, ETTh2, ETTm1, ETTm2)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Weather, Traffic, Electricity &amp;rarr; 대규모 데이터셋&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Baselines
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Transformer 기반 모델: Informer, Autoformer, FEDformer, Pyraformer, LogTrans&lt;/li&gt;
&lt;li&gt;non-Transformer 기반 모델: DLinear&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Experimental Settings
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;예측 길이
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;ILI 데이터셋 : 24, 36, 48, 60&lt;/li&gt;
&lt;li&gt;나머지: 96, 192, 336, 720&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Look-back Window (L)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Transformer 기반 모델: 96&lt;/li&gt;
&lt;li&gt;non-Transformer 기반 모델(DLinear) : 336
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;이전 DLinear논문에서 언급 - Transformer 기반 모델 가장 성능 좋았던 길이&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Model Variants: 2가지 버전 PatchTST
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;PatchTST/64 - Input patch(64), L(512)&lt;/li&gt;
&lt;li&gt;PatchTST/42 - Input patch(42), L(336)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Results&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;PatchTST 모델&lt;/b&gt;이 Baselines(Transformer 기반 및 DLinear)에 비해 &lt;b&gt;우수한 성능&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;최고 성능의 &lt;b&gt;Transformer 기반 모델&lt;/b&gt; 비교
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;PatchTST/64는 MSE에서 21.0%, MAE에서 16.7%의 전반적인 감소&lt;/li&gt;
&lt;li&gt;PatchTST/42는 MSE에서 20.2%, MAE에서 16.4%의 감소&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;DLinear&lt;/b&gt; 비교
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;특히 &lt;b&gt;큰 데이터셋&lt;/b&gt;(Weather, Traffic, Electricity)에서 &lt;b&gt;성능차이 큼&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4-2. REPRESENTATION LEARNING&lt;/b&gt;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;experimental Settings
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;자기지도, 사전 학습&lt;/b&gt;(Self-supervised Pre-training)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;non-overlapped patch&lt;/li&gt;
&lt;li&gt;Look-back Window (L): 512&lt;/li&gt;
&lt;li&gt;패치 길이(P): 12 (총 42개의 패치 생성)&lt;/li&gt;
&lt;li&gt;마스킹 비율(Masking ratio): 40%&lt;/li&gt;
&lt;li&gt;&lt;b&gt;100 epoch&lt;/b&gt; self-supervised &lt;b&gt;pre-training&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Evaluation&lt;/b&gt; &amp;rarr; &lt;b&gt;사전 학습 후&lt;/b&gt;, 평가 위해 2가지 방식 이용하여 &lt;b&gt;지도학습(Supervised Learning)&lt;/b&gt; 수행
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;Linear Probing - 마지막 레이어(모델 Head)만 20 Epoch 학습 (다른 부분은 freezing)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;vs supervised &amp;rarr; Pre-training에 따른 representation learning 능력 비교&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;End-to-end &lt;b&gt;Fine-tuning&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;vs Linear Probing &amp;rarr; Fine-tuning 차이(전체 vs 일부) 능력 비교&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;Linear Probing 10 epoch &amp;rarr; 마지막 레이어(모델 Head)만 10 Epoch 학습 (다른 부분은 freezing)&lt;/li&gt;
&lt;li&gt;전체 20 Epoch 학습&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Results&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;ol style=&quot;list-style-type: decimal;&quot; data-ke-list-type=&quot;decimal&quot;&gt;
&lt;li&gt;&lt;b&gt;Comparison with Supervised Methods&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Self-supervised(&lt;b&gt;Fine-tuning vs Linear Probing) vs Supervised&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;큰 데이터셋 대상(Weather, Traffic, Electricity)&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;Self-supervised &lt;b&gt;Pre-training&lt;/b&gt;이 효과적 &amp;rarr; &lt;b&gt;representation learning 효과 확인&lt;/b&gt;&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Fine-tuning &amp;gt; Supervised&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;PatchTST의 우수한 효과&lt;/b&gt;&lt;/span&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;다른 트랜스포머 기반 모델들보다 뛰어난 성능&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Transfer Learning&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;pre-trained&lt;/b&gt;: Electricity 데이터셋&lt;/li&gt;
&lt;li&gt;&lt;b&gt;fine-tuning&lt;/b&gt;: Weather, Traffic 데이터셋&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;PatchTST가 baselines(Transformer 기반 모델) 보다 우수한 성능&lt;/b&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Comparison with Other Self-supervised Method&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;PatchTST self-supervised learning 성능과 다른 time-series representation learning 모델과 비교
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;time-series representation learning 모델: BTSF, TS2Vec, TNC, TS-TCC&lt;/li&gt;
&lt;li&gt;데이터셋: ETTh1&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;Self-supervised, Transferred 둘다 PatchTST가 다른 representation learning 모델보다 우수&lt;/b&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4-3. ABLATION STUDY&lt;/b&gt;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Patching and Channel-independence&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;PatchTST vs FEDformer(기존 Transformer 기반 모델 중 SOTA모델)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;FEDformer &amp;rarr; channel-mixing(변수간 상관성 고려)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;비교 PatchTST( P+CI / P / CI / Original) / FEDformer&lt;/li&gt;
&lt;li&gt;P(Patching ), CI(Channel-independence) &lt;b&gt;둘다 적용한 PatchTST가 가장 우수한 성능&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;Patching, Channel-independence&lt;/b&gt; &lt;b&gt;기법의 우수성 입증&lt;/b&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;Varying Look-back Window&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;기존 논문 : 기존 Transformer 기반 LTSF 모델들은 더 긴 look-back window(L)의 이점을 제대로 활용하지 못함
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;Transformer 기반 모델&lt;/b&gt;들은 큰 크기의 look-back window에서 오히려 성능이 하락하여 &lt;b&gt;temporal relation을 잘 추출하지 못하는 경향&lt;/b&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;look-back window(L)이 길어질수록 MSE 감소
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;PatchTST가 긴 과거 시퀀스로부터 temporal relation 효과적 추출, 예측 성능 향상&lt;/b&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h4 data-ke-size=&quot;size20&quot;&gt;&lt;b&gt;4-4. Appendex&lt;/b&gt;&lt;/h4&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;CHANNEL-INDEPENDENCE ANALYSIS&lt;/b&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Channel-Independence vs Channel-Mixing
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;&lt;b&gt;Adaptability&lt;/b&gt;&lt;/span&gt;: Channel-Independence &amp;rarr; 각 채널이 자신에게 적합한 어텐션 맵(attention map) 학습 &lt;b&gt;(유사한 패턴이라도 다른 어텐션맵 특징 시각화)&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;&lt;span style=&quot;background-color: #f3c000;&quot;&gt;Channel-Mixing 모델은 오버피팅 현상 발생 &amp;rarr; &lt;b&gt;Channel-Independence의 더 좋은 일반화 능력&lt;/b&gt;&lt;/span&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h3 data-ke-size=&quot;size23&quot;&gt;&lt;b&gt;5. CONCLUSION AND FUTURE WORK&lt;/b&gt;&lt;/h3&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;시계열 예측 위한 Transformer 구조 제안 (PatchTST)
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;핵심 기법:&lt;/b&gt; 패칭(patching), channel-independent(CI)&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;우수한 성능
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Supervised Learning - 기존 Transformer 기반 모델들 보다 우수&lt;/li&gt;
&lt;li&gt;Self-supervised Learning&lt;/li&gt;
&lt;li&gt;Transfer Learning&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;3. Implementation&lt;/b&gt;&lt;/h2&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&lt;a href=&quot;https://github.com/yuqinie98/PatchTST?tab=readme-ov-file&quot;&gt;https://github.com/yuqinie98/PatchTST?tab=readme-ov-file&lt;/a&gt;&lt;/p&gt;
&lt;figure id=&quot;og_1769750320923&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;object&quot; data-og-title=&quot;GitHub - yuqinie98/PatchTST: An offical implementation of PatchTST: &amp;quot;A Time Series is Worth 64 Words: Long-term Forecasting with&quot; data-og-description=&quot;An offical implementation of PatchTST: &amp;quot;A Time Series is Worth 64 Words: Long-term Forecasting with Transformers.&amp;quot; (ICLR 2023) https://arxiv.org/abs/2211.14730 - yuqinie98/PatchTST&quot; data-og-host=&quot;github.com&quot; data-og-source-url=&quot;https://github.com/yuqinie98/PatchTST?tab=readme-ov-file&quot; data-og-url=&quot;https://github.com/yuqinie98/PatchTST&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/dwXgzq/dJMb8VNqay0/O85OUx22tdqK449k0JyLAk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/dLdmCF/dJMb9bvW9AW/w90qk2ybwKPl44hxyQtmg1/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600&quot;&gt;&lt;a href=&quot;https://github.com/yuqinie98/PatchTST?tab=readme-ov-file&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://github.com/yuqinie98/PatchTST?tab=readme-ov-file&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/dwXgzq/dJMb8VNqay0/O85OUx22tdqK449k0JyLAk/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600,https://scrap.kakaocdn.net/dn/dLdmCF/dJMb9bvW9AW/w90qk2ybwKPl44hxyQtmg1/img.png?width=1200&amp;amp;height=600&amp;amp;face=0_0_1200_600');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;GitHub - yuqinie98/PatchTST: An offical implementation of PatchTST: &quot;A Time Series is Worth 64 Words: Long-term Forecasting with&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;An offical implementation of PatchTST: &quot;A Time Series is Worth 64 Words: Long-term Forecasting with Transformers.&quot; (ICLR 2023) https://arxiv.org/abs/2211.14730 - yuqinie98/PatchTST&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;github.com&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;예시 데이터셋을 이용하여 실험
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Supervised Learning Transformer 후 예측&lt;/li&gt;
&lt;li&gt;Self-supervised Learning Transformer &amp;rarr; 전체 파인튜닝 후 예측&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;h2 data-ke-size=&quot;size26&quot;&gt;&lt;b&gt;4. Discussion&lt;/b&gt;&lt;/h2&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;현재 PatchTST모델 &amp;rarr; &lt;b&gt;Channel Independence&lt;/b&gt; 방식
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;직관적으로 &lt;b&gt;변수간 상관성&lt;/b&gt;이 모델 예측에 중요할 것이라고 생각됨&lt;/li&gt;
&lt;li&gt;&lt;b&gt;channel-mixing&lt;/b&gt;으로 성능 끌어올린 방법론이 있는지&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;각 패치 길이를 동일하게 설정함
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;패치(P)와 스트라이드(S) 길이를&lt;/b&gt; &lt;b&gt;동적으로 변경&lt;/b&gt;해서 모델에 반영한다면?
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;변동이 큰 시퀀스 부분은 패치길이를 짧게? / 주기성과 유사하게 패치개수만큼 분할 등
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;시계열 학습 불알정할 가능성 매우 큼 Like GAN idea 유사&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;EntroPE: Entropy-Guided Dynamic Patch Encoder for Time Series Forecasting&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;(CIKM 2025)&lt;/li&gt;
&lt;li&gt;시계열의 엔트로피 변화를 감지해 Patch를 자동으로 조절하는 모델&lt;/li&gt;
&lt;li&gt;&lt;a href=&quot;https://arxiv.org/html/2509.26157v1&quot;&gt;https://arxiv.org/html/2509.26157v1&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;PatchTST + 변수 상관관계까지 고려(&lt;b&gt;Channel Attention&lt;/b&gt; 레이어) = CT-PatchTST (Channel-Time PatchTST&lt;/li&gt;
&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2501.08620&quot;&gt;https://arxiv.org/abs/2501.08620&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;figure id=&quot;og_1769750449236&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;EntroPE: Entropy-Guided Dynamic Patch Encoder for Time Series Forecasting&quot; data-og-description=&quot;EntroPE: Entropy-Guided Dynamic Patch Encoder for Time Series Forecasting Sachith Abeywickrama1, 2 &amp;emsp;Emadeldeen Eldele3, 2 &amp;emsp;Min Wu2 &amp;emsp;Xiaoli Li2, 4 &amp;emsp;Chau Yuen1 1School of Electrical and Electronics Engineering, Nanyang Technological University, Singa&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/html/2509.26157v1&quot; data-og-url=&quot;https://arxiv.org/html/2509.26157v1&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://arxiv.org/html/2509.26157v1&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/html/2509.26157v1&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;EntroPE: Entropy-Guided Dynamic Patch Encoder for Time Series Forecasting&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;EntroPE: Entropy-Guided Dynamic Patch Encoder for Time Series Forecasting Sachith Abeywickrama1, 2 &amp;emsp;Emadeldeen Eldele3, 2 &amp;emsp;Min Wu2 &amp;emsp;Xiaoli Li2, 4 &amp;emsp;Chau Yuen1 1School of Electrical and Electronics Engineering, Nanyang Technological University, Singa&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;figure id=&quot;og_1769750448660&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;CT-PatchTST: Channel-Time Patch Time-Series Transformer for Long-Term Renewable Energy Forecasting&quot; data-og-description=&quot;Accurate forecasting of renewable energy generation is fundamental to enhancing the dynamic performance of modern power grids, especially under high renewable penetration. This paper presents Channel-Time Patch Time-Series Transformer (CT-PatchTST), a nove&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2501.08620&quot; data-og-url=&quot;https://arxiv.org/abs/2501.08620v4&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/PlOBK/dJMb8YXGjNG/gKSCc6KVO3GtizoCQNJ6Ck/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/EPPpU/dJMb8863LQg/O5dnTLEvsTcjFwlfqLFFsK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2501.08620&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2501.08620&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/PlOBK/dJMb8YXGjNG/gKSCc6KVO3GtizoCQNJ6Ck/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/EPPpU/dJMb8863LQg/O5dnTLEvsTcjFwlfqLFFsK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;CT-PatchTST: Channel-Time Patch Time-Series Transformer for Long-Term Renewable Energy Forecasting&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Accurate forecasting of renewable energy generation is fundamental to enhancing the dynamic performance of modern power grids, especially under high renewable penetration. This paper presents Channel-Time Patch Time-Series Transformer (CT-PatchTST), a nove&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;현재 PatchTST모델 &amp;rarr; &lt;b&gt;Channel Independence&lt;/b&gt; 방식
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;직관적으로 &lt;b&gt;변수간 상관성&lt;/b&gt;이 모델 예측에 중요할 것이라고 생각됨&lt;/li&gt;
&lt;li&gt;&lt;b&gt;channel-mixing&lt;/b&gt;으로 성능 끌어올린 방법론이 있는지&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;각 패치 길이를 동일하게 설정
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;&lt;b&gt;패치(P)와 스트라이드(S) 길이를&lt;/b&gt; &lt;b&gt;동적으로 변경&lt;/b&gt;해서 모델에 반영한다면?
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;변동이 큰 시퀀스 부분은 패치길이를 짧게? / 주기성과 유사하게 패치개수만큼 분할 등
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;시계열 학습 불알정할 가능성 매우 큼 Like GAN idea 유사&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;b&gt;EntroPE: Entropy-Guided Dynamic Patch Encoder for Time Series Forecasting&lt;/b&gt;&lt;/li&gt;
&lt;li&gt;(CIKM 2025)&lt;/li&gt;
&lt;li&gt;시계열의 엔트로피 변화를 감지해 Patch를 자동으로 조절하는 모델&lt;/li&gt;
&lt;li&gt;&lt;a href=&quot;https://arxiv.org/html/2509.26157v1&quot;&gt;https://arxiv.org/html/2509.26157v1&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;PatchTST + 변수 상관관계까지 고려(&lt;b&gt;Channel Attention&lt;/b&gt; 레이어) = CT-PatchTST (Channel-Time PatchTST)&lt;/li&gt;
&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2501.08620&quot;&gt;https://arxiv.org/abs/2501.08620&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;figure id=&quot;og_1769750347359&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;EntroPE: Entropy-Guided Dynamic Patch Encoder for Time Series Forecasting&quot; data-og-description=&quot;EntroPE: Entropy-Guided Dynamic Patch Encoder for Time Series Forecasting Sachith Abeywickrama1, 2 &amp;emsp;Emadeldeen Eldele3, 2 &amp;emsp;Min Wu2 &amp;emsp;Xiaoli Li2, 4 &amp;emsp;Chau Yuen1 1School of Electrical and Electronics Engineering, Nanyang Technological University, Singa&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/html/2509.26157v1&quot; data-og-url=&quot;https://arxiv.org/html/2509.26157v1&quot; data-og-image=&quot;&quot;&gt;&lt;a href=&quot;https://arxiv.org/html/2509.26157v1&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/html/2509.26157v1&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url();&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;EntroPE: Entropy-Guided Dynamic Patch Encoder for Time Series Forecasting&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;EntroPE: Entropy-Guided Dynamic Patch Encoder for Time Series Forecasting Sachith Abeywickrama1, 2 &amp;emsp;Emadeldeen Eldele3, 2 &amp;emsp;Min Wu2 &amp;emsp;Xiaoli Li2, 4 &amp;emsp;Chau Yuen1 1School of Electrical and Electronics Engineering, Nanyang Technological University, Singa&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;
&lt;figure id=&quot;og_1769750346032&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;CT-PatchTST: Channel-Time Patch Time-Series Transformer for Long-Term Renewable Energy Forecasting&quot; data-og-description=&quot;Accurate forecasting of renewable energy generation is fundamental to enhancing the dynamic performance of modern power grids, especially under high renewable penetration. This paper presents Channel-Time Patch Time-Series Transformer (CT-PatchTST), a nove&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2501.08620&quot; data-og-url=&quot;https://arxiv.org/abs/2501.08620v4&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/PlOBK/dJMb8YXGjNG/gKSCc6KVO3GtizoCQNJ6Ck/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/EPPpU/dJMb8863LQg/O5dnTLEvsTcjFwlfqLFFsK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2501.08620&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2501.08620&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/PlOBK/dJMb8YXGjNG/gKSCc6KVO3GtizoCQNJ6Ck/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/EPPpU/dJMb8863LQg/O5dnTLEvsTcjFwlfqLFFsK/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;CT-PatchTST: Channel-Time Patch Time-Series Transformer for Long-Term Renewable Energy Forecasting&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Accurate forecasting of renewable energy generation is fundamental to enhancing the dynamic performance of modern power grids, especially under high renewable penetration. This paper presents Channel-Time Patch Time-Series Transformer (CT-PatchTST), a nove&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;P-sLSTM
&lt;ul style=&quot;list-style-type: disc;&quot; data-ke-list-type=&quot;disc&quot;&gt;
&lt;li&gt;Paper: Unlocking the Power of LSTM for Long Term Time Series Forecasting&lt;/li&gt;
&lt;li&gt;PatchTST의 성공 공식(패치+채널 독립)을 LSTM에 적용했더니, 트랜스포머보다 가볍고 성능도 좋았음&lt;/li&gt;
&lt;li&gt;&lt;a href=&quot;https://arxiv.org/abs/2408.10006&quot; target=&quot;_blank&quot; rel=&quot;noopener&amp;nbsp;noreferrer&quot;&gt;https://arxiv.org/abs/2408.10006&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;figure id=&quot;og_1770363118342&quot; contenteditable=&quot;false&quot; data-ke-type=&quot;opengraph&quot; data-ke-align=&quot;alignCenter&quot; data-og-type=&quot;website&quot; data-og-title=&quot;Unlocking the Power of LSTM for Long Term Time Series Forecasting&quot; data-og-description=&quot;Traditional recurrent neural network architectures, such as long short-term memory neural networks (LSTM), have historically held a prominent role in time series forecasting (TSF) tasks. While the recently introduced sLSTM for Natural Language Processing (&quot; data-og-host=&quot;arxiv.org&quot; data-og-source-url=&quot;https://arxiv.org/abs/2408.10006&quot; data-og-url=&quot;https://arxiv.org/abs/2408.10006v2&quot; data-og-image=&quot;https://scrap.kakaocdn.net/dn/lDInA/dJMb9eTK9B4/iaW1d6dUCud5EozCgTgwi1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/3HRjx/dJMb9b3NABe/IKZGHUnwFvNLo6QDHtpEVk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000&quot;&gt;&lt;a href=&quot;https://arxiv.org/abs/2408.10006&quot; target=&quot;_blank&quot; rel=&quot;noopener&quot; data-source-url=&quot;https://arxiv.org/abs/2408.10006&quot;&gt;
&lt;div class=&quot;og-image&quot; style=&quot;background-image: url('https://scrap.kakaocdn.net/dn/lDInA/dJMb9eTK9B4/iaW1d6dUCud5EozCgTgwi1/img.png?width=1200&amp;amp;height=700&amp;amp;face=0_0_1200_700,https://scrap.kakaocdn.net/dn/3HRjx/dJMb9b3NABe/IKZGHUnwFvNLo6QDHtpEVk/img.png?width=1000&amp;amp;height=1000&amp;amp;face=0_0_1000_1000');&quot;&gt;&amp;nbsp;&lt;/div&gt;
&lt;div class=&quot;og-text&quot;&gt;
&lt;p class=&quot;og-title&quot; data-ke-size=&quot;size16&quot;&gt;Unlocking the Power of LSTM for Long Term Time Series Forecasting&lt;/p&gt;
&lt;p class=&quot;og-desc&quot; data-ke-size=&quot;size16&quot;&gt;Traditional recurrent neural network architectures, such as long short-term memory neural networks (LSTM), have historically held a prominent role in time series forecasting (TSF) tasks. While the recently introduced sLSTM for Natural Language Processing (&lt;/p&gt;
&lt;p class=&quot;og-host&quot; data-ke-size=&quot;size16&quot;&gt;arxiv.org&lt;/p&gt;
&lt;/div&gt;
&lt;/a&gt;&lt;/figure&gt;
&lt;p data-ke-size=&quot;size16&quot;&gt;&amp;nbsp;&lt;/p&gt;</description>
      <category>Paper review</category>
      <category>PatchTST</category>
      <category>tsf</category>
      <author>Hippo's data</author>
      <guid isPermaLink="true">https://hipposdata.tistory.com/154</guid>
      <comments>https://hipposdata.tistory.com/entry/Paper-review-PatchTST#entry154comment</comments>
      <pubDate>Fri, 30 Jan 2026 14:21:01 +0900</pubDate>
    </item>
  </channel>
</rss>