Popular Posts

[논문 리뷰] 3D Gaussian Splatting 이해하기
·
3D Vision
📌 3D Gaussian Splatting (3DGS) 이란?3D Gaussian Splatting for Real-Time Radiance Field Rendering / SIGGRAPH 20233D Gaussian Splatting(3DGS)은 복잡한 3D 장면을 수천에서 수백만 개의 3차원 가우시안(스플랫) 으로 표현하는 방식이다. 각 가우시안은 다음과 같은 정보를 갖는다.3D 위치 (x, y, z)크기 (scale 또는 covariance)회전 (orientation)색상 (RGB)불투명도 (alpha)뷰 방향 의존적인 특성 값이러한 점들을 화면 상에 투영하고, GPU에서 가우시안 형태로 부드럽게 퍼지게 만들어 실시간으로 이미지를 렌더링하는 것이 핵심이다. 마치 수많은 반투명한 비누방울이 공중에..
[AI/LLM] Transformer Attention 이해하기: Q, K, V의 역할과 동작 원리
·
Large-scale Model
LLM하면 transformer를 빼먹을 수 없고, 그 핵심 중 하나는 바로 어텐션 메커니즘이다. 이 메커니즘을 이해하면 트랜스포머가 어떻게 단어들 간의 관계를 학습하고 문맥을 파악하는지 알 수 있다. 특히, 트랜스포머에서 사용되는 Query (Q), Key (K), Value (V)는 어텐션이 어떻게 작동하는지 이해하는 데 아주 중요한 역할을 한다.1. Q, K, V: 정보 검색의 관점에서 본 개념 정의 Transformer의 Scaled Dot-Product Attention은 데이터베이스의 정보 검색(Information Retrieval) 시스템과 유사한 논리를 가진다. 입력 임베딩 벡터 $x$에 대해 학습 가능한 가중치 행렬 $W^Q, W^K, W^V$를 곱하여 세 가지 벡터를 생성한다.Quer..
Vision Transformer(ViT): 이미지 Transformer 이해하기
·
AI & ML
본 글은 Vision Transformer(ViT)의 핵심 개념을 기초부터 상세하게 설명한다. ViT가 이미지를 어떻게 토큰화하고, 실제 텐서 차원이 어떻게 변하는지까지 이해하기 쉽게 정리했다. 1. Vision Transformer (ViT)Vision Transformer(ViT)는 2020년 Google Research가 발표한 모델로, 이미지를 Transformer 구조로 직접 처리하는 첫 성공 사례이다. 발표 당시만 해도 Transformer는 자연어 처리에 특화된 모델로 여겨졌기 때문에, 이미지를 언어처럼 토큰 단위로 다뤄 self-attention으로 처리한다는 발상 자체가 매우 혁신적이었다. ViT는 이미지도 문장처럼 “순서가 있는 토큰 시퀀스”로 바라볼 수 있다는 점을 보여주었고, 이후 ..
[논문 리뷰] NeRF 간단 설명 & 원리 이해하기 | 새로운 방향에서 바라본 view를 생성하는 기술
·
3D Vision
- paper : NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis / ECCV2020 NeRF 논문이 공개된지도 시간이 꽤 흘렀는데, 2020 ECCV에서 공개됐을 때만 해도 굉장히 신기하고 획기적인 view synthesis 방법으로 관심을 받았지만, 여러 단점 때문에 실제 서비스에 적용되기는 쉽지 않았다. 하지만, 2023 CVPR에서는 2022년에 비해 radiance라는 단어의 사용이 80% 증가하고, NeRF의 경우 39% 증가했을 만큼 NeRF는 활발히 연구되고 있다. 특히 이젠 개념 증명을 넘어 veiw editing 이나 각종 application 연구가 진행되고 있다. 즉 NeRF가 이제 각종 서비스에 활용될만..
[AI/LLM] Transformer의 인코더와 디코더 쉽게 이해하기
·
Large-scale Model
Transformer 아키텍처는 크게 정보를 압축하고 이해하는 Encoder와, 이를 바탕으로 새로운 시퀀스를 생성하는 Decoder로 나뉜다. 각 컴포넌트의 수학적 설계 의도와 연산 특성, 그리고 이를 응용한 대표적인 모델군(BERT, T5, GPT)의 차이점을 정리해 본다.1. Encoder인코더는 입력 시퀀스 $X = {x_1, x_2, \dots, x_n}$의 각 토큰이 문장 내 다른 모든 토큰과 어떤 관계를 맺는지 파악하여, 풍부한 문맥이 담긴 잠재 벡터(Latent Vector)를 생성한다.① Multi-Head Self-Attention (MHSA)인코더의 핵심은 모든 위치의 토큰을 동시에 참조하는 Bi-directional(양방향) 연산이다. $h$개의 헤드를 사용하는 MHSA는 서로 다른..
[Gen AI] Diffusion Transformer (DiT) 완벽 이해하기!
·
Image•Video Generation
1. 인트로1.1 트랜스포머의 영향최근 딥러닝에서는 자연어 처리에서 GPT, BERT 같은 트랜스포머가 사실상 표준이 되었고, 이미지 분류에서도 ViT(Vision Transformer)가 ResNet을 대체하는 흐름을 보이고 있다. 하지만 이상하게도 이미지 생성 분야, 특히 diffusion 기반 모델에서는 해당 논문이 발표되기 전까진 convolutional U-Net이 널리 쓰이고 있다.1.2 diffusion에서 왜 아직도 U-Net인가?Stable Diffusion, DALL·E 2 같은 유명한 생성 모델들도 모두 noise를 점진적으로 제거하는 neural network로 U-Net을 사용한다. diffusion process에서 timestep마다 노이즈를 제거하는 ε_θ(x_t)을 예측할 ..

Latest posts

[MLLM] Gemma 3 테크니컬 리포트 리뷰
·
Multi-modal
https://arxiv.org/abs/2503.197861. IntroductionGemma 3는 Google DeepMind가 2025년 3월 공개한 경량 오픈 모델 시리즈에 멀티모달 비전 능력을 추가한 모델이다. Pan and Scan (P&S) 방법으로 유연한 이미지 해상도를 지원하며, Local/Global Attention 혼합 구조로 128K 토큰 컨텍스트를 효율적으로 처리한다.Google Gemma 시리즈는 오픈소스 경량 LLM으로 출발했다. Gemma 2까지는 텍스트 전용 모델이었지만, 실제 응용에서는 이미지와 텍스트를 함께 처리하는 능력이 필요하기에 MLLM으로 발전했다. 경량 model에 멀티모달 능력을 추가할 때의 주요 과제는 메모리 효율성이다. Vision encoder는 많은 t..
[MLLM] GLM-4.5V 테크니컬 리포트 리뷰
·
Multi-modal
https://arxiv.org/abs/2507.010061. IntroductionGLM-4.5V는 Zhipu AI와 Tsinghua University가 2025년 7월 1일 테크리포트에서 소개된 RLCS(Reinforcement Learning with Curriculum Sampling)를 포함한 스케일러블 멀티모달 RL 레시피를 기반으로, 2025년 8월 11일경 공개/배포된 VLM이다. GLM-4.5V는 GLM-4.5-Air 기반(MoE, 106B total / 12B active)이며, RLCS를 포함한 멀티모달 RL 스택(RLVR + RLHF, unified reward system, dynamic sampling expansion 등)을 통해 멀티모달 추론 능력을 강화한 모델이다. 기존 ..
[MLLM] InternVL3.5 테크니컬 리포트 리뷰
·
Multi-modal
https://arxiv.org/abs/2508.182651. IntroductionInternVL3.5는 OpenGVLab이 2025년 8월 공개한 효율성과 성능을 동시에 개선한 오픈소스 멀티모달 모델로, Qwen 시리즈 다음으로 자주 등장하는 모델이 아닐까 싶다. 기존 멀티모달 모델들은 성능 향상에 집중했지만, 추론 속도와 메모리 효율성은 상대적으로 소홀했다. InternVL3.5는 성능과 효율성을 동시에 개선하는 것이 실용적 배포에 필수적임을 보여준다. 특히 추론 속도 약 4배 향상은 실시간 응용에서 큰 차이를 만든다. 기존 InternVL3는 다양한 멀티모달 작업에서 좋은 성능을 보였지만, 추론 속도와 메모리 효율성 측면에서 개선이 필요했다. 특히 대규모 모델을 배포할 때는 단일 GPU의 메모리 ..
Qwen3-VL 테크니컬 리포트 리뷰 | VLM | MLLM
·
Multi-modal
1. Qwen3-VL 개요1.1 목표Qwen3-VL은 단순히 이미지를 입력으로 받을 수 있는 LLM이 아니다. 텍스트, 이미지, 비디오가 섞인 초장문 컨텍스트 환경에서 실제 추론과 문제 해결을 수행할 수 있는 멀티모달 파운데이션 모델을 목표로 한다. 리포트 전반에서 강조되는 핵심 목표는 다음과 같다.텍스트 성능을 희생하지 않는 VLM최대 256K 토큰의 네이티브 롱 컨텍스트 처리멀티모달 reasoning, 문서 이해, 차트 해석, 에이전트 시나리오 대응이는 Qwen2.5-VL이 주로 '이미지를 잘 이해하는 LLM'에 초점이 있었다면, Qwen3-VL은 복합 멀티모달 환경에서 실제로 일할 수 있는 모델로 확장되었다고 주장한다.1.2 모델 라인업과 스케일 전략Qwen3-VL은 Dense 모델과 MoE(Mix..
MoE(Mixture of Experts) 개념 설명: 거대 모델을 sparse 계산으로 확장
·
Large-scale Model
요즘 LLM에서 이야기하는 MoE(Mixture of Experts)는 sparse 라우팅 기반의 조건부 연산 구조를 의미한다. MoE는 고전적인 앙상블·모듈러 네트워크 계열과는 구분되는 개념이며, 실제로 대규모 언어 모델 스케일링 전략으로 정립된 시점은 비교적 최근이다.LLM에서의 MoE를 본격적으로 이해하기 위한 대표적 기준점은 다음 두 연구이다.Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer이 논문은 토큰마다 top-k expert만 활성화하는 sparsely-gated MoE 구조를 제안하며, 대규모 모델에서 계산 비용을 제어할 수 있음을 명확히 보여주었다. 오늘날 LLM MoE의 구조적 원형에 해당한다..
vLLM을 활용한 Large-scale AI 모델 가속화 | LLM Acceleration
·
Distributed Training & Inference
실험 코드와 상세 결과는 링크를 참고 - https://github.com/ldj7672/Vision-AI-Tutorials/tree/main/inference_acceleration Vision-AI-Tutorials/inference_acceleration at main · ldj7672/Vision-AI-TutorialsComputer Vision & AI를 쉽게 배우고 실습할 수 있는 예제 모음입니다. Contribute to ldj7672/Vision-AI-Tutorials development by creating an account on GitHub.github.com 1. 개요Large-scale AI 모델은 수십억 파라미터 규모의 Transformer 기반 구조를 공통적으로 사용하며, 추..