Latent Space

잠재 공간 : 딥러닝 모델이 원본 데이터의 핵심 특징만 압축하여 저차원으로 표현한 추상적인 공간

전체 글 160

Gemma 4와 양자화모델

https://ai.google.dev/gemma/docs/core/model_card_4?hl=koGemma 4 모델을 vLLM(버전 0.7 이상 권장)에 연결합니다. Gemma 4는 256K의 긴 컨텍스트 창과 멀티모달 기능을 지원하므로, 실행 시 관련 설정을 확인하는 것이 중요합니다. vLLM에 연결하기export HUGGING_FACE_HUB_TOKEN="your_token_here"python -m vllm.entrypoints.openai.api_server \ --model noctrex/gemma-4-26B-A4B-it-MXFP4_MOE-GGUF \ --tokenizer google/gemma-4-26B-A4B-it \ --trust-remote-code# 모델 파일 다운..

LLM 2026.04.07

Denoising Diffusion Probabilistic Models

https://www.youtube.com/watch?v=1j0W_lu55nc 최근 스테이블 디퓨전(Stable Diffusion)과 같은 이미지 생성 AI가 보여주는 퍼포먼스는 경이로움 그 자체입니다. 아무 의미 없는 노이즈 섞인 화면에서 서서히 형체가 잡히더니, 마치 사진작가가 찍은 듯한 고화질 이미지가 나타나는 과정은 마치 마법처럼 느껴지죠. 하지만 과학의 눈으로 보면 이는 우주의 근본 원리인 '엔트로피 증가의 법칙'을 정면으로 거스르는 거대한 역전극입니다.이 모든 열풍의 시초에는 2020년 발표된 DDPM(Denoising Diffusion Probabilistic Models) 논문이 자리 잡고 있습니다. 2015년 처음 제안된 '확산(Diffusion)'이라는 초기 개념이 어떻게 실질적인 생..

멀티모달 2026.04.07

LoRA: Low-Rank Adaptation

현대 AI 개발의 패러다임은 거대언어모델(LLM)을 특정 도메인에 최적화하는 '파인튜닝(Fine-Tuning)'을 중심으로 재편되었습니다. 하지만 모델의 체급이 커질수록 엔지니어가 마주하는 현실적인 벽은 가혹합니다. 1,750억 개의 파라미터를 가진 GPT-3를 예로 들어보겠습니다. 이 모델을 전체 파인튜닝(Full Fine-Tuning)하려면 350GB 이상의 체크포인트 저장 공간은 물론, 천문학적인 GPU 연산 자원이 필요합니다.많은 개발자에게 이는 '불가능한 미션'처럼 보였습니다. 인프라의 한계로 인해 거대 모델이라는 '거인의 어깨'에 올라타는 것조차 허락되지 않았던 것이죠. 하지만 여기, 모델의 핵심 가중치는 고정하면서도 0.01% 수준의 파라미터만으로 거대 모델을 길들일 수 있는 기술적 돌파구가..

멀티모달 2026.04.06

VAE(Variational Auto-Encoder)

인간의 눈으로 보기에 아주 살짝 옆으로 이동한(Shift) 이미지는 원본과 거의 똑같아 보입니다. 하지만 컴퓨터에게 단순한 픽셀 단위의 오차(MSE)를 계산하게 하면, 두 이미지는 완전히 다른 데이터로 인식됩니다. 반면 일부분이 잘려 나간 이미지는 컴퓨터 입장에서 오차가 적을 수 있지만, 인간에게는 명백히 손상된 데이터죠. 이 차이는 무엇을 의미할까요? 바로 인간은 데이터의 '표면'이 아닌 '본질적인 패턴'을 본다는 것입니다.단순한 복사를 넘어 세상에 없는 고양이를 그려내고, 데이터의 숨은 의미를 포착하는 생성형 AI의 '상상력'. 그 중심에는 VAE(Variational Autoencoder)가 있습니다. VAE는 데이터를 단순히 압축하는 도구가 아니라, 데이터가 생성되는 확률적인 원리를 학습하여 AI..

멀티모달 2026.04.06

Attention

우리가 일상에서 사용하는 언어는 사실 고도의 '눈치 게임'입니다. 예를 들어 'mole'이라는 단어를 들었을 때, 여러분은 무엇을 떠올리시나요? 누군가는 땅속의 '두더지'를, 누군가는 화학 시간의 '분자 단위'를, 또 누군가는 피부에 난 '점'을 떠올릴 겁니다. 우리는 주변 단어들을 통해 이 모호함을 순식간에 해결하지만, 컴퓨터에게 이 '문맥(Context)'을 가르치는 것은 오랜 난제였습니다.2017년 등장한 '트랜스포머(Transformer)' 모델은 이 문제를 혁신적으로 해결하며 현대 AI의 심장이 되었습니다. 그 비결은 바로 어텐션(Attention) 메커니즘에 있습니다. 2. 고정된 의미는 없다: 임베딩 공간 속의 '이동'AI가 처음 단어를 받아들이면, 이를 고차원 공간상의 점인 '임베딩(Emb..

멀티모달 2026.04.06

Stable Diffusion

1. 도입부: 이미지 생성의 새로운 패러다임스테이블 디퓨전(Stable Diffusion)과 같은 이미지 생성 AI를 사용해 본 분들이라면 한 번쯤 이런 갈증을 느껴보셨을 겁니다. "내가 찍은 사진의 구도는 그대로 두고, 스타일만 살짝 바꾸고 싶은데 왜 이렇게 어렵지?" 특정 이미지를 정밀하게 수정하기 위해 모델을 새로 학습시키거나 복잡한 파인튜닝(Fine-tuning)을 거쳐야 했던 번거로움은 개발자와 창작자 모두에게 큰 장벽이었습니다.하지만 이제는 '학습 없이(Training-free)' 모델 내부의 피처 맵(Feature Map)을 활용하여 이미지를 편집하는 혁신적인 시대가 열리고 있습니다. 인공지능이 이미지를 이해하는 메커니즘을 역이용해, 추가 비용 없이도 리얼 이미지를 자유자재로 변형하는 기술의..

멀티모달 2026.04.06

ComfyUI+n8n연동

https://dev.to/worldlinetech/automating-image-generation-with-n8n-and-comfyui-521p 사용자가 원하는 이미지를 설명하면 AI Agent가 Prompt를 생성하여 ComfyUI에 입력하고 이미지를 생성하는 Workflow만들기 n8n > setting > Community nodes Browse에서 'comfyui'검색 > ' n8n-nodes-comfyui' 복사 > install run_nvidia_gpu.bat 파일 편집 > --listen추가 > 실행 ComfyUI account 생성 > URL추가ComfyUI에서 만든 Workflow를 JSON으로 변환 > Ctrl+C > n8n Workflow JSON에 Ctrl+VPrompt tex..

멀티모달 2026.04.05