전체 글(61)
-
클로드코드 터미널 설치 기초 1
1) 네이티브 설치 (권장)macOS / Linux / WSL: bashcurl -fsSL https://claude.ai/install.sh | bashWindows PowerShell: powershellirm https://claude.ai/install.ps1 | iex2) npm으로 설치 (Node.js 18+ 필요) bashnpm install -g @anthropic-ai/claude-code※ sudo npm install -g 는 권한 문제를 일으키니 쓰지 마세요.3) 실행 & 로그인 bashcd 프로젝트폴더claude처음 실행하면 브라우저가 열리고 Claude 구독 계정 또는 Console API 키로 로그인합니다. 나중에 계정을 바꾸려면 세션 안에서 /login.4) 설치 확인 / 업..
2026.08.25 -
held-out validation 없이, 과거의 지연 라벨·검증기 피드백을 이용하는 prequential 정지 관련 연구
2. 관련 연구2.1 테스트타임 컴퓨트의 한계 수익추론 길이를 늘리면 성능이 오른다는 전제는 최근 정면으로 검토되기 시작했다. Zhou 등은 추가 추론 토큰의 한계효용이 예산 증가에 따라 어떻게 변하는지를 체계적으로 조사해, 높은 예산에서 한계 수익이 크게 감소하며, 확장된 추론이 이미 도달했던 정답을 버리는 "과잉사고" 현상과 연관됨을 보고했다. 또한 최적 사고 길이가 문제 난이도에 따라 달라져 균일한 연산 배분이 준최적임을 지적했다. 유사한 현상은 병렬 탐색 축에서도 관찰되어, 넓은 빔 탐색이 노이즈 있는 채점기 위에서 후보 풀 크기에 비례해 커지는 체계적 과대추정 편향을 유발한다는 분석이 제시되었다. arxiv이들 연구는 곡선의 형태를 사후적으로 특징짓는다. 라벨된 코퍼스 전체를 관측한 뒤 어느 예..
2026.08.02 -
Kolmogorov–Arnold Transformer (Review)
연구 배경 및 동기 기존 트랜스포머의 한계: 현대의 트랜스포머 모델(ViT 등)은 Attention 메커니즘과 MLP(Multi-Layer Perceptron) 레이어로 구성됩니다. 하지만 MLP는 선형 레이어와 단순 비선형 활성화 함수(ReLU 등)의 조합이어서, 주기 함수나 고주파 성분을 학습하는 데 시간이 오래 걸리고 복잡한 함수를 근사하는 데 구조적 한계가 있습니다. KAN의 등장과 실패: 최근 대안으로 등장한 KAN(콜모고로프-아놀드 네트워크)은 고정된 활성화 함수 대신 가중치마다 '학습 가능한 1차원 함수(B-Spline 등)'를 배치하여 이론적으로 매우 뛰어난 파라미터 효율성과 표현력을 보여주었습니다. 하지만 이를 트랜스포머에 그대로 적용(ViT+KAN)했을 때는 심각한 성능 저하와 학습 ..
2026.07.23 -
On the Benefits of Learning to Route in Mixture-of-Experts Models 리뷰
1. 논문의 배경 및 주제배경 (Introduction): 최근 트랜스포머(Transformer) 기반 모델들이 커지면서 성능은 좋아지지만 계산 비용이 너무 비싸지고 있습니다. 이를 해결하기 위해 '조건부 연산(Conditional Compute)' 구조가 등장했습니다. 이는 모든 데이터를 처리할 때 전체 네트워크를 다 쓰는 게 아니라, 일부만 활성화해서 쓰는 방식입니다. 대표적인 예가 MoE (Mixture-of-Experts) 모델입니다.MoE의 핵심 구조: MoE는 여러 개의 '전문가(Experts)' 네트워크와 입력 데이터를 어떤 전문가에게 보낼지 결정하는 **'라우터(Router)'**로 구성됩니다. 2. 연구의 목적 (Abstract)기존 연구들은 MoE가 계산 비용을 늘리지 않고도 모델 크기..
2025.12.15 -
old start 방식의 감독 학습(supervised fine-tuning)ChatGPT
"Old start 방식의 감독 학습(supervised fine-tuning)"은 자연어 처리, 특히 언어 모델(Language Model)*이나 대형 사전 학습 모델(LLM)의 미세조정(fine-tuning) 맥락에서 등장하는 개념입니다. 이 용어는 일반적으로 특정 전략이나 초기화 방식과 관련되며, 최신 방법들과 대비해 초기부터 전통적인 방식으로 미세조정하는 전략을 의미합니다. Old Start 방식의 정의Old start 방식은 다음과 같은 특징을 가집니다:모델의 전(pre-trained) 파라미터를 그대로 유지하고, 초기부터 전체 네트워크 또는 하위 모듈 전체를 동시에 미세조정함학습 초기부터 라벨 데이터를 직접 사용한 감독 학습(Supervised Fine-Tuning; SFT)을 적용초기에는 모..
2025.06.08 -
논문 리뷰: GenCRF: Generative Clustering and Reformulation Framework forEnhanced Intent-Driven Information Retrieval
이 논문 (Abstract)은 LLM 기반 쿼리 재작성(Query Reformulation) 분야의 한계를 극복하고자 제안된GenCRF (Generative Clustering and Reformulation Framework)를 소개하고 있습니다https://arxiv.org/pdf/2409.10909핵심 배경Query Reformulation: 정보 검색(IR)에서 사용자의 원래 쿼리를 자동으로 수정하여 검색 정확도를 높이는 방법.LLM 기반 최신 기법: 최근에는 대형 언어 모델을 활용해 쿼리를 확장하지만, 여전히 중복된 표현이나 의도 다양성 부족 문제가 있음.제안 기법: GenCRFGenCRF의 주요 구성요소는 다음과 같음:LLM 기반 다변화 쿼리 생성:사용자 원 쿼리로부터 다양한 방식으로 prom..
2025.06.08