Getting the transcript
Reading the captions from YouTube. A video nobody has opened here before takes 10 to 30 seconds; this page fills in on its own.
Getting the transcript
Reading the captions from YouTube. A video nobody has opened here before takes 10 to 30 seconds; this page fills in on its own.

조피디 연구소 JoPD LAB · @jopdlab
Words
1,378
Runtime
14:39
Speaking pace
94wpm
Reading time
6min
94 words per minute, below the 160 25th percentile of 349 measured videos. That distribution comes from the 349-video hook study.
Opening (first 30 seconds)
안녕하세요 조 피디입니다 오늘 또 한번 놀라운 비디오 생성 모델이 출시되어 여러분에게 소개하려고 합니다 바로 Wan 2.2 모델입니다 저희는 wan 2.1 모델에서도 놀라운 성능을 체험해 보았습니다 이번에 출시한 2.2 모델은 현존하는 모든 오픈소스 비디오 생성 모델 중에서 단연코 최고라고 해도 과언이 아닙니다 wan 2.2 모델의 발표에서도 사용자들의
47 words, the words spoken in the first 30 seconds at 94 words per minute.
Free, no signup. See how the first 30 seconds hold attention, with rewrites.
Sentence shape
| Measure | This transcript |
|---|---|
| Sentences | 2 |
| Average words per sentence | 689.0 |
| Longest sentence | 748 words |
| Questions asked | 0 |
| Sentences containing a number | 2 |
Most used terms
What this transcript is
Every word below is the caption track YouTube publishes for this video, pulled from the video itself and reproduced unchanged. It is not Prepublish's writing, not a summary, and not a re-transcription: it is the video's own published captions. Korean captions, published by the channel, in the video’s original language. Source: the video on YouTube. A channel that would rather this page did not exist can ask for its removal through the contact page, and it is removed.
No Script X-ray for this video: YouTube shows a Most replayed graph only once a video has enough views.
안녕하세요 조 피디입니다 오늘 또 한번 놀라운 비디오 생성 모델이 출시되어 여러분에게 소개하려고 합니다 바로 Wan 2.2 모델입니다 저희는 wan 2.1 모델에서도 놀라운 성능을 체험해 보았습니다 이번에 출시한 2.2 모델은 현존하는 모든 오픈소스 비디오 생성 모델 중에서 단연코 최고라고 해도 과언이 아닙니다 wan 2.2 모델의 발표에서도 사용자들의 열광적인 호흥을 얻었지만 우리는 또 직접 확인해 보고 평가해야겠죠 wan 2.2 모델이 출시되자마자 ComfyUI에서도 발빠르게 업데이트를 통해 지원한다는 발표를 했습니다 이번 강의의 내용을 확인하려면 반드시 ComfyUI를 최신 버전으로 업데이트하고 진행하시기 바랍니다 그럼 먼저 wan 2.2 모델에서 어떤 점이 달라졌는지부터 확인해 보겠습니다 이번 모델에서는 MoE라는 아키텍처를 채택하였습니다 이 이름은 좀 생소할 수 있습니다 쉽게 설명하자면 하이노이즈와 로우노이즈로 구분하여 작업을 진행합니다 하이노이즈에서는 전반적인 레이아웃을 생성하고 로우노이즈에서는 디테일한 세부 사항을 다듬는다고 생각하시면 됩니다 이렇게 전반적인 레이아웃과 디테일한 작업을 구분하여 진행하기 때문에 더욱 고품질의 비디오를 생성할 수 있게 된 것입니다 그 외에도 영화와 같은 미적 표현 그리고 더 자연스러운 움직임 복잡하고 창의적인 장면 연출등이 있지만 이런 부분은 영상을 생성하면서 확인해 보면 될 것 같고 가장 큰 혁신은 하이 노이즈와 로우 노이즈로 나뉘어서 작업을 진행하는 방식인 것 같습니다 이 부분은 뒤에 워크 플로우에서 확인해 보겠습니다 그러면 이번에 출시한 모델의 종류부터 확인해 보겠습니다 먼저 5B 모델입니다 이 모델은 TI2V 모델입니다 기존에 우리는 텍스트로 비디오를 생성하는 모델은 T2V라고 하고 이미지를 통해서 비디오를 생성하는 모델을 I2V라고 불렀습니다 TI2V는 뭘까요 이 모델은 이 모델 하나로 T2V도 가능하고 I2V도 가능한 모델입니다 그리고 다음은 14B 모델입니다 이 모델은 T2V와 I2V로 나뉘어져 있습니다 모델을 다운로드할 수 있는 링크는 모두 설명란에 더 보기에 남겨두겠습니다 모델을 다운로드할 수 있는 허깅페이스에 접속합니다 모델 리스트에 보면 가장 아래에 5B TI2V 모델이 있습니다 용량은 10GB 입니다 그리고 14B 모델도 한번 보겠습니다 FP16 과 FP8로 나뉘는데 FP16 모델은 모두 28 기가 이상입니다 용량이 너무 커서 사용하기 힘들겠죠 FP8 모델은 14기가 정도 합니다 그리고 앞에서 설명했다시피 14B 모델은 하이노이즈와 로우노이즈 모델로 구분 되어 있습니다 모델을 받을 때는 하이노이즈와 로우노이즈 모델을 모두 받으셔야 합니다 저는 I2V FP8 하이 노이즈와 로우 노이즈를 받았고 T2V도 FP8 하이 노이즈와 로우 노이즈를 받았습니다 받은 모델은 전부 모델 폴더의 디퓨전 모델즈 폴더의 저장하였습니다 이제 ComfyUI를 실행하고 영상을 생성해 보겠습니다 워크 플로우는 따로 공유하지 않겠습니다 ComfyUI에서 공식적으로 워크 플로우를 제공해 줍니다 상단 메뉴에서 워크플로우를 클릭하고 브라우저 템플릿을 선택합니다 왼쪽 메뉴에서 비디오를 선택하면 14 빌리언 텍스트 투 비디오 14 빌리언의 이미지 투 비디오 그리고 5빌리언의 워크플로우가 있습니다 먼저 5빌리언의 워크플로우부터 보겠습니다 모델을 로딩하는 그룹입니다 wan 2.2 TI2V 5빌리언 모델을 선택하였습니다 텍스트 인코더 모델은 이전 버전에서 사용하던 umt 5 모델을 사용하였습니다 vae 모델도 wan 2.2 전용 모델을 선택하였습니다 여기에서 이전 버전의 모델을 사용해도 되지만 이번에 새롭게 출시된 버전이 압축률이 좋아서 용량이 더 작습니다 이 모델을 다운로드할 수 있는 주소 링크도 설명란에 더 보기에 남겨두었습니다 다음은 이미지 그룹인데 먼저 먼저 텍스트로 영상을 생성하기 위하여 이미지 노드는 바이패스 처리하였습니다 그리고 영상의 해상도는 1280 704로 설정되어 있습니다 랭스는 생성할 영상의 총 프레임 수량입니다 121 프레임의 영상을 생성할 예정입니다 다음은 프롬프트입니다 긍정 프롬프트에는 1970 년대 복고풍지하철 역 안에서 음악을 연주하고 낡은 제킷을 입고 기타를 연주한다고 입력하였습니다 그리고 출근하는 사람들이 서둘러 지나가고 일부 사람들이 모여 음악을 들으며 카메라는 천천히 오른쪽으로 움직이며 배경에는 오래된 지하철 표지판과 얼룩이 있는 벽이 보인다고 입력하였습니다 프럼프트에 입력된 내용을 보면 꽤 복잡하게 입력하였습니다 이번 모델은 이렇게 복잡한 프럼프트도 잘 이해하고 복잡한 화면 구성도 잘 표현해 준다고 합니다 부정 프럼프트에는 중국어로 된 키워드들이 입력되어 있는데 이 내용은 그대로 유지하고 진행하면 됩니다 그리고 모델에는 시프트 값이 8이 적용되었습니다 KSampler 노드를 보면 steps는 20으로 설정되어 있고 CFG는 5로 설정하였습니다 Sampler는 uni pc로 선택하였고 스케줄러는 scheduler는 simple로 선택하였습니다 영상을 저장하는 부분을 보면 크리에이트 비디오에서 fps를 24로 설정하였습니다 전 버전에서는 초당 프레임을 16으로 했었는데 이번 버전에서는 24로 합니다 생성되는 프레임의 총 수량은 121 프레임이고 초당 프레임이 24이기 때문에 약 5초짜리 영상이 생성됩니다 세이브 비디오 노드를 보면 파일 이름을 설정할 수 있고 포멧과 코덱을 선택할 수 있습니다 포멧은 현재 mp4 포멧 하나만 있고 코덱은 h264 하나만 있습니다 옵션이 하나밖에 없기 때문에 두 개 다 그냥 오토로 선택하면 됩니다 그럼 영상을 한번 생성해 보겠습니다 큐 버튼을 클릭합니다 영상이 생성되었습니다. 5 초짜리 영상이 생성되는데 약 9분 정도 소요되었습니다 생성된 영상을 확인해 보면 엄청 감탄이 나올 정도로 퀄리티가 좋은 영상은 아닙니다 배경의 일부 요소는 조금 뭉개지는 현상도 있습니다 하지만 전체적인 화면 구성과 일관성 유지면에서는 상당히 좋습니다 그리고 작은 화질 안에서 기타를 치는 손의 움직임도 정말 좋습니다 엄청 훌륭한 건 아니지만 나쁘지는 않은 것 같습니다 다음은 이미지 투 비디오 기능도 확인해 보겠습니다 참조 이미지는 이 이미지를 사용하겠습니다 워크 플로우에서 이미지 노드를 선택하고 컨트롤 삐를 눌러서 노드를 활성화합니다 이미지를 드래그하여 노드에 추가합니다 입력된 이미지는 영상의 시작 프레임이 됩니다 안녕 그리고 이미지 투 비디오를 생성할 때 프럼프트는 반드시 입력해야 하는 건 아닙니다 하지만 간혹 기괴한 연출을 보여 주는 경우가 있어서 짧게라도 입력하는 걸 권장합니다 저는 아름다운 여성이 기타를 치면서 노래를 부른다고 입력하였습니다 나머지 설정은 그대로 유지하고 생성하겠습니다 큐 버튼을 클릭합니다 영상이 생성되었습니다 한번 볼까요 이건 정말 좋은 것 같습니다 기타 치는 손가락에 움직임은 많이 움직이는데도 불구하고 자연스럽고 또 노래에 심취해서 부르는 것 같은 표정 연기도 정말 좋은 것 같습니다 그럼 이번에는 14빌리언 모델도 한번 볼까요 이 워크 플로우는 14 빌리언 텍스트 투 비디오 워크 플로우입니다 모델 부분부터 보겠습니다 앞에서 설명했다시피 14 빌리언 모델은 하이노이즈와 로우노이즈 모델 두 개를 동시에 사용합니다 첫 번째 모델은 하이노이즈로 선택하고 두 번째 모델은 로우노이즈로 선택해야 합니다 그리고 두 모델의 각각 시프트를 팔씩 적용합니다 그리고 이 워크 플로우에서 케이 샘플러도 두 개를 사용하여 두 번의 샘플링 과정을 거칩니다 첫 번째 케이 샘플러에서는 빠르게 전체적인 구도를 생성하고 두 번째 케이샘플러에서 디테일한 부분을 이어서 생성해 줍니다 여기에서 사용하는 케이 샘플러는 어드벤스드 케이 샘플러입니다 어드벤스를 사용하는 이유는 스타트와 앤드 스텝 옵션 때문입니다 두 개의 케이 샘플러를 위치를 좀 옮겨서 같이 보겠습니다 영상을 생성하는 과정에서 우리는 총 20 스텝을 사용합니다 첫 번째 케이 샘플러에서 전체 스텝 중에서 10 스텝을 진행하게끔 앤드 스텝을 10까지 설정하였습니다 두 번째 케이 샘플러에서는 스타트 스텝을 10으로 설정하여 첫 번째 케이샘플러에서 진행한 위치부터 이어서 영상을 생성합니다 그리고 첫 번째 케이 샘플러에서 add noise와 return with leftover noise 옵션은 모두 enable로 설정하였고 두 번째 케이 샘플러에서는 두 개 옵션을 모두 disable로 설정하여 비활성화하였습니다 add noise는 입력된 레이턴트 이미지에 노이즈를 추가하는 역할을 하고 return with leftover noise는 생성된 레이턴트 이미지에서 노이즈를 유지한 상태로 출력할지 여부를 결정하는 옵션입니다 즉 첫 번째 케이샘플러에서는 입력된 레이턴트 이미지에 노이즈를 추가하고 10 스텝까지 진행한 다음 출력되는 이미지에서는 노이즈를 완전히 제거하지 않고 유지한 상태로 출력합니다 두 번째 케이샘플러에서는 입력받은 레이턴드 이미지에 노이즈를 추가하지 않고 10 스텝부터 이어서 진행하고 출력할 때는 노이즈를 전부 제거하여 출력해 줍니다 그리고 14빌리언 모델은 용량이 크기 때문에 사이즈를 조금 작게 설정하였습니다 해상도는 832 480으로 설정하였습니다 랭스도 81로 작게 입력하였습니다 프럼프트에는 비가 내리고 미소를 짓는 젊은 여성을 클로즈업하고 얼굴과 속눈썹에 빗방울이 반짝인다고 입력하였습니다 그럼 한번 생성해 볼까요 큐 버튼을 클릭합니다 케이 샘플러 두 개가 순서대로 이어서 샘플링을 진행하는 것을 볼 수 있습니다 영상이 생성되었습니다 생성된 영상을 확인해 보면 정말 퀄리티 좋은 자연스러운 영상이 생성되었습니다 비 오는 배경과 빗속에서 미소를 짓고 있는 인물이 정말 잘 표현 되었고 빗방울이 얼굴에 맺혔다가 떨어지는 표현도 정말 좋은 것 같습니다 너무 좋습니다 이번에는 14빌리언 이미지 투 비디오 워크 플로우를 확인해 보겠습니다 이 워크 플로우에서 모든 노드 구성은 동일하고 이미지 노드만 추가되었습니다 참조 이미지는 이 화이트 드래곤 워리어 이미지를 사용하겠습니다 모델은 14 빌리언 아이 투 브이 하이 노이즈와 로우 노이즈 모델을 사용하겠습니다 프럼프트에는 화이트 드래곤 워리어가 가만히 서 있고 카메라가 전사에게 천천히 다가가거나 주위를 맴돈다고 입력하였습니다 이번에는 카메라 무빙을 잘 표현하는지 한번 보겠습니다 영상의 해상도는 이번에도 작게 832 480으로 입력하였습니다 랭스도 81로 입력하였습니다 큐 버튼을 클릭하여 영상을 생성합니다 영상이 생성되었습니다 와우 너무 멋있습니다 화이트 드래곤 워리어도 너무 멋있게 표현 되었고 카메라 무빙도 워리어를 돋보일 수 있게 잘 연출된 것 같습니다 영화의 한 장면 같습니다 너무 좋습니다 5빌리언 모델은 약간 아쉽지만 14 빌리언 모델은 정말 만족스럽습니다 하지만 14 빌리언 모델은 용량이 너무 커서 영상을 생성하는데도 오래 걸리고 또 브이램이 부족하여 정상적으로 작동하지 않는 경우도 있을 겁니다 그래서 추가적으로 GGUF 모델도 함께 소개하겠습니다 GGUF 모델을 다운로드할 수 있는 주소도 설명란에 더 보기에 남겨두었습니다 주소로 접속하면 하이노이즈와 로우노이즈 모델 리스트가 있습니다 리스트에서 본인의 컴퓨터 사용에 맞는 모델을 다운로드하면 됩니다 5 기가부터 15기가까지 다양한 용량을 제공합니다 다운로드한 모델은 모델즈 폴더에 유넷 폴더에 저장하면 됩니다 워크 플로우는 리스트의 가장 아래에 있는 이그잼플 png 이미지를 다운로드한 다음 comfyUI 화면에 드래그하여 가져오면 됩니다 GGUF 노드 두 개에서 각각 하이 노이즈와 로우 노이즈 모델을 선택하여 사용하면 됩니다 지지유에프 모델을 사용하면 컴퓨터 사양이 조금 부족한 환경에서도 사용할 수 있어서 좋습니다 이 영상은 GGUF Q5 모델을 이용하여 생성한 영상입니다 용량은 조금 작지만 퀄리티는 큰 차이가 없습니다 GGUF 모델도 정말 좋습니다 컴퓨터 사양이 부족하신 분들도 한 번씩 사용해 보시기 바랍니다 이번 시간에는 wan 2.2 모델이 새로 출시되어 사용하는 방법에 대해서 알아보았습니다 여러분도 직접 테스트해 보고 성능을 평가해 보세요 오늘의 영상이 유익하였으면 좋아요 눌러서 응원해 주세요 그럼 다음 시간에 또 만나요
The words are the caption track's own and nothing is reworded or re-transcribed. Paragraph breaks are placed between sentences so the text reads as prose.
Free tools for your own script. No signup, no login.
Paste your draft and see where viewers are likely to drop off, with a rewrite for each weak line.
Paste the first 30 seconds of your own draft for a hook score and rewrites.
Check your draft against YouTube's advertiser-friendly guidelines before you record it.
Read this channel's public videos and transcripts, and download a writing brief for it.